古兰经背诵转录中的背诵事件标注:什么算错误?
该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非
该论文对 Praxa AI 的 agent 评估管线进行回溯性测量审计,发现多项指标在数值正确的情况下测量了与标签不符的构念:139 例离线路由报告有 112 通过、27 失败,但门控失败为零,因为已知缺口被显式豁免;8,843 条工具尝试记录中 448 条时长缺失,且 121 条时长等于 32 位有符号整数最大值并带有被放弃客户端标签;单轨迹压缩试点报告的
该论文提出一种「读取时记忆替换」方法,用于区分视频模型的记忆收益与记忆特异性。在冻结的视频世界模型中,无身份信息的控制记忆在 Ego-Exo4D 和 7-Scenes 上几乎恢复了全部收益,TUM 上约恢复部分,支持「表征修复」解释;WorldMem 表现出分级的内容依赖,SAM 2 则表现出强内容依赖,在 DAVIS 和 MOSEv2 上替换正确空间记忆会
微软与卡内基梅隆大学的研究者对两种企业级工作流基准(TheAgentCompany 和 APEX-Agents)进行了受控工具接口消融实验,比较了五种接口:纯类型化工具、类型化工具加 bash、纯 bash、带持久化合成工具的 bash,以及程序化工具调用(PTC)。使用 Opus-4.8 和 GPT-5.5 测试发现,纯 bash 在两个基准上均优于纯类型
一篇 arXiv 综述论文系统梳理了大语言模型驱动软件工程中的测试驱动方法,围绕「测试改变了什么决策」这一核心问题,整合了 87 条研究记录(其中 83 条做了方法或协议级提取)及 5 项实践资源。论文区分了 Red–Green–Refactor 循环与测试条件生成、执行引导精炼、测试中介分析和仅评估测试等不同机制,并跨代码生成、修复、翻译、重构、克隆检测、
该研究通过配对同模型对比,在256个私有防污染任务上测试了厂商原生harness与中立harness(deepagents)对智能体编码能力的影响。结果显示,Opus 4.8和GPT-5.5上两种harness的解决率差异均不显著(分别约1.25个百分点),但Opus在仓库任务上原生harness落后9.0个百分点、在竞赛任务上领先23.7个百分点,呈现任务
中国公司深度机智于2026年9月9日发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5综合均分,位居开源模型首位,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距收窄至1分以内。该模型围绕其提出的Physical Loop物理智能循环架构,将具身理解、动作生成与未来状态预测统一在同一训练框架中,并
Andon Labs 用 Vending-Bench 和 Drone-Bench 两个智能体基准测试 OpenAI 的 GPT-6 Astra。在模拟自动售货机经营中,Astra 六次运行平均结余 15,515 美元,约为 Claude Fable 5.1(5,422 美元)的三倍,并首次登顶 Vending-Bench 2 排行榜。在 Drone-Benc
OpenAI 的 GPT-6 Astra 在一个名为 StationeryBench 的新机器人基准测试中展现出空间推理能力的显著提升。该测试让 Astra 与 Ai2 的 MolmoAct2 在相同双臂 YAM 机器人上完成五类桌面物体任务,共 200 次试验。Astra 完整完成 7/100 任务,MolmoAct2 为零;Astra 中位进度分 46,
韩国KAIST与Naver AI Lab的一项新研究发现,语言模型文本输出中的推理步骤在模型内部数值表示中也能被区分开来,且信号在中间层最强。研究团队定义了八种推理操作,用Qwen2.5-7B、Qwen3-8B和Gemma4-31B求解数学题,并用GPT-5标注各步骤。结果表明,内部状态携带的推理步骤类型信息超越了表面用词,且推理步骤依赖前文语境而非孤立形成
2026 Inclusion·外滩大会举办“Agent Post-Training:智能本质与下一个 Scaling Law”见解论坛,CAMEL AI、蚂蚁百灵、英伟达、美团LongCat、新加坡国立大学、清华大学、上海交通大学、KAUST等机构研究者围绕智能体后训练展开分享。议题覆盖多智能体扩展与环境构建、真实专业任务中的可信执行、轻量化强化学习框架Mo
OpenAI的GPT-6 Astra攻破了FrontierMath Tier 4中此前唯一未被AI解出的题目,Epoch AI据此宣布Tier 4已饱和。该测试2025年7月推出时最高成绩仅约5%,Astra公布成绩达97.6%。Epoch同时将评测推进到真正的开放问题及Lean形式化的FrontierMath Erdős,Astra在后者68道题中仅解出2
9月11日,蚂蚁灵波科技在2026外滩大会举办具身智能论坛,围绕通用大脑、数据飞轮与场景落地三场圆桌展开讨论。蚂蚁灵波首席科学家沈宇军提出通用大脑需具备表征提取、多模态融合与动作生成能力,并以部署成本和长期稳定运行作为模型进步尺度;首席数据科学家黄用韬指出数据飞轮未转起来的关键是真实场景机器人太少。蚂蚁灵波CEO朱兴认为难点已从'一'转向'多',公司聚焦通用
陶哲轩、邓煜等25位菲尔兹奖得主联合发布紧急声明,指出AI公司以benchmark为导向推进数学研究的方式与数学共同体目标出现严重错位。声明核心担忧包括AI解题速度超过数学界消化知识的速度、商业评价体系与学术评价体系分叉、以及数学研究优先权和人才培养规则需重新制定。导火索是OpenAI用1万个Agent运行88小时宣称解决Navier-Stokes问题,引发
另有 1 家信源报道
该研究对扩散模型微调中的LoRA秩选择进行了受控实验,在CIFAR-10上使用DDPM U-Net,固定优化设置,比较不同秩下的FID、可训练参数量、运行时间和GPU内存。结果显示中等秩(rank 4和8)在固定训练预算下效率最高,更高秩带来的质量提升有限。研究还用20轮DDPM和Tiny DiT骨干验证了趋势的稳健性,为实践者提供了小到中等秩作为默认选择的
该论文提出一个多阶段规则链式框架,用于在ARC-AGI-2基准上进行组合式与可解释的认知推理。框架整合三个互补求解器:确定性规则发现、模式组合引擎和结构抽象层,按渐进回退层级顺序运行并复用先前推理轨迹。在1000个任务中通过995个训练任务,并在240个ARC-AGI-2测试任务中解决230个,整体准确率超过95%。
研究者提出一个端到端多智能体框架,可从自然语言问题描述自动生成 QUBO(二次无约束二值优化)公式,并支持结构化或非结构化测试用例。团队同时发布 QUBOBench 基准,涵盖 12 个应用领域的 100 个组合优化问题。实验显示该框架在 QUBOBench 上达到 68% 准确率,比直接单次调用基线(46%)高出 22 个百分点,其中迭代自修复被识别为提升
Hugging Face 用户 nerkyor 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-EfficientThink-Uncensored,采用 SFT 和 SimPO 训练,并集成 DFlash2 推测解码。该模型提供 GGUF 多级量化(Q2 至 Q8)及 NVFP4 量化版本,附带 GPQA、MMLU、LCB 基准测试分
AWS Machine Learning Blog 发布一篇技术文章,介绍一个开源基准测试工具 openai-on-aws/benchmarks-openai,用于在 Amazon Bedrock 上对比 OpenAI 模型(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)与 OpenAI API 上两个高性价比模型(gpt-5
网商银行在2026外滩大会首次披露AI银行落地进展,推出面向4200万小微商家的普惠金融Agent「百灵2.0」,用户仅需在聊天框提出需求即可获得个性化信贷方案,复杂需求办理时间从3天缩短至10分钟。后台方面,网商银行建成八大AI工作台,其中千里眼、定海针、宝莲灯、筋斗云分别覆盖风控、人审、营销响应和研发提效,并披露Harness工程、评测、知识库、人机共生