ReasonIF基准揭示大型推理模型在推理中指令遵循失败率高
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
Together AI 的研究显示,语音识别系统在识别不同语言背景说话者所说的街道名称时,平均转录错误率达 39%,非英语母语者的准确率比英语母语者低 18%。他们提出了名为“跨语言风格迁移”的合成数据生成技术,用不到 1000 个训练样本将错误率相对降低 60%。该研究还引入了 SF Streets 和 US Streets 两个新基准,并估计仅旧金山出租
Together AI 发布了一项针对编码代理工作负载的大规模推理基准测试,结果显示其推理引擎在相同硬件上比最快的开源引擎吞吐量高 31%,且在饱和状态下 TTFT 快 2 倍。该基准测试模拟了长上下文、高并发的生产环境,并强调了 TTFT 和预填充压力等关键指标。性能提升源于全栈优化,包括 ThunderMLA 内核融合和自定义内核重写。
Together AI 发布了 ParallelKernelBench(PKB),一个用于评估多 GPU 内核生成的基准测试框架,包含 87 个来自真实代码库的问题,要求模型将 PyTorch + NCCL 实现替换为直接通过 NVLink 通信的 CUDA 内核。测试前沿模型如 GPT-5.5、Gemini 3 Pro 和 Opus 4.7 后发现,正确率
Together AI 发布了对 Kimi K3 与 Claude Fable 5 在 DeepSWE 基准上的对比分析。结果显示,Kimi K3 在 pass@1 上以 68.5% 略低于 Fable 的 69.9%,但在 pass@2 和 pass@4 上反超,且每次运行成本仅为 4.65 美元,远低于 Fable 的 13.41 美元,每美元解决任务数
xAI 发布了其首个多模态模型 Grok-1.5V,能够处理文档、图表、截图和照片等多种视觉信息。该模型在多个基准测试中表现优异,特别是在新的 RealWorldQA 基准上超越了 GPT-4V 和 Claude 3 等竞品。xAI 还开源了 RealWorldQA 数据集,包含 700 多张图像,旨在评估模型对真实世界的空间理解能力。
xAI 发布了 Grok-2 和 Grok-2 mini 的测试版,在聊天、编码和推理方面性能显著提升,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 和 GPT-4-Turbo。这两个模型已在 X 平台上向 Premium 用户开放,并计划于本月晚些时候通过企业 API 提供给开发者。Grok-2 在视觉任务上表现出色,并与 Black
Together AI 博客介绍了 DSGym,一个用于评估和训练数据科学智能体的统一框架,它整合了现有基准并新增了生物信息学和 Kaggle 竞赛任务。通过 DSGym 生成的数据,研究者训练了一个 4B 模型,在开源模型中达到最先进性能。该框架还解决了基准测试中的记忆化问题,并揭示了模型在端到端机器学习流程中的失败模式。
Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,这是首个达到 2.8 万亿参数的开源模型,采用 MoE 架构和 MXFP4 量化,支持 100 万 token 上下文及原生视觉。模型在多个基准测试中表现优异,尤其在编码任务上领先。开源权重计划于 7 月 27 日发布,将推动社区研究和部署。
DeepSeek 发布 DeepSeek-V4-Flash 正式版 API,模型结构不变,仅重新后训练,在多个基准测试中表现优异。API 调用方式不变,模型名设为 deepseek-v4-flash。DeepSeek-V4-Pro 正式版将尽快发布。
另有 1 家信源报道
Hugging Face 发布了 Real World VoiceEQ 基准,用于评估语音 AI 的人类质量,涵盖 40 多个模型和 60 多项指标,基于超过 100 万条人工评分。该基准发现语音模型在情感、口音和噪声等真实场景中表现不佳,且没有单一模型在所有能力上领先。研究还表明,语音语言模型(SLM)在主观评估中不能替代人类评分者。
Langfuse 发布 v4.1.0 版本,包含多项新功能和修复。新功能包括在 PR 描述中固定预览 URL、增强实验表单验证、扩展应用内代理的后台执行、显示已弃用 API 的最后使用时间、在复制提示时自动生成 API 密钥等。修复涉及助手工具调用副作用、仪表板组件版本、评估器 JSONPath 验证、ClickHouse 评分过滤优化、非流式 LLM 请求
Import AI 466 报道了 Epoch 和 METR 发布的 MirrorCode 基准测试,用于评估 AI 系统完成长期编程任务的能力,结果显示 Opus 4.7 等模型能在 14 小时内完成人类需 2-17 周的任务,但仍有部分任务无法解决。同时,Anthropic 展示了 Claude Opus 4.7 在机器人任务中自主完成速度比人类快 20
Anthropic 于周五发布了 Claude Opus 5 模型,官方基准显示其性能接近 Fable 5,但独立评估认为其实际表现更优。Epoch 的 ECI 指数显示 Opus 5 得分为 159,略低于 Fable 5 的 161,但在软件工程基准上持平。社区反馈强调其在编码和浏览器自动化等实际任务中的出色表现,同时也有对基准测试有效性的质疑。
在 Interconnects 播客中,Nathan Lambert 和 Florian Brand 讨论了开放模型的近期进展,包括 Kimi K3 的发布、Qwen 3.8 的开放权重计划、中国领导人的开源承诺,以及中美模型差距和蒸馏技术的争议。他们指出,开放模型在特定任务上可能接近前沿,但后训练和微调仍面临挑战。
Agno 发布 v2.8.0 版本,新增 agno.scorer 模块(包含 CodeScorer、JudgeScorer、ToolCallScorer)和 agno.environments 环境模拟工具,支持 pass@k 评估和 SFT 数据导出。同时修复了 RemoteAgent/RemoteTeam 的元数据丢失等问题,并引入破坏性变更:Relia
Import AI 464期报道了Fable模型在KernelBench-Mega基准上编写GPU内核,实现18.71倍加速,创下最快megakernel记录,显示AI在自动化AI研发任务上的进步。同时,CAIS和Scale Labs的Remote Labor Index显示AI系统在在线自由职业任务上的成功率从2.5%升至16.1%,表明AI对经济就业的潜
OpenCompass 发布 v0.5.3 版本,新增了 AIME2026、HMMT Feb 2026、SimpleQA-Verified 等多个基准测试和数据集支持,并引入 RawPromptTemplate 以增强提示模板的灵活性。同时,该版本新增了对 OpenAI Responses API、Gemini SDK API 和 Claude SDK 思考
Eugene Yan 撰文探讨了构建网络安全评估(cybersecurity evals)的模式,介绍了评估模型漏洞利用能力的通用框架,包括沙箱目标、难度输入、工具和评分器。文章重点分析了 Cybench 等基准测试的设计与结果,指出当前模型在复杂任务上表现有限,如 Claude 3.5 Sonnet 在无引导模式下成功率仅 17.5%。
Google DeepMind 发布了 AI co-clinician 项目,这是一种用于临床环境的 AI 系统,采用双智能体架构(Planner 和 Talker)以确保安全边界,并优先进行临床级证据的验证和引用检查。目前正与美国、印度、澳大利亚等地的学术和医疗机构合作进行分阶段评估,但现阶段不用于疾病诊断或治疗。