ReasonIF基准揭示大型推理模型在推理中指令遵循失败率高
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。
Mistral AI 发布了 Mathstral,这是一个专为数学和 STEM 领域设计的新模型,基于 Mistral 7B 构建,在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%。该模型旨在支持学术研究,与 Project Numina 合作开发,并可通过 HuggingFace 获取。Mathstral 在推理时增加计算量可显著提
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
OpenAI 使用其下一代模型 Astra 的内部版本,在不到 2000 美元(按 GPT-5.6 Sol 代币价格计算)的成本下,解决了十个至少十年未获进展的数学问题。OpenAI 公开了 Lean 4 形式化证明、论文及 LLM 生成的证明重建 PDF,但未透露具体提示词。数学家对此反应不一,有人将其与 Deep Blue 事件类比,数学家 Kirwin
Mistral AI 发布了 Mistral Small 4,这是其 Small 系列的新旗舰模型,首次统一了推理、多模态和智能体编码能力,支持文本和图像输入,并采用 Apache 2.0 开源许可。该模型基于 MoE 架构,总参数 119B,激活参数 6B,上下文窗口 256k,性能相比 Small 3 提升显著,推理延迟降低 40%,吞吐量提升 3 倍。
本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。
Anthropic 于 2026 年 6 月 30 日发布了 Claude Sonnet 5 模型,这是其最具代理能力的 Sonnet 系列模型,在推理、工具使用、编码和知识工作方面相较 Sonnet 4.6 有显著改进。该模型旨在提升自动化任务执行能力,相关细节已通过官方博客公布。
Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202
作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。
Anthropic 发布了 Claude Opus 4.8,相比 4.7 在编码、智能体技能、推理和实际知识工作方面有所改进。同时,企业版计划新增了连接器权限管理功能,允许管理员通过自定义角色控制连接器及其工具的访问权限。
Berkeley AI Research Blog 发表文章,探讨自适应并行推理作为高效推理扩展的新范式。文章指出,现有并行推理方法(如自一致性、树搜索等)的并行结构由外部决定,而自适应方法让模型自主决定何时分解任务、并行线程数及协调方式。文章分析了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,并强调不同问
Google DeepMind 发布了 Gemma 4 系列开放模型,包括 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,支持高级推理、智能体工作流、多模态(视觉、音频)和 140 多种语言,采用 Apache 2.0 许可。该系列模型在 Arena AI 文本排行榜上表现优异,31B 模型排名第三,26B 模型排名第六,并针对从移动设备
Google DeepMind 在 AlphaGo 战胜人类十周年之际,回顾了其影响:AlphaGo 的技术启发了 AlphaFold 解决蛋白质折叠问题,并获诺贝尔化学奖;AlphaProof 和 AlphaGeometry 2 在数学推理上达到国际数学奥林匹克银牌水平;AlphaEvolve 发现更高效的矩阵乘法算法;AI 协同科学家在抗菌素耐药性研究中
Google DeepMind 发布了 Gemini 3.1 Pro,这是 Gemini 3 系列的核心推理升级版,旨在解决科学、研究和工程领域的复杂任务。该模型已在开发者产品(如 Gemini API、AI Studio、Antigravity)和企业产品(如 Vertex AI、Gemini Enterprise)以及消费者应用(如 Gemini 应用和
Google DeepMind 发布了 Gemini 3 Deep Think 推理模式的重要升级,该模式专为科学、研究和工程领域设计,可处理缺乏明确规则和数据的复杂问题。新版 Deep Think 在多个基准测试中创下新高,如 Humanity's Last Exam 得分 48.4%、ARC-AGI-2 得分 84.6%、Codeforces Elo 3
Google DeepMind 发布 Gemini Deep Think 高级版本,与专家合作解决了 18 个研究问题中的长期瓶颈,涵盖算法、机器学习、组合优化、信息论和经济学等领域。该模型通过跨领域数学工具解决了 Max-Cut 和 Steiner Tree 等经典问题,推翻了 2015 年关于在线子模优化的猜想,并扩展了经济学中的启示原理。研究显示,AI
阿里通义千问团队发布Qwen3-2507更新,包含Instruct和Thinking两个变体,提供235B-A22B、30B-A3B和4B三种尺寸。新版本在指令跟随、逻辑推理、数学、编程、工具使用及多语言长尾知识等方面显著提升,并支持256K上下文,可扩展至100万token。Thinking版本在推理任务上达到开源思考模型的最先进水平。
DSPy 发布 3.1.0 正式版,将之前的 beta 版本转正。新版本引入了 dspy.Reasoning 以捕获推理模型的原生推理过程,新增 File 类型处理文件数据,并支持 Python 3.14。同时增强了安全防护,防止加载 pkl 文件,并修复了多个 bug,更新了文档和教程。
Google DeepMind 发布 2025 年度回顾,总结其在 AI 和量子计算领域的研究突破。2025 年,Google 发布了 Gemini 2.5、Gemini 3 和 Gemini 3 Flash 等模型,提升了推理和多模态能力,并推出 Nano Banana、Veo 3.1 等生成式媒体工具。同时,Google 通过 Gemini 应用、Not