返回主题地图

推理能力

技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月2日周三 · 1 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog产品发布

Claude Fable 5.1 生成精美动画鹈鹕

Anthropic 发布了 Claude Fable 5.1 模型,声称在编码、知识工作和长期问题解决方面树立了新标准,并在新的 Terminal-Bench-Science 基准上取得 52.6% 的分数。作者 Simon Willison 测试了该模型生成鹈鹕骑自行车 SVG 的能力,发现低和中等推理级别下模型几乎不进行推理,而高和最高级别则产生更详细和

9月1日周二 · 4 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

ERR+:基于序列熵消解的 LLM 高效推理框架

ERR+ 提出一种两阶段 RLVR 框架,基于 token 级熵降奖励(ERR)和鲁棒相对效率奖励(RRER)优化 LLM 推理。实验表明正确推理轨迹熵降更频繁,ERR+ 在五个数据集上提升准确率并缩短响应长度。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

停止向量:将因果干预内化以实现高效推理

该研究在 DeepSeek-R1-Distill-Qwen-7B 模型中发现了一个“停止向量”(halt vector),位于第 18 层,通过干预该方向可控制模型思考长度。研究者将该因果干预内化到模型权重中,从 24 个问题中拟合,无需强化学习,在五个未见基准上以保持准确率的方式减少了约 24% 的思考,并解决了非终止病理问题。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

AgenticRag-R1:基于栈内存的智能体强化学习实现多步推理与检索

AgenticRag-R1 是一个基于强化学习的框架,通过内存栈和细粒度动作空间深度融合推理、检索和记忆,并采用分层动作感知奖励和信息感知轨迹拒绝策略,以解决现有 RAG 系统在多步推理中自适应检索和上下文修订的不足。实验表明,该方法在多个多跳、开放域和智能体推理基准上优于强基线,并展现出更稳健、可解释且记忆感知的推理行为。代码已在 GitHub 上匿名公开

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

在线策略蒸馏真的有效吗?从噪声教师到自我改进

该论文研究了在线策略蒸馏(OPD)在推理任务中的实际作用,发现其提升主要来自抑制低概率token而非教师模型的指导。基于此,作者提出了一种无需监督的熵自适应方法OPSA,在AIME24基准上相比基础模型Qwen3-1.7B将Avg@32提升了35.41分,相对提升263%,并显著优于传统OPD方法。

8月31日周一 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SciReC:多模态多轮关系推理的自适应诊断评估

arXiv 论文提出 SciReC,一个模型自适应的多模态学术对话基准,用于评估多模态大语言模型在八类关系推理上的表现,并引入 DMRA 诊断框架以量化视觉理解、知识、记忆和推理等成分的贡献。结果显示 Claude 4.6 总体关系得分最高(73%),GPT 5.4 次之(68%);开源模型在空间关系上最弱,闭源模型在层级和顺序关系上更吃力;所有模型的主要错

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布 Leanstral 1.5 形式化证明模型

Mistral 平台发布了 Leanstral 1.5 模型,这是面向 Lean 4 形式化证明工程的更新版本,改进了 SFT 混合质量并扩展了长上下文推理能力。该模型将于 2026 年 9 月 30 日退役。

8月30日周日 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NC-AI 联盟发布 VAETKI-100B-A10B 多语言 MoE 大模型

NC-AI 联合 13 家机构组成的 NC-AI 联盟发布了 VAETKI-100B-A10B 大型语言模型,采用 MoE 架构,总参数 112.2B,激活参数 10.1B,支持韩、英、中、日四种语言,上下文长度 32k,基于 MIT 许可开源。该模型针对推理、知识应用和智能体场景设计,工具智能体任务使用非思考模式,其他任务使用思考模式,并经过人类偏好对齐。

8月29日周六 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

PACE:因子引导的长视频证据获取框架

香港科技大学团队提出PACE框架,用于长视频问答中的证据获取。PACE采用两阶段方法:先基于问题因子索引片段描述,再结合候选答案进行对比验证。在MMR-V基准上,PACE达到42.6%准确率,优于Deep Video Discovery等基线,并在多个长视频基准上表现一致。

8月26日周三 · 1 条
正文结构化主题已通过公开置信门槛
MIT Technology Review AI研究

AI 在这些智力测试中频频失误,你能比它做得更好吗?

MIT Technology Review 报道称,AI 模型在空间推理、记忆适应性和抽象视觉推理等智力测试中仍存在明显短板。哥伦比亚大学和谷歌等机构的研究显示,模型在 Connections 谜题上进步显著,但在心理旋转、骑士与无赖变体及 ARC-AGI 等任务上仍常出错。文章通过多个示例谜题,展示了人类与 AI 认知方式的差异,并邀请读者测试自己能否在这

8月25日周二 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

区分增量叙事理解中的修订与延迟细化

本文区分了增量叙事理解中的两种更新操作:修订驱动更新(非单调,因矛盾而撤回或替换已承诺结构)和延迟细化(单调,通过添加约束细化未充分指定的内容而不撤回先前承诺)。作者使用视觉叙事作为诊断领域,通过一个实例展示了结构化叙事表示如何显式区分已承诺与未充分指定内容,并支持这两种更新操作。该区分对增量推理和混合符号-神经系统的设计具有启示意义。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

基于记忆增强推理的 LLM 智能体群组推荐方法

arXiv 论文提出 AGR,一个基于 LLM 的智能体框架,用于增强群组推荐。AGR 包含记忆模块和推理模块,通过 token 哈希表动态管理用户和群组的历史交互,并执行多步推理以生成可解释的推荐。实验表明,AGR 在 LastFM 和 Douban 数据集上显著优于现有方法,模型已开源。

8月24日周一 · 3 条
正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

多模态智能体框架的基础与前沿:技术与应用综述

该综述系统分析了多模态智能体框架中感知、推理、规划、记忆和行动等核心模块,并提出了按模态分类的架构分类法。文章回顾了从文本智能体到多模态框架的演变,以及委托、晚期融合和早期融合等集成方式,并评估了在机器人、GUI与网页导航、多媒体内容生成与编辑、长视频理解与检索等领域的应用。最后讨论了性能、效率与可扩展性之间的权衡,并指出了未来研究方向。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

评估大语言模型有限理性策略深度的Level-k可区分机制

本研究提出level-k可区分机制,用于评估大语言模型在有限理性环境中的策略推理深度。作者构建了满足level-k可区分性的新博弈结构,并测试了四个LLM在递归推理和对手行为归纳下的策略深度,发现模型在递归推理下表现准确,但在归纳推理下性能下降。研究还指出,错误源于推理深度步骤数错误而非最佳响应计算错误。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

SKT 发布 688B 参数 MoE 模型 A.X K2,支持原生 FP8 训练

SKT 发布了 A.X K2,这是一个 6880 亿参数、330 亿激活参数的 MoE 语言模型,作为 A.X K1 的继任者,支持思考与非思考模式,并采用 Think-Fusion 训练方法。该模型原生 FP8 训练,支持 256K 上下文,并针对多语言和代码进行了优化。它是韩国政府主权 AI 基础模型项目的一部分,旨在提升韩语和文化理解能力。

8月22日周六 · 4 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

新研究:忽视人类信念的世界模型预测行为不准

一项新研究指出,当前世界模型(如Sora、Genie 3等)仅建模物理层,忽略了人类信念、意图等心理状态,导致预测行为不准确。研究者提出“心理世界建模”(MWM)框架,并构建无需训练的参考实现MENTIS,在Menti-Bench基准上显著提升模型表现。该框架通过耦合物理与心理变量,使AI代理能更准确地预测人类行为,但模拟阶段仍是主要瓶颈。

正文结构化主题已通过公开置信门槛
Latent Space观点

代理框架的演进:模型与框架的交叉点

本文探讨了AI代理在2025年圣诞节前后突然变得有效的原因,作者认为这是模型能力与代理框架(harness)共同进步并交叉的结果。文章回顾了从ReAct、AutoGPT到Cursor、Claude Code的演进历程,指出模型正在吸收框架功能,而框架正转向管理人类注意力。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.8 冷融合微调模型,大幅减少思考 token

DavidAU 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF,采用 COLD FUSION(GAIN+Unsloth)训练方法,将思考 token 减少至原来的 1/2 到 1/10,同时保持或提升推理能力。该模型在 4bit 和 8bit

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.6-40B 多阶段微调模型,宣称达到闭源智能水平

DavidAU 发布了 Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF,这是一个基于 Qwen 3.6 的 40B 参数多阶段微调模型,据称在 8 位和 4 位量化下达到闭源模型(如 OpenAI、Claude)的智能水平。该

8月21日周五 · 1 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示通用智能体架构

NVIDIA 研究项目 AVO 在 ARC-AGI-3 基准测试中取得 100.00 分,完成全部 183 个关卡。AVO 是一种通用智能体架构,通过持久记忆和监督机制支持长时间自主运行,此前已在 GPU 内核优化中展现性能提升。该结果表明,智能体系统的整体架构对模型能力转化为实际进展至关重要。