CAViAR:用于真实场景细粒度事故推理的因果视频数据集
CAViAR 是一个由 NEC 实验室发布的新型因果视频数据集,包含 2,249 个真实行车记录仪事故视频,并标注了环境条件、事故类型、因果解释、责任方和违规规则等信息。通过评估多个视觉语言模型,研究发现现有模型在感知任务上表现较好,但在事故类型和责任推理上存在明显不足,揭示了感知与推理之间的差距。该数据集和代码已公开,旨在推动自动驾驶安全领域的多模态推理研
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
CAViAR 是一个由 NEC 实验室发布的新型因果视频数据集,包含 2,249 个真实行车记录仪事故视频,并标注了环境条件、事故类型、因果解释、责任方和违规规则等信息。通过评估多个视觉语言模型,研究发现现有模型在感知任务上表现较好,但在事故类型和责任推理上存在明显不足,揭示了感知与推理之间的差距。该数据集和代码已公开,旨在推动自动驾驶安全领域的多模态推理研
The Verge 的 AI 记者 Robert Hart 在 Decoder 节目中讨论了 AI 对数学领域造成的冲击,称数学界因 OpenAI 发布的高难度数学问题解决方案而‘震惊’。尽管 AI 在基础算术上仍表现不佳,但在高级抽象数学上已展现出专业水平,引发了对数学家角色和数学研究未来的存在主义危机。Hart 采访了多位顶尖数学家,探讨 AI 能力提升
雷峰网报道了开源项目J-Space Cognition Suite被指造假,其宣称通过外部Harness让小模型追平甚至超越顶级大模型,但独立复测结果相反。OpenAI思维链发明者Jason Wei发文指出小模型加工具无法替代大模型的内化能力,引发行业对Scaling Law与工程路线的讨论。
IJCAI 2026 在德国不来梅召开,聚焦 Agent、多智能体、机器人和强化学习。中国厂商如阿里、字节、百度、腾讯、华为等正将大模型融入复杂系统,补齐 Agent 能力缺口,竞争从模型能力转向系统能力。
inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s
一项针对医学推理中大型语言模型(LLM)的元认知敏感性的研究,开发了一个受心理物理学启发的临床基准,测试了gpt-4.1-nano在阿尔茨海默型神经认知障碍与抑郁相关认知障碍鉴别中的诊断准确性和置信度行为。结果显示模型表现出部分元认知敏感性,但置信度并非完全可靠,且较新或名义上更强的模型不一定具有更好的置信度-正确性区分能力。研究强调应直接测量医学LLM的置
本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态
本文分析了多种深度研究代理(DRA)的推理轨迹,发现它们常出现“推理停滞”问题,即多数迭代对最终性能贡献甚微,且代理缺乏对自身轨迹的感知。为此,作者提出无监督信号和检索感知代理控制器(RAAC),帮助代理在每步选择最优动作,减少不必要的搜索调用并提升性能。在BrowseComp-Plus等基准上,RAAC平均减少14次搜索调用,准确率最高提升10%,平均提升
arXiv 论文提出 SELR 框架,通过多任务训练让单一模型同时进行高效潜在空间推理并生成可读的思维链解释,解决了潜在推理的不可解释性和监督缺失问题。实验表明 SELR 在 LLM 和 VLM 上相比基线提升了 token 效率和准确性,且无需外部解码器。
美团LongCat团队构建了MineExplorer评测基准,用于系统评估多模态大模型在开放世界中的长程任务能力。该基准包含813个人工验证的实例,通过隐藏前置条件、知识解耦和多智能体数据合成等创新设计,揭示了当前顶级模型在动态世界中感知强于推理、多跳任务成功率骤降等能力断层。评测显示最强模型Claude-Opus-4.6整体成功率仅41分,导航失败是主要错
菲尔兹奖得主Timothy Gowers指出,近期AI在数学领域的重大突破多通过寻找反例实现,如OpenAI模型解决Erdős单位距离问题、Claude协助发现雅可比猜想反例等。Gowers认为AI擅长在巨大搜索空间中寻找特殊对象,但缺乏人类数学家的直觉判断力,并预测AI将快速进步。
麻省理工学院的研究人员通过电路分析发现,大型语言模型(LLMs)在语言、形式推理、社会推理和物理推理等认知领域表现出与人类大脑相似的功能模块化组织。该研究基于46项任务,表明LLMs中处理相同认知领域的任务会激活重叠的神经元,而不同领域则激活不同的神经元。这一发现暗示模块化可能是智能系统的一个基本属性,而非生物大脑特有的进化偶然。
阿里Qwen实验室发布Apache 2.0许可的Qwen 3.8 27B视觉语言模型,作者Simon Willison在本地设备上测试后发现其默认推理强度为xhigh,导致模型对简单任务过度思考,生成耗时极长。作者建议用户将推理强度调低或关闭,并展示了模型在生成SVG和边界框标注方面的优秀能力。
顶级数学家Timothy Gowers和Peter Sarnak认为,大型语言模型在数学计算方面表现出色,但在创造性思维上存在局限。Gowers指出,模型擅长组合已知方法和探索多条路径,但缺乏在广阔搜索空间中选择有效路径的直觉。Sarnak补充说,AI能从现有理论推导结果,但无法从基本问题出发发展出支撑重大证明的抽象概念。DeepMind研究员Tom Zah
这篇立场论文指出,生成式AI领域对“推理”缺乏统一定义,导致推理评估的构念效度无法验证,阻碍了可信自主推理的进展。作者提出将有效且合理的推理视为一种可学习的、基于规则的过程,并提供了操作化定义和最佳实践清单,以促进研究交流。
Gambit是一种新的推理算法,通过思想级束搜索在固定硬件预算下动态分配计算资源到有前景的推理轨迹。在多个模型和基准测试中,Gambit相比现有基线在HMMT-24上取得+6.7%的绝对准确率提升,在AIME-25上提升+3.3%,同时将总token消耗减少高达68.5%。该方法通过轻量级评分器探测隐藏状态,定期剪枝无望轨迹并立即从高质量前缀分支,保持高硬件
llama.cpp 发布 b10434 版本,主要更新是在聊天功能中传递 reasoning effort 参数,并将其存储到 common chat templates inputs 中,供 Jinja 模板使用,同时支持模型特定的翻译。该版本还修复了服务器端从请求体读取 reasoning effort 的问题,并提供了多平台(macOS、Linux、W
HPSE是一种用于非结构化知识编辑的新方法,通过从混合轨迹中蒸馏来将缺失事实插入模型的推理路径,从而实现可组合的多跳推理。该方法解决了现有编辑器无法利用注入段落的问题,并在四个LLM骨干和两个KE编辑器上展示了即插即用的改进。
Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24
Anthropic研究员Levent Alpöge与两位人类伙伴及Claude合作,构造出668阶哈达玛矩阵,并一并解决了2000阶以下所有12个空缺阶数。该成果已被FrontierMath基准测试标记为AI解决,成为其50个开放问题中第四个被AI解决的题目。此前668阶矩阵已困扰数学界30年,此次突破展示了AI在数学推理领域的潜力。