Claude Opus 5.5、GPT-6 Sol/Luna 发布与新一轮价格战
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Sol 和 Luna 价格仅为 GPT-5.6 同级模型的一半,GPT-6 Luna 输入/输出定价低至 $0.10/$0.50 每百万 token;Claude Opus 5.5 相比 Opus 5.0 降价
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Sol 和 Luna 价格仅为 GPT-5.6 同级模型的一半,GPT-6 Luna 输入/输出定价低至 $0.10/$0.50 每百万 token;Claude Opus 5.5 相比 Opus 5.0 降价
IFM 在 Hugging Face 发布 K2-Horizon-3.7B,这是 K2-Horizon 系列中的小型稠密解码器模型,拥有 3.7B 核心参数和 512K 原生上下文窗口。该模型在 agentic、编码和推理基准上与 Qwen3.5-4B、G9v3-3B、Granite 4.2-3B、Nemotron 3 Nano-4B 等开放权重稠密模型对比
该论文提出 CaLR(因果潜在修正)框架,将扩散语言模型(DLM)的推理过程重构为受约束的潜在空间优化。它通过专家模型提取因果拓扑矩阵(CTM),并利用隐式微分进行梯度引导的“思维修正”,从而在并行生成中实现中间步骤的动态自我纠错。实验表明,CaLR 在 GSM8K 和 Sudoku 等推理基准上取得 SOTA 表现,超越强自回归(AR)基线和标准 DLM
研究者提出 GovSim-SelfGovern,扩展 GovSim 公共池资源环境,让 LLM 智能体用可执行 Python 代码编写治理规则,经沙箱验证、投票后跨轮次生效。在资源充裕场景中,自治治理使完整社区存活率(ICS)从 45.0% 提升至 72.5%,但在资源紧张场景中 ICS 骤降至 5% 和 2.5%。增加财政能力、取消民主否决权以及提升推理深
该论文提出 Attention-Aware Routing (AAR),在 MoE 语言模型中用滑动窗口的注意力权重为路由器补充上下文信息,同时冻结基础 Transformer 只训练路由参数。在 OLMoE 上,AAR 相比仅路由 SFT 基线提升了 GSM8K 数学推理表现,并揭示路由与注意力构成耦合回路:路由变化经残差流放大注意力汇。研究还发现 AAR
IFM 在 Hugging Face 发布 K2-Horizon-0.9B,这是 K2-Horizon 系列中的紧凑型 dense 解码器模型,参数量 0.9B,支持 128K 上下文窗口(通过 YaRN RoPE 缩放)。模型采用多教师蒸馏训练,覆盖数学、代码、STEM 和指令跟随,并在数学、编程、科学和工具使用基准上与 Qwen3.5-0.8B、Open
Nature 报道了诺奖得主、Google DeepMind 联合创始人哈萨比斯提出的「爱因斯坦测试」:若只给 AI 1911 年前的知识,它能否自行提出相对论。独立研究者 Michael Hla 用 Karpathy 的 nanochat 框架从零训练了 33 亿参数的 GPT-1900,预训练语料约 220 亿 token 的 1900 年前书籍报纸,并
Google DeepMind 新成立的 DeepMind Institute 发布首批文章,研究员 Rohin Shah 和 Anca Dragan 指出,可见的思维链(CoT)是 AI 安全的重要优势,因为模型用自然语言写出中间推理步骤,便于研究者发现欺骗行为或问题计划,例如 Gemini 3 Pro 的思维链显示其意识到自己处于测试环境。但这一透明度正
AWS Machine Learning Blog 发布了一套面向医疗与生命科学(HCLS)领域的开源 agent skills 集合,包含覆盖 11 个 HCLS 领域的 38 项技能,以 SKILL.md 结构化 markdown 文档形式编码领域决策流程,采用 Agent Skills 开放标准并遵循 MIT-0 许可。文章指出基础模型 agent 常
llama.cpp 发布 b10996 版本,主要变更是针对 qwen3-coder 在推理预算结束时强制输出 \n 标签。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制文件,包括 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等加速方案。
研究者提出 MechReason,一个面向机械工程的多图像多跳推理基准,源自真实机械工程论文,包含 12k 问答对、21k 视觉材料和显式推理链标注,覆盖解释、预测、设计、诊断四个维度共八类任务。该基准采用四阶段构建流程,通过遮蔽后验验证信息来防止模型走捷径,并经过多模态质量验证。实验显示最先进的多模态大模型仅达到 62.89% 准确率,错误主要来自推理链缺
开发者 DavidAU 在 Hugging Face 发布 Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF,这是一个基于 Qwen3.5-9B 的多阶段微调与合并模型,提供常规与 MTP 两种 NEO IMATRIX GGUF 量化版本。模型宣称在 7 项基准上
Google ADK Python 发布 v2.9.1 版本,主要改进在使用 Claude 自适应思考能力时对模型推理步骤的可见性。该版本通过确保在自适应思考任务中请求可见思考内容,让开发者能够访问 Claude 模型逐步推理的过程。此次更新以 bug 修复形式提交。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向近实时语音交互的新模型。前者主打规模化与成本效率,支持近实时视觉输入、97 种语言自动切换及后台工具调用;后者面向高复杂度任务,可边推理边说话,在 Artificial Analysis 语音到语音质量指数上以
另有 2 家信源报道
研究团队发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,从零训练,结合内部推理与外部工具使用,支持 256K 上下文。该模型采用架构与系统协同设计(交错门控滑窗与全注意力、稳定的 FP8 Muon 优化器)、渐进式课程与 MDP 中期训练,并借助智能体集群自主管理集群运维、数据整理与评估。在数学推理和智能体搜索任务上,其表现可与 Qwen3-235B
另有 1 家信源报道
Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重模型 Nemotron 后训练而成,专攻销售、营销和客服任务。Koa 以开源权重、不摄入客户数据、token 消耗更少等特性,作为 Agentforce 平台中 Claude、ChatGPT 等前沿模型的替代选项。Salesforce 高管称此前缺乏具
另有 1 家信源报道
NVIDIA 于 9 月 9 日公开了 Nemotron 3 Ultra 在 2026 年 IMO 上取得 30/42 分(超过 29 分金牌线)的完整数学推理系统,包括两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、提交证明及 200 道 Nemotron-IMO-Bench。该系统通过多 checkpoint 采样、p
研究者提出 PhysMent,一个基于 MuJoCo 物理模拟器的交互式基准,用于评估大语言模型通过多轮工具调用进行物理实验推理的能力。该基准包含 105 个经典力学场景,覆盖四种难度、三种场景模态和一个场景操控类别,并采用六维评分框架。结果显示,当前模型在定性单概念任务上可达 80% 准确率,但在需要精确多步实验的定量任务上大多低于 30%,七个模型整体准
该论文研究自主编码智能体在实验后如何复用证据来指导下一步决策。作者重建了400任务NeuroGolf竞赛中的证据复用过程,发现智能体常将实验结论过度泛化,例如把仅证明新颖性不足的拒绝误读为已测得的封闭性,或使用过宽的排除理由。为此提出一种可检查的交接协议,将测试命题、适用范围、候选与评估者身份、检查状态和重开条件关联起来,并设计调度树与晋升谓词,要求每项检查
研究者提出 TestHallVQA,一个面向大型视觉语言模型(LVLM)的多图像文档级 VQA 基准,数据来自科学考试试卷,包含超过 1 万条问答对和 7000 张试卷图像。该基准可控制地注入多级冗余上下文,并配套提出 F1-R2 指标,同时衡量模型的推理能力与对文档级冗余的证据检索鲁棒性。实验显示主流 LVLM 在多个维度存在潜在缺陷,为后续研究提供方向。