返回主题地图

推理能力

技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

12月17日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布 Gemini 3 Flash:高速前沿智能,低成本普及

Google DeepMind 发布 Gemini 3 Flash 模型,面向开发者和公众提供快速、低成本的推理能力。该模型在 GPQA Diamond 等基准上表现优异,价格低于 Pro 版本,并已集成至 Gemini API、Vertex AI 及 Gemini 应用。此举旨在扩大 Gemini 3 的覆盖范围,提升日常任务和智能体工作流的效率。

11月20日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Google 发布 Nano Banana Pro 图像模型,强化推理与创意控制

Google DeepMind 发布了新一代图像生成与编辑模型 Nano Banana Pro(基于 Gemini 3 Pro),该模型具备更强的推理能力、多语言文本渲染和高级创意控制功能,支持最多 14 张图像融合和 5 人一致性保持。该模型已开始在 Gemini 应用、Google Ads、Workspace、Gemini API 等产品中向消费者、专业

11月19日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布Gemini 3:开启智能新时代

Google 和 Alphabet CEO Sundar Pichai 及 Google DeepMind 团队宣布推出 Gemini 3,这是其最先进的 AI 模型,具备顶尖的多模态理解和推理能力,并同步在搜索、Gemini 应用、AI Studio 及新平台 Google Antigravity 中上线。Gemini 3 Pro 在多个基准测试中刷新纪录

11月18日周二 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Google 发布 Gemini 3 Pro 预览版,强化推理与多模态能力

Google 于 2025 年 11 月 18 日发布 Gemini 3 系列首个模型 gemini-3-pro-preview,该模型具备先进的推理、多模态理解、智能体及编程能力,并引入新的行为特性。开发者可通过 Gemini 3 开发者指南了解迁移、新功能和规格。

11月13日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

SIMA 2:在虚拟3D世界中游玩、推理与学习的智能体

Google DeepMind 的 SIMA 2 团队发布了一款能够在虚拟 3D 世界中游玩、推理并与用户共同学习的智能体。该研究得到了多个游戏开发商的合作支持,并使用了 Genie 3 模型。SIMA 2 旨在推动 AI 在交互式环境中的能力发展。

10月29日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

Google DeepMind 启动 AI for Math 计划,加速数学发现

Google DeepMind 宣布启动 AI for Math 计划,联合帝国理工学院、高等研究院等五所顶尖机构,利用 AI 加速数学研究。该计划将提供 Gemini Deep Think、AlphaEvolve 和 AlphaProof 等工具,并已取得突破,如 AlphaEvolve 发现更高效的矩阵乘法算法,打破 50 年纪录。此举旨在推动 AI 与

8月5日周二 · 1 条
正文结构化主题已通过公开置信门槛
Claude App Release Notes一手来源模型发布

Anthropic 发布 Claude Opus 4.1 增量更新

Anthropic 于 2025 年 8 月 5 日发布了 Claude Opus 4.1,这是对 Opus 4 的增量更新,提升了复杂推理、分析和创意任务的性能。该模型被定位为 Anthropic 最强大的模型,相关公告和模型概述已提供。

5月1日周四 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

为什么我们要思考:测试时计算与思维链的进展

Lil'Log 发布文章《Why We Think》,回顾了测试时计算和思维链(CoT)在提升模型性能方面的最新进展。文章从人类双过程理论出发,将慢思考类比为测试时计算,并探讨了通过并行采样和顺序修正等解码策略来优化模型输出的方法。文章还提到了强化学习在提升 CoT 推理能力中的应用,并引用了 o1、o3 和 R1 等模型的技术报告。

12月19日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

谷歌发布Gemini 2.0 Flash Thinking Mode公开预览版

谷歌于2024年12月19日发布Gemini 2.0 Flash Thinking Mode公开预览版。该模式是一种测试时计算模型,允许用户查看模型的思考过程,并生成具有更强推理能力的响应。