返回主题地图

推理能力

技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布17

Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型

Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1 0)或 7.21 GB(PQ2 0),相比

9月25日周五 · 8 条
正文结构化主题已通过公开置信门槛
Latent Space商业3

AINews 改版:Discord 与 AINews 合并,本周前沿模型密集发布

Latent Space 发布 AINews 改版计划,将 Discord 与 AINews 合并,并探索迁移至 Beehiiv 及新主页,同时重新开放赞助与 PR 合作。本周 AI 动态密集:Anthropic 发布 Claude Opus 5.5、OpenAI 推出 GPT-6 系列(Astra/Sol/Luna)、Google 发布 Gemini 3.

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

预测智能体何时该推理?可靠性路由的行为压力测试

该研究将预测智能体的机制选择(检索、推理、参考市场先验或使用历史类比)视为可观测行为,在 ForecastBench 式二元预测任务上进行压力测试。作者提出 ReliabilityRoute,基于历史覆盖率、市场先验可用性、证据强度等可靠性特征进行路由,而非硬编码来源名称。实验显示固定路由在 2025-10-26 评估集上将 Brier 分数从 0.1876

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究4

多智能体辩论用于可解释交易:推理、共识与模拟市场表现

研究团队构建了一个多智能体辩论框架,用于历史市场模拟中的投资组合配置,让专门化智能体在结构化推理与干预协议下提出、批评并修订投资决策。在210次受控实验中,聚合推理质量与夏普比率和总回报均无显著关系,结构化提示虽大幅提升推理质量,但收益并未稳定提高。研究识别出「谄媚式收敛」这一核心失败模式,并发现保留分歧的JSD干预能提升夏普比率和索提诺比率,而强制因果推理

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究4

Agent-Editing World Model:重新思考 LLM 智能体的世界建模

该论文提出 Agent-Editing World Model(AEWM),重新思考长时程 LLM 智能体的世界建模方式,将目标从预测环境观测转向建模推理与动作如何影响未来任务进展。AEWM 结合 Action Judge(区分关键、探索性、噪声决策)与 State Revision(直接编辑噪声推理-动作延续),其推理框架 EditAct 与真实环境交互结

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布6

IFM 发布 K2-Horizon-7B 开源稠密模型,支持 512K 上下文

IFM 在 Hugging Face 发布 K2-Horizon-7B,这是 K2-Horizon 系列的中等规模稠密解码器模型,拥有 512K 原生上下文窗口。模型在数学、编程、长上下文与推理等基准上对标 Gemma 4-12B、Qwen3.5-9B、Granite 4.2-8B 等参考模型,并公开训练数据、训练配方、训练代码与评测资源,同时提供中间检查点

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B 高效推理模型

UkisAI 发布了 Swift-Qwen3.8-27B,这是基于 Qwen3.8-27B 微调而来的推理高效衍生模型。该方法通过识别并惩罚导致过度思考的推理标记 token,使思考 token 数量减少 58.3%,性能损失低于 1%,在多个任务上实现约 1.95 倍加速。模型还引入了来自 BottleCap AI 的 ThinkingCap-Qwen3.

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B GGUF 量化模型

UkisAI 在 Hugging Face 发布了 Swift-Qwen3.8-27B 的 GGUF 量化版本,该模型是 Qwen3.8-27B 的推理高效衍生版本。据其评测,Swift 版本在保持性能损失小于 1% 的前提下,平均思考 token 减少约 58.3%,并在多项任务上实现约 1.95 倍加速。该模型采用自定义的 swift-open-lice

正文结构化主题已通过公开置信门槛
THE DECODER研究1

AI 性能成本下降速度超过以往任何技术

Epoch AI 研究显示,在特定 AI 基准上达到固定性能水平的成本自 2023 年以来以每季度约 47%、每年约 13 倍的速度下降,快于以往任何变革性技术。MIT 研究者基于 Artificial Analysis 数据得出年降幅为 5 至 10 倍,剔除硬件降价和竞争压力后,纯算法效率提升约为每年 3 倍。研究同时指出,新推理模型因消耗更多测试时算力

9月24日周四 · 5 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

阶段监督潜在推理实现单次JavaScript反混淆

该论文提出一种阶段感知的潜在推理框架,用于JavaScript反混淆。方法将确定性反混淆工具产生的中间输出转化为监督信号,基于Coconut(连续思维链)范式训练模型,使其在训练时学习多阶段重写过程,但在推理时仅接收混淆代码并一次性生成清理后的程序。在JsDeObsBench上的初步结果显示,基于Coconut的模型将语法有效性提升至50%(直接微调为15%

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究2

CoMed:多LLM推理中路由与协作之间的选择性升级

论文提出 CoMed,一种多 LLM 推理中的选择性协作控制器,位于路由与密集协作之间。作者发现跨模型协作具有非单调性:同伴既能挽救单模型无法解决的错误,也可能破坏原本正确的答案。CoMed 通过锚点自一致性、路由边际和轻量同伴探测,决定接受、验证或升级协作,在 16 个开源权重设置中均优于固定或路由锚点,MedQA 最高提升 10.7 个百分点,并在 HL

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究2

审计多智能体审议中的置信度路由、校准与承诺

该研究审计了多智能体审议中常见的「置信度路由」协议:让各智能体报告置信度,由最高分者发言。作者将审计拆分为路由(是否选对候选)、校准(置信度是否像概率)和承诺(被选智能体是否公开说出赢得回合的答案)三个可分别测量的维度。在 4,181 条 gpt-oss-120b 奥数轨迹上,置信度能区分对错(AUROC 0.72)但严重过度自信(79% 置信 vs 52%

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源模型发布3

NVIDIA 发布 NV-Reason-CT:面向放射科思维链的 3D CT 视觉语言模型

NVIDIA 发布 NV-Reason-CT,一个专为 3D CT 分析构建的视觉语言模型,将思维链推理扩展到全容积 CT,可生成结构化诊断报告、模拟放射科医生思维链并支持多轮追问对话。该模型基于 NV-Reason-CXR 的推理方法,采用 3D ViT 编码器与 Qwen3.5-4B 语言模型组合,处理 192³ 体素 CT 数据。NVIDIA 强调其定

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源1

IsValorum 发布 Qwen3.8-35B MoE 定制 GGUF 量化版

IsValorum 在 Hugging Face 发布了 Qwen3.8-35B-A3B-Distill-MTP-APEX-I-MiniPlus-V2.1 的 GGUF 量化版本,基于 empero-ai/Qwen3.8-35B-A3B-Distill 模型。该版本针对 13-14GB 显存/内存上限优化,采用逐张量定制量化策略,保留 F32 路由门、Q6

9月23日周三 · 6 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

TopologicalQwen:拓扑知识蒸馏的1.7B模型

Convergent Intelligence LLC 研究部门发布 TopologicalQwen,一个从 Qwen3-30B-A3B-Thinking-2507 蒸馏得到的 1.7B 参数模型。该方法称为拓扑知识蒸馏(TKD),将教师输出分布视为有界变差函数,分解为平滑、跳跃和漂移三个通道进行知识迁移,并采用 DualMind 格式训练模型进行推理、自我

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

TAMELM-AFMoER 1B 发布:引入黑洞绳机制

研究者 reaperdoesntknow 在 Hugging Face 发布 TAMELM-AFMoER (1B) 模型,在原有 421M 版本基础上引入 Blackhole Rope(BHR)机制,通过类引力吸引子稳定多时间尺度路由并放大推理信号。模型采用 16 专家稀疏路由、CPU 单机 FP32 训练,仅用约 100 万 token 即达到 loss

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

Convergent Intelligence 发布符号-神经混合模型 Symbiotic-Beta

Convergent Intelligence LLC 在 Hugging Face 发布实验性模型 Symbiotic-Beta(SymLM),基于 Qwen2.5-0.5B 冻结主干,融合符号认知模块(DTE-HDM、M.A.S.R.M、QwenExoCortex 等),在 MetaMathQA 的 2.5 万条样本上微调,面向数学推理与神经符号研究。模

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究1

The Tasteful Agent:长周期任务中智能体品味的度量与提升

该论文提出「品味」(taste)概念,指 LLM 智能体在长周期任务中于决策分叉点选择更优方向的能力,并构建了 Taste-Bench 基准。Taste-Bench 从 SWE-bench Pro 和 METR AI R&D 轨迹中自动挖掘出 502 个决策分叉,无需人工标注。评测显示 14 个前沿模型中最优者仅答对 59.7%,且决定证据出现越晚准确率越低

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究1

LEDFlow:熵引导生成顺序的均匀离散流采样器

该论文提出 LEDFlow,一种无需训练的采样器,通过熵引导的吸收策略为均匀离散流引入生成顺序。研究发现均匀离散流中 9.4% 的生成单元在中间步骤正确但最终输出错误,LEDFlow 将这一比例降至 2.6%。在 Nikoli 数独上达到 0.845 的求解准确率,在文本到图像生成和多模态理解任务上也优于原生采样器,且推理成本相当。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究1

同量不同答:语言模型中的数值表示不变性

该研究提出一个精确有理数轨道框架,用3,600道精确有理数题和8,600条提示,测试五种开源权重模型在五种保持数值恒等的改写(小数/分数、科学计数法、百分数、数字词、单位换算)下是否给出相同答案。结果显示,规范准确率高达0.969–0.996,但轨道正确率降至0.848–0.981,轨道不变性为0.851–0.981;大部分严格解析器崩溃源于乘法形式科学计数