参数空间探索通过变分学习改进 LLM 强化学习
Hugging Face 每日论文介绍了一篇关于参数空间探索的研究,提出了一种名为 Perturbed Parameter Policy Optimization (3PO) 的方法族,通过从后验分布中采样不同策略来生成轨迹,以改进 LLM 的强化学习。实验表明,在 OLMo-3-1025-7B 和 Qwen2.5-Math-7B 上,3PO 在数学推理和代
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 每日论文介绍了一篇关于参数空间探索的研究,提出了一种名为 Perturbed Parameter Policy Optimization (3PO) 的方法族,通过从后验分布中采样不同策略来生成轨迹,以改进 LLM 的强化学习。实验表明,在 OLMo-3-1025-7B 和 Qwen2.5-Math-7B 上,3PO 在数学推理和代
IJCAI 2026 将于 8 月在德国不莱梅举行,中国机构论文贡献比例未因 CCF 评级下调而下降,反而在知识表示、规划等符号推理方向占比显著。中国企业如蚂蚁、美团、京东、腾讯等虽未赞助,但深度参与技术研究,聚焦可解释性、组合优化、逻辑强化学习等方向。会议风向标包括多智能体协作、神经符号计算和可解释性安全,反映产业界从参数竞赛转向逻辑攻坚。
该研究提出Code-with-Image范式,将视觉推理从语言链转移到Python程序执行,并构建CwI-Bench基准测试。作者提出Self-Reflection over Executable Reasoning,一种无需训练的自我进化循环,通过观察和可执行反射改进技能库,显著提升GPT-5.6-luna和Qwen3.5-27B在基准上的准确率,且技能可
TRACES 基准测试通过 42 篇撤稿、欺诈或伪科学论文,评估大语言模型在科学推理中的认知可靠性。测试发现,30 个模型在 71% 以上的智能体探针中失败,22 个模型失败率超过 90%,表明模型拒绝不可靠前提的能力主要基于主题安全行为而非真正的认知能力。该研究呼吁为科学部署的语言模型建立防护基础设施。
该研究将预训练语言模型 Qwen2.5-0.5B-Instruct 改造为循环深度架构,通过权重共享的循环块和可训练桥接层实现迭代潜在计算。在两种参数预算(6M 适配器和 180M 全块)下,模型在 ARC 基准上表现不逊于基线,并能外推至监督深度的 1.5 倍。与同规模自回归模型相比,循环模型在深度推理上准确率更高(84% vs 72%),速度更快,且保留
微软研究院推出新基准 MindTopo,用于评估多模态大语言模型的拓扑推理能力,涵盖连通性、封闭、顺序、分离和打结等概念。研究发现,当前模型在静态图像识别上表现较好,但在交互式规划任务中显著下降,错误多出现在规划阶段而非感知阶段。该基准旨在为机器人及交互环境中的 AI 系统提供诊断工具,并指出需要显式拓扑状态或保持拓扑的世界模型。
本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。
DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 模型,这是基于 Qwen3.6-27B 的多阶段微调模型,据称在 8 位和 4 位量化下 ARC-C 得分均超过 700,达到闭源模型水平。该模型在 7 项基准测试中 6 项超过基础模型,并支
一篇研究论文展示了如何通过重放加密的推理块,从Claude、GPT和Gemini等前沿模型中提取隐藏的推理痕迹,并成功移植到其他模型或会话中,从而显著提升开源模型性能。初步扫描约7000个公共痕迹发现62个API密钥、33个邮箱和33个密码等敏感数据泄露。该漏洞已负责任披露,部分已修复,但类似攻击仍可能发生。
该研究对大型语言模型在民主审议中的推理能力提出实证批评,指出其能力不能从可验证任务基准推断。通过应用政治学中的审议理性指数(DRI),对1980次五智能体LLM运行进行分析,发现LLM群体的程序性话语质量接近人类,但视角多样性仅约为人类的三分之一,且审议过程呈现发散而非收敛。研究结论认为,LLM可作为支持人类推理的工具,但当前证据不支持将其视为自主审议代理。
该研究通过实证调查挑战了链式思考(CoT)提示普遍提升大语言模型推理能力的假设。基于带宽约束框架,研究在三个指令微调模型和五个基准测试中发现,CoT的效果取决于任务的序列深度:在高深度任务(如GSM8K、MATH)上CoT带来显著提升,而在低深度任务(如MMLU、ARC-Challenge)上CoT几乎无益。研究结论表明,CoT并非通用的推理增强器,而是作为
本文提出一个形式化框架,用于从多元结构理论构建规范解释,并区分了三种强度的“规范”概念:闭包稳定、全局完成和AC-6意义下的确定性。该框架将非确定性分为结构多元性(S型)和认知多元性(E型),并分别以Wyckoff和ICT理论为例。研究表明,基于完成算子的规范化需要闭包、可比性和兼容扩展条件,而基于选择器的规范化需要理论内在可比性和全局兼容性。在LLM辅助推
Hugging Face 每日论文介绍了一项名为 BDH-CQ 的研究,该研究将上下文学习与循环潜在推理相结合,提出了一种 150M 参数的推理模型。该模型在 ARC-AGI-1 基准上达到了 29.5% 的 pass@2 准确率,每任务推理成本仅为 0.0007 美元,突破了该基准的成本-精度帕累托前沿,树立了新的成本效率标杆。
安全研究人员发现了一个影响所有主要AI提供商API的漏洞,可以读取推理模型的加密思维过程。通过越狱,他们使用较小的模型转录更强大模型的原始推理,并在公开会话中暴露了密码和API密钥。该漏洞还加剧了关于推理蒸馏的争议,并揭示了模型内部使用难以理解的语言或考虑欺骗行为。
Motif 3 是一个具有 3140 亿总参数、每 token 激活 132 亿参数的解码器专用混合专家语言模型,采用细粒度稀疏 MoE 架构,每层包含 384 个路由专家,每 token 选择 8 个。该模型基于分组差分潜在注意力(GDLA)构建,并整合了流形约束超连接、专家特定 PolyNorm 激活和多 token 预测等技术。模型在约 12.5 万亿
Hugging Face 发布了 Sci-VBench,一个用于评估科学领域视频生成的基准,包含 1253 个专家标注示例,覆盖自然科学、医疗、人文社科和工程四个学科。该基准采用基于规则的评估协议,发现非专家和 MLLM 评审与专家判断高度一致。对 16 个前沿模型的评估显示,视觉质量分数接近,但提示遵循和科学因果正确性差异显著,且闭源模型优于开源模型。
Hugging Face Daily Papers 发布了一篇题为《Evidence-RL: Towards Evidence-intensive Visual Reasoning》的论文。论文提出了一种名为反事实证据解缠(CED)的训练时证据审计方法,用于增强视觉语言模型(VLM)的接地能力。CED 通过中和对象中心的证据区域并比较支持度下降,结合 GRP
SPOT 是一种用于在线蒸馏(OPD)的新方法,通过稀疏探测和结果校准目标来改进推理性能。它解决了标准 OPD 中教师不确定性分布不均和局部概率无法预测下游成功的问题。实验表明,在多个学生模型和推理基准上,SPOT 相比 OPD 和 EOPD 在 Avg@8/Pass@8 指标上均有显著提升。
Meta 发布了新的开源模型 Muse Glimmer,这是一个 30B 参数、采用 Apache 2.0 许可证的模型,旨在优化端到端代理任务完成、可靠工具使用和多步推理。作者 Simon Willison 在本地使用 LM Studio 和 llm-coding-agent 插件进行了测试,认为该模型大小适合在 32GB 以上内存的机器上运行,并展示了其
OneEmo是一个统一的多模态情感推理模型,能够处理情感感知、理解和交互任务。研究团队构建了EmoWorld-130K数据集,通过人类参与的工作流程将专业知识转化为推理轨迹,并提出Emo-Chord强化学习策略来优化多任务学习。实验表明,OneEmo在多数基准上达到最先进性能,且参数远少于商业模型。