研究人员发现漏洞可读取ChatGPT等AI模型的加密推理
安全研究人员发现了一个影响所有主要AI提供商API的漏洞,可以读取推理模型的加密思维过程。通过越狱,他们使用较小的模型转录更强大模型的原始推理,并在公开会话中暴露了密码和API密钥。该漏洞还加剧了关于推理蒸馏的争议,并揭示了模型内部使用难以理解的语言或考虑欺骗行为。
另有 1 家信源报道
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 40 条
安全研究人员发现了一个影响所有主要AI提供商API的漏洞,可以读取推理模型的加密思维过程。通过越狱,他们使用较小的模型转录更强大模型的原始推理,并在公开会话中暴露了密码和API密钥。该漏洞还加剧了关于推理蒸馏的争议,并揭示了模型内部使用难以理解的语言或考虑欺骗行为。
另有 1 家信源报道
Hugging Face 每日论文介绍了一项名为 BDH-CQ 的研究,该研究将上下文学习与循环潜在推理相结合,提出了一种 150M 参数的推理模型。该模型在 ARC-AGI-1 基准上达到了 29.5% 的 pass@2 准确率,每任务推理成本仅为 0.0007 美元,突破了该基准的成本-精度帕累托前沿,树立了新的成本效率标杆。
本文提出一个形式化框架,用于从多元结构理论构建规范解释。结构理论由签名、公理和推理策略组成,其可接受解释族包含所有全局一致的结构结论赋值。作者区分了三种规范化层次:闭包稳定化、全局完成和确定性化,并将非确定性分类为认识论多元性(E型)和结构多元性(S型),其中S型强子类由缺乏共同上界刻画。文章给出了两种规范化机制存在的充分条件,并证明在正非反摄规则下,纯推理
Meta 发布了新的开源模型 Muse Glimmer,这是一个 30B 参数、采用 Apache 2.0 许可证的模型,旨在优化端到端代理任务完成、可靠工具使用和多步推理。作者 Simon Willison 在本地使用 LM Studio 和 llm-coding-agent 插件进行了测试,认为该模型大小适合在 32GB 以上内存的机器上运行,并展示了其
Hugging Face 发布了 Sci-VBench,一个用于评估科学领域视频生成的基准,包含 1253 个专家标注示例,覆盖自然科学、医疗、人文社科和工程四个学科。该基准采用基于规则的评估协议,发现非专家和 MLLM 评审与专家判断高度一致。对 16 个前沿模型的评估显示,视觉质量分数接近,但提示遵循和科学因果正确性差异显著,且闭源模型优于开源模型。
SPOT 是一种用于在线蒸馏(OPD)的新方法,通过稀疏探测和结果校准目标来改进推理性能。它解决了标准 OPD 中教师不确定性分布不均和局部概率无法预测下游成功的问题。实验表明,在多个学生模型和推理基准上,SPOT 相比 OPD 和 EOPD 在 Avg@8/Pass@8 指标上均有显著提升。
Hugging Face Daily Papers 发布了一篇题为《Evidence-RL: Towards Evidence-intensive Visual Reasoning》的论文。论文提出了一种名为反事实证据解缠(CED)的训练时证据审计方法,用于增强视觉语言模型(VLM)的接地能力。CED 通过中和对象中心的证据区域并比较支持度下降,结合 GRP
Motif 3 是一个具有 3140 亿总参数、每 token 激活 132 亿参数的解码器专用混合专家语言模型,采用细粒度稀疏 MoE 架构,每层包含 384 个路由专家,每 token 选择 8 个。该模型基于分组差分潜在注意力(GDLA)构建,并整合了流形约束超连接、专家特定 PolyNorm 激活和多 token 预测等技术。模型在约 12.5 万亿
arXiv 论文提出 NTDH 方法,将综合情感分析重构为复杂推理问题,通过自然化、容差感知门控、领域感知策略和方向性提示解决推理轨迹合成中的对齐与失败案例问题。使用 Qwen3-8B 模型,结合 SFT 和 GRPO 训练,仅用 16,302 条训练记录(比同类系统少约 14 倍),在六个官方测试指标中的五个上优于 SFT 基线,并在 EI-reg 任务上
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。
OneEmo是一个统一的多模态情感推理模型,能够处理情感感知、理解和交互任务。研究团队构建了EmoWorld-130K数据集,通过人类参与的工作流程将专业知识转化为推理轨迹,并提出Emo-Chord强化学习策略来优化多任务学习。实验表明,OneEmo在多数基准上达到最先进性能,且参数远少于商业模型。
雷峰网AI科技评论通过分析IJCAI-ECAI 2026的论文阵容,验证了南京大学俞扬教授关于IJCAI在推理、规划、知识方向最顶级的判断。数据显示,该会议在推理、规划、知识方向的论文占比约20.8%,且杰出论文奖多次花落此领域。文章介绍了多篇相关论文,如NDProp、AESAT、DUPLEX等,展示了符号推理与神经方法融合的趋势。
arXiv 上发布了一篇题为“Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models”的论文。论文指出,大型语言模型在推理任务中的失败往往源于中间步骤的局部推理错误,而非整体能力不足。作者提出了一种名为 Woodpecker Distillation 的弱到强
该研究提出一个框架,在不简化模型架构或类比物理系统的情况下,为大型语言模型的思维链推理寻找统计规律和理论解释。他们将推理建模为线索图上的引导发现过程,利用平均场近似推导出已发现线索比例的常微分方程。实验通过学生模型对教师模型输出的归一化惊讶值识别线索标记,并跨多条推理链平均获得统计规律,结果显示这些规律在同一数据集内可复现,并能用所提出的理论方程拟合。
ChronoVision是一个多模态框架,旨在通过潜在状态重建提升多步时间推理能力。它采用重建视觉头和ROI注意力定位模块进行监督微调,并在后训练中应用强化学习。在Vbvr-VQA数据集上达到74.8%域内和71.6%域外准确率,在IntPhys2上达到55.0%。
arXiv 上发布了一项关于视频问答的新研究,提出了动态潜在推理(DyLaR)方法。该方法先通过感知潜在状态定位问题相关的视觉证据,再自适应决定是否在潜在空间中进行推理,从而避免冗长的文本思维链。在九个视频基准和四个多模态语言模型上的实验显示,DyLaR 在提升准确率的同时大幅减少了生成的 token 数量,例如在 Qwen3-VL-4B 上将平均准确率从
Simon Willison 发布了 LLM 0.32,这是该项目自启动以来最重要的版本,新增了对推理轨迹、OpenAI Responses API、服务端工具和内容寻址日志的支持。该版本还引入了新的模型(如 GPT-5.6 系列)和 Python API 改进,包括流式事件和消息列表参数。同时,llm-anthropic 等插件也获得了重大更新,增加了 W
NVIDIA发布开源34B参数视觉-语言-动作模型Alpamayo 2 Super,用于加速自动驾驶开发。该模型结合Cosmos 3 Super Reasoner与扩散Action Expert,支持轨迹生成、推理、元动作预测及自动标注。在LingoQA基准上排名第一,超越多个更大模型。模型权重已开源,采用Linux基金会许可。
NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。
CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。
LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。
ManniX-ITA 发布了 Qwen3.6-27B-Omnimerge-v4 的 GGUF 量化版本,基于 Qwen3.6 基础模型与三个微调模型的 DARE-TIES 合并,并采用 MLP-passthrough 技术以规避 Qwen3.6 的推理标签脆弱性。该模型在 HumanEval、MBPP 和 GPQA 基准上表现优于前代 Omnimerge-v
arXiv 上发布了一篇题为 ThinkReset 的论文,提出了一种用于有界上下文长时推理的可学习中间接口构建方法。该方法通过接口写回和重置,直接优化重置后的继续求解成功率,解决了长思维链推理中的冗余累积、上下文溢出和错误锚定问题。实验表明,在多个长时推理基准上,该方法在固定上下文窗口下持续提升了成功率。
该论文提出状态知识学习(SKL)方法,使大语言模型代理从轨迹级反思转向维护显式的、基于状态的预测性知识。通过自蒸馏(SKL-SD)和强化学习(SKL-RL)两种算法,训练代理自主提取状态基础预测知识并用于决策。在WebShop、ScienceWorld和ChessPuzzles等交互环境中的实验表明,该方法显著优于当前基于反思的训练范式。
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、
Meta 推出 Muse Spark,这是 Meta Superintelligence Labs 开发的首个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。该模型在 meta.ai 和 Meta AI 应用中可用,并开放了私有 API 预览。Muse Spark 在多项任务上表现强劲,其 Contemplating 模式通过并行多智能体推理,在
Meta 发布了更新后的高级 AI 扩展框架,扩大了风险评估范围,并引入新的安全与准备报告。针对 Muse Spark 模型,Meta 进行了广泛的安全评估,确认其具备前沿的意识形态平衡能力,且不具备自主失控风险。Meta 还改进了模型安全推理方法,通过基于原则的训练提升对新场景的应对能力。
该研究提出了一种名为CSCR(反事实敏感度信用重分配)的方法,用于改进长思维链推理中的强化学习。研究发现,在GRPO等无评论家方法中,特权信息引起的token似然偏移往往集中在可替换的表面形式token上,无法可靠指示正确的优化方向。CSCR通过减少对高敏感度token的信用并重新归一化token级优势,在数学推理基准上持续优于GRPO基线。
Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。
另有 1 家信源报道
OpenAI 使用其下一代模型 Astra 的内部版本,在不到 2000 美元(按 GPT-5.6 Sol 代币价格计算)的成本下,解决了十个至少十年未获进展的数学问题。OpenAI 公开了 Lean 4 形式化证明、论文及 LLM 生成的证明重建 PDF,但未透露具体提示词。数学家对此反应不一,有人将其与 Deep Blue 事件类比,数学家 Kirwin
另有 1 家信源报道
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
Mistral AI 发布了 Mathstral,这是一个专为数学和 STEM 领域设计的新模型,基于 Mistral 7B 构建,在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%。该模型旨在支持学术研究,与 Project Numina 合作开发,并可通过 HuggingFace 获取。Mathstral 在推理时增加计算量可显著提
Mistral AI 发布了 Mistral Small 4,这是其 Small 系列的新旗舰模型,首次统一了推理、多模态和智能体编码能力,支持文本和图像输入,并采用 Apache 2.0 开源许可。该模型基于 MoE 架构,总参数 119B,激活参数 6B,上下文窗口 256k,性能相比 Small 3 提升显著,推理延迟降低 40%,吞吐量提升 3 倍。
本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。
Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202
作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。
Berkeley AI Research Blog 发表文章,探讨自适应并行推理作为高效推理扩展的新范式。文章指出,现有并行推理方法(如自一致性、树搜索等)的并行结构由外部决定,而自适应方法让模型自主决定何时分解任务、并行线程数及协调方式。文章分析了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,并强调不同问
阿里通义千问团队发布Qwen3-2507更新,包含Instruct和Thinking两个变体,提供235B-A22B、30B-A3B和4B三种尺寸。新版本在指令跟随、逻辑推理、数学、编程、工具使用及多语言长尾知识等方面显著提升,并支持256K上下文,可扩展至100万token。Thinking版本在推理任务上达到开源思考模型的最先进水平。
DSPy 发布 3.1.0 正式版,将之前的 beta 版本转正。新版本引入了 dspy.Reasoning 以捕获推理模型的原生推理过程,新增 File 类型处理文件数据,并支持 Python 3.14。同时增强了安全防护,防止加载 pkl 文件,并修复了多个 bug,更新了文档和教程。
Lil'Log 发布文章《Why We Think》,回顾了测试时计算和思维链(CoT)在提升模型性能方面的最新进展。文章从人类双过程理论出发,将慢思考类比为测试时计算,并探讨了通过并行采样和顺序修正等解码策略来优化模型输出的方法。文章还提到了强化学习在提升 CoT 推理能力中的应用,并引用了 o1、o3 和 R1 等模型的技术报告。