NTDH:面向综合情感分析的复杂推理方法
arXiv 论文提出 NTDH 方法,将综合情感分析重构为复杂推理问题,通过自然化、容差感知门控、领域感知策略和方向性提示解决推理轨迹合成中的对齐与失败案例问题。使用 Qwen3-8B 模型,结合 SFT 和 GRPO 训练,仅用 16,302 条训练记录(比同类系统少约 14 倍),在六个官方测试指标中的五个上优于 SFT 基线,并在 EI-reg 任务上
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
arXiv 论文提出 NTDH 方法,将综合情感分析重构为复杂推理问题,通过自然化、容差感知门控、领域感知策略和方向性提示解决推理轨迹合成中的对齐与失败案例问题。使用 Qwen3-8B 模型,结合 SFT 和 GRPO 训练,仅用 16,302 条训练记录(比同类系统少约 14 倍),在六个官方测试指标中的五个上优于 SFT 基线,并在 EI-reg 任务上
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。
Antim Labs 发布了 Among AIs 社交推理基准测试,让 LLM 玩《Among Us》游戏。作者从六个日志文件重建了游戏引擎和地图,并用六个小型开放模型运行了 90 局游戏。结果显示,这些模型能推理欺骗但无法执行,船员胜率高达 80%。作者还开源了重建工具和模拟器。
雷峰网AI科技评论通过分析IJCAI-ECAI 2026的论文阵容,验证了南京大学俞扬教授关于IJCAI在推理、规划、知识方向最顶级的判断。数据显示,该会议在推理、规划、知识方向的论文占比约20.8%,且杰出论文奖多次花落此领域。文章介绍了多篇相关论文,如NDProp、AESAT、DUPLEX等,展示了符号推理与神经方法融合的趋势。
arXiv 上发布了一篇题为“Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models”的论文。论文指出,大型语言模型在推理任务中的失败往往源于中间步骤的局部推理错误,而非整体能力不足。作者提出了一种名为 Woodpecker Distillation 的弱到强
该研究提出一个框架,在不简化模型架构或类比物理系统的情况下,为大型语言模型的思维链推理寻找统计规律和理论解释。他们将推理建模为线索图上的引导发现过程,利用平均场近似推导出已发现线索比例的常微分方程。实验通过学生模型对教师模型输出的归一化惊讶值识别线索标记,并跨多条推理链平均获得统计规律,结果显示这些规律在同一数据集内可复现,并能用所提出的理论方程拟合。
本文提出UniME-R1框架,用于统一多模态检索。该框架通过嵌入器-顾问架构,基于初始检索结果生成检索中心思维链(RC-CoT),以解决LVLM检索器忽略细粒度判别线索的问题。实验表明,UniME-R1在MMEB-V2等多个基准上优于强基线。
ChronoVision是一个多模态框架,旨在通过潜在状态重建提升多步时间推理能力。它采用重建视觉头和ROI注意力定位模块进行监督微调,并在后训练中应用强化学习。在Vbvr-VQA数据集上达到74.8%域内和71.6%域外准确率,在IntPhys2上达到55.0%。
arXiv 上发布了一项关于视频问答的新研究,提出了动态潜在推理(DyLaR)方法。该方法先通过感知潜在状态定位问题相关的视觉证据,再自适应决定是否在潜在空间中进行推理,从而避免冗长的文本思维链。在九个视频基准和四个多模态语言模型上的实验显示,DyLaR 在提升准确率的同时大幅减少了生成的 token 数量,例如在 Qwen3-VL-4B 上将平均准确率从
Simon Willison 发布了 LLM 0.32,这是该项目自启动以来最重要的版本,新增了对推理轨迹、OpenAI Responses API、服务端工具和内容寻址日志的支持。该版本还引入了新的模型(如 GPT-5.6 系列)和 Python API 改进,包括流式事件和消息列表参数。同时,llm-anthropic 等插件也获得了重大更新,增加了 W
NVIDIA发布开源34B参数视觉-语言-动作模型Alpamayo 2 Super,用于加速自动驾驶开发。该模型结合Cosmos 3 Super Reasoner与扩散Action Expert,支持轨迹生成、推理、元动作预测及自动标注。在LingoQA基准上排名第一,超越多个更大模型。模型权重已开源,采用Linux基金会许可。
NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。
LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。
CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。
该研究提出了一种名为CSCR(反事实敏感度信用重分配)的方法,用于改进长思维链推理中的强化学习。研究发现,在GRPO等无评论家方法中,特权信息引起的token似然偏移往往集中在可替换的表面形式token上,无法可靠指示正确的优化方向。CSCR通过减少对高敏感度token的信用并重新归一化token级优势,在数学推理基准上持续优于GRPO基线。
Meta 推出 Muse Spark,这是 Meta Superintelligence Labs 开发的首个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。该模型在 meta.ai 和 Meta AI 应用中可用,并开放了私有 API 预览。Muse Spark 在多项任务上表现强劲,其 Contemplating 模式通过并行多智能体推理,在
Meta 发布了更新后的高级 AI 扩展框架,扩大了风险评估范围,并引入新的安全与准备报告。针对 Muse Spark 模型,Meta 进行了广泛的安全评估,确认其具备前沿的意识形态平衡能力,且不具备自主失控风险。Meta 还改进了模型安全推理方法,通过基于原则的训练提升对新场景的应对能力。
ManniX-ITA 发布了 Qwen3.6-27B-Omnimerge-v4 的 GGUF 量化版本,基于 Qwen3.6 基础模型与三个微调模型的 DARE-TIES 合并,并采用 MLP-passthrough 技术以规避 Qwen3.6 的推理标签脆弱性。该模型在 HumanEval、MBPP 和 GPQA 基准上表现优于前代 Omnimerge-v
arXiv 上发布了一篇题为 ThinkReset 的论文,提出了一种用于有界上下文长时推理的可学习中间接口构建方法。该方法通过接口写回和重置,直接优化重置后的继续求解成功率,解决了长思维链推理中的冗余累积、上下文溢出和错误锚定问题。实验表明,在多个长时推理基准上,该方法在固定上下文窗口下持续提升了成功率。
该论文提出状态知识学习(SKL)方法,使大语言模型代理从轨迹级反思转向维护显式的、基于状态的预测性知识。通过自蒸馏(SKL-SD)和强化学习(SKL-RL)两种算法,训练代理自主提取状态基础预测知识并用于决策。在WebShop、ScienceWorld和ChessPuzzles等交互环境中的实验表明,该方法显著优于当前基于反思的训练范式。