多智能体推理用于说话人关系推断
该论文提出一种无需训练的多智能体推理框架,用于从口语对话中推断说话人之间的关系。框架包含两种设计:多角色多智能体辩论(MRMAD)为智能体分配互补角色或社会理论视角;多智能体竞争(MAC)通过成对裁决比较假设并淘汰较弱候选。在 Seamless Interaction 数据集上的实验表明,这些方法在多数情况下优于零样本和现有多智能体基线,但声学线索仍未被当前
技术方向 · 模型推理能力的进展:思维链、推理模型、数学与逻辑基准 · 共 189 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文提出一种无需训练的多智能体推理框架,用于从口语对话中推断说话人之间的关系。框架包含两种设计:多角色多智能体辩论(MRMAD)为智能体分配互补角色或社会理论视角;多智能体竞争(MAC)通过成对裁决比较假设并淘汰较弱候选。在 Seamless Interaction 数据集上的实验表明,这些方法在多数情况下优于零样本和现有多智能体基线,但声学线索仍未被当前
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-4B-Thinking 仓库,将 Qwen 的 40 亿参数稠密视觉语言模型 Qwen3-VL-4B-Thinking 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LL
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-8B-FP8 模型仓库,将 Qwen3-8B-FP8 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LLM 运行。该模型为 8.2B 稠密模型,支持思考/非思考模式切换、工具调
webAI 官方发布了基于 SmolLM3-3B 的 3B 规模形式逻辑推理模型 TwIL-LM3,通过 LoRA 微调、检查点融合、WiSE-FT 和 GRPO 强化学习训练。该模型在领域内形式逻辑任务上相对基座提升 26%,同时保持甚至提升泛化基准性能,在多项指标上超越参数规模更大的模型。模型采用非商业许可,支持 GGUF 量化,可在低资源环境运行。
智东西报道了一款名为Omen Alpha的匿名模型,该模型在OpenCode调用量榜单中排名第七,以超高性价比和快速开发能力著称。实测显示,Omen Alpha具备视觉能力,能快速完成前端开发、游戏开发和3D建模,但在逻辑推理方面表现不佳,如洗车难题和公务员考试题正确率仅80%。目前该模型仅在OpenCode Go订阅套餐中可用,价格极低。
AhaBench 是一个用于评估语言代理在长时间跨度内能否从先前经验中持续学习的新基准,包含 Aha-Puzzle、Aha-Euler 和 Aha-Vending 三个组件。该基准通过初始分数、经验后分数和学习提升三个指标来区分模型的初始能力、利用显式支持的能力以及持久改进的能力。在八模型评测中,Claude Opus 4.6 在经验后总分上领先(64.3)
DavidAU 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF,这是一个基于 Qwen3.8 27B 的多阶段微调模型,采用 COLD FUSION 和 Fable Fusion 711 训练方法,显著减少思考 token 数量
TechCrunch 发布了一份 AI 术语表,用通俗语言解释 AGI、AI agent、API 端点、思维链、计算、深度学习、扩散模型等常见术语,并提及 OpenAI 新模型 Astra 的“不透明递归”推理技术引发安全担忧。该术语表旨在帮助从业者、投资者和普通读者跟上快速演进的 AI 词汇,并会定期更新。
本文提出 LARK(Latent-Aligned Reasoning frameworK),一种用于多模态推荐的两阶段潜在推理框架,旨在解决视觉-语言模型在多步推理中视觉和文本信号逐渐衰减的“跨模态稀释”问题。LARK 在第一阶段将可学习潜在标记与思维链推理交错,并与冻结的视觉编码器对齐;第二阶段通过桥接 MLP 和对比学习生成嵌入,并将中间特征与思维链隐藏
SelfDR 是一个面向 LLM 推荐系统的自蒸馏框架,通过将模型自身推理增强的预测蒸馏为直接推荐结果,在保持推理效率的同时提升推荐效果。该框架基于同一基础 LLM 构建教师和学生模型,教师通过训练推理器生成高质量理由,学生则通过动态加权策略学习。在三个公开数据集上的实验验证了其有效性、合理性和效率。
字节跳动旗下Seed团队发布Seedream 5.0 Lite图像生成模型,相比4.0版本在理解、推理和生成能力上全面提升,并引入实时搜索增强功能。该模型采用统一多模态架构,能更好地理解用户意图和世界知识,适用于信息可视化、视觉推理等场景。目前已在Dreamina AI和火山方舟体验中心上线。
OpenAI 发布了其迄今最强大的模型 GPT-6 Astra,并宣称其可能已接近或达到 AGI 水平。该模型在逻辑推理、数学、软件工程等多项基准测试中大幅超越前代 GPT-5.6 Sol 及 Anthropic 的 Fable 系列。Astra 将首先通过 Daybreak 计划向特定组织开放,随后向 ChatGPT 付费用户及云平台提供。尽管 token
另有 2 家信源报道
OpenAI于周四发布了其最新AI模型Astra,号称迄今最强大、能力最全面,在计算机和浏览器使用方面开辟新前沿。该模型首先面向Daybreak网络安全计划的客户提供,随后将向Pro、Plus等付费用户及API开放。OpenAI强调其安全性和对齐能力,并宣称Astra是当前最强的软件工程模型,但因其采用不透明递归推理技术而引发争议,该技术可能削弱对模型推理过
Anthropic 的 Claude Fable 5.1 成功破解了自 1653 年以来一直未被解开的数字谜题“Cyphral Distich”,该谜题由 Thomas Urquhart 爵士出版。Vals AI 称,Fable 5.1 在无人协助的情况下于 44 分钟内解决了该谜题,而其他前沿模型均未能给出可验证的解决方案。该模型通过系统性的试错和坚持,从
PRO-Step 提出了一种面向检索增强生成(RAG)的步骤级过程奖励优化框架,通过训练生成式过程奖励模型(PRM)同时评估每一步的逻辑有效性和证据支撑,并利用 PRM 引导的价值树搜索构建偏好对,结合步骤级直接偏好优化(DPO)来训练策略模型。实验表明,该方法在五个单跳和多跳问答基准上取得了最佳的平均 EM 和 F1 分数,代码、模型和训练数据已公开。
该综述研究了自动驾驶中从文本思维链到基于动作的推理的转变,提出以中间表示形式为中心的分类法,将130种方法分为语言、视觉空间、潜在动态和外部化推理四类及13个子类型。分析表明,自动驾驶推理的前沿在于可落地于真实世界、与实时动作耦合且可在安全关键系统中验证的中间表示。
据The Information报道,OpenAI的新模型Astra将采用一种名为“循环深度”(又称“不透明循环”)的推理技术,该技术使模型在循环中处理查询,可能使思维链更难监控,引发AI安全专家的担忧。Redwood Research CEO Buck Shlegeris和AI安全倡导者Zvi Mowshowitz等专家公开表示忧虑,认为该技术可能破坏思维
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,基于六周内第三次 Flash 更新。3.8 Flash 在软件工程、智能体任务和多步推理上显著提升,定价与 3.7 Flash 相同;3.8 Flash Cyber 专攻网络安全,具备漏洞发现和自动修补能力,通过 Fairwind 计划提供
FuriosaAI 发布了 Solar-Open-100B-NVFP4A16,这是对 Upstage 的 Solar-Open-100B 模型进行 NVFP4A16 量化后的版本,并提供了在 FuriosaAI RNGD 硬件上运行的 Furiosa Executable Bundle。该模型支持推理和工具调用,可通过 Furiosa-LLM 服务器以 Op
EULER 是一个多智能体数学发现系统,以跨领域桥接为搜索单元,通过直接、相邻领域和远距离领域三条竞争路线探索猜想,并利用压力测试和证据返回检查来过滤无效桥接。在 120 个近期猜想上,EULER 产生了 10 个证明、3 个反例和 45 个部分结果,消融实验表明桥接特定压力测试和可执行操作增益是成功的关键。该系统展示了跨领域转移在数学发现中的价值,并强调了