Claude Fable/Mythos 5.1 发布:缓存降价但成本上升
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
另有 1 家信源报道
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2398 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
另有 1 家信源报道
腾讯WorkBuddy于9月2日正式上线开放平台,首批引入超百家生态伙伴,成为国内首个同时打通硬件、应用与开发者三层生态的Agent基座。平台已接入智能眼镜、录音卡片等十余个品类超30个品牌,并发布9款联名硬件及30余个行业应用,覆盖金融、法律、医疗等领域。同时面向开发者开放Skill、Expert、Connector三大能力,并计划建设支付与分发通路。腾讯
另有 2 家信源报道
9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。孙鹏拥有十余年强化学习与智能体研究经验,曾主导开发字节核心强化学习基础设施ByteRL,并参与大模型RLHF与预训练。他的加入将强化星尘智能在机器人强化学习方向的布局,与AI模型、具身OS和绳驱机器人本体形成
阿里云于9月2日公测企业级人与Agent协作平台“万有无界”,支持多角色Agent协作,可调用旗舰模型Qwen3.8-Max。平台提供项目空间、群聊协作、PMO Agent等功能,强调组织记忆与资产归属企业,并开放Agent接入与技能市场。该平台旨在提升企业AI协作效率,覆盖多行业场景。
LangChain 发布了 1.4.0a4 预发布版本,主要围绕 MCP(Model Context Protocol)适配器进行重构和功能增强,包括支持 ClientGroup 作为目标、简化 MCPAdapter 构造、引入 LangGraph 中断机制处理 MCP 请求等。同时修复了多个中间件问题,并增加了对标准模型异常类型和 LangSmith 提供
SilentProbe 研究测量了生产 API 作为 LLM 代理工具时的静默失败问题。通过审计 2501 个 OpenAPI 文档和 721320 个参数,发现 40.1% 的文档在 schema 中未编码约束,导致代理无法区分空结果与未理解的查询。实验表明,机器可检查的约束在 111 次中全部返回诚实错误,而纯文本约束在 61 次中有 44 次静默失败。
GUI-CC 是一个用于评估 GUI 世界模型作为智能体环境时上下文一致性的基准测试。它包含离线轨迹和在线智能体循环两个轨道,基于 GUIOdyssey 构建了 500 个离线任务和 200 个在线任务。实验表明,当前模型在单步生成上表现合理,但在多步环境中难以保持任务相关上下文,导致智能体陷入看似合理但无效的状态。该基准强调了从单步预测到多步环境模拟评估的
arXiv 论文提出 EpisodeSim,一种混合 LLM 智能体架构,通过经典 AI 脚手架(如世界主控器)维护场景、脚本、义务和结束条件,以增强 LLM 社交智能体的情节连贯性。实验表明,仅靠 LLM 的局部流畅性不足以模拟完整社交场景,而经典 AI 风格的控制层能显著提升模拟质量。该研究强调将经典 AI 的结构化表示与 LLM 的生成能力结合,为社交
HyperWorld 研究通过对比四种信息等价的文本状态序列化方式(原始观察、独立句子、成对三元组、超边单元),发现超边序列化能显著提升小语言模型(0.5B-1.5B)在文本世界中的效果预测和分布外鲁棒性,并在规划任务中取得最高成功率。该研究为学习符号世界模型提供了高阶结构作为廉价归纳偏置的证据。
arXiv 论文提出 Dreams,一种用于对话推荐系统(CRS)的双节点树结构上下文建模框架。Dreams 通过蒙特卡洛树搜索(MCTS)进行偏好 elicitation,并使用 LLM 将偏好状态转化为结构化检索查询以实现 exploitation。实验证明其在基准数据集上优于现有方法,代码已开源。
arXiv 论文提出 Agentic Cloud Workflow Engineering 框架,将自然语言云工程任务转化为代码仓库和云部署,通过图工程、循环工程和零信任代理框架实现工作流推进、故障恢复与验证。框架在 Google Cloud 上验证,执行以可验证部署或可审计失败终止。该框架统一了 Agentic DevOps、CloudOps、SRE 等云
该论文对MCP客户端在收到失败结果后能否自主决策进行了审计研究。作者提出一个六部分的可操作性分析框架,通过对21个真实失败案例的分析发现,类型化字段能暴露失败但很少提供具体原因、修复目标或重试策略,而文本描述包含更多信息但需要语义解释。论文还展示了一个故障关闭原型,表明需要额外的控制平面来支持确定性分支。研究结论是,MCP的完成结果通常使失败可观察,但很少使
本研究构建了一个确定性工具使用环境,通过脚本化 oracle 策略和故障注入器,对五种 LLM 裁判(包括仅看结果的裁判、步骤评分裁判等)在 400 条轨迹上的表现进行了评估。结果显示,仅看结果的裁判对静默故障的召回率仅为 45%,且会误报 33% 的正确轨迹;而步骤评分裁判在零误报的情况下达到了 77% 的静默召回率。研究还发现,自一致性集成成本增加三倍但
该论文对11个生产级编码代理的源码进行了系统解剖,定义了harness工程学科,并识别出7个子系统和29种设计模式。研究发现,所有系统均未使用通用代理框架或向量检索,而SKILL.md技能采用率超过MCP。论文指出,到2026年上半年,编码harness已从工具转变为平台,并提出了18条设计建议。
EULER 是一个多智能体数学发现系统,以跨领域桥接为搜索单元,通过直接、相邻领域和远距离领域三条竞争路线探索猜想,并利用压力测试和证据返回检查来过滤无效桥接。在 120 个近期猜想上,EULER 产生了 10 个证明、3 个反例和 45 个部分结果,消融实验表明桥接特定压力测试和可执行操作增益是成功的关键。该系统展示了跨领域转移在数学发现中的价值,并强调了
RAPIDMap 是一个由 Texas A&M University 提出的多智能体管道,用于从卫星和街景图像中快速生成可解释的灾害地图。该系统通过四个智能体(DPA、IRA、DRA、DMA)实现零样本灾害识别、图像恢复、损伤识别和空间映射,无需人工标注或微调。研究在多种灾害场景中验证了其泛化能力,旨在提升灾害响应的速度和准确性。
该研究提出一种受控基准测试,让LLM通过逐步调用工具执行MD5哈希计算,以评估其长时程状态跟踪能力。实验表明,gpt-oss-120b模型在多数运行中能正确完成全部步骤,且当用另一个LLM替代所有原始工具时,驱动-工作模型对也能从零计算哈希。成功的关键在于将模型自身推理保留在上下文中,并对工作模型采用多数投票机制。
OPPO联合OpenKG社区及浙江大学、同济大学、东南大学等高校推出行业首个端侧AI记忆评测基准MobileMem,旨在为端侧AI记忆能力提供统一评测标准。该基准覆盖长期事件建模、跨模态推理和持续个性化适应等维度,数据集规模达百万词元,并已发布技术白皮书,后续将开源相关工具。此举有助于推动端侧AI记忆技术的标准化和生态发展。
百融智能发布2026年中报,总收入下降但AICC业务同比增长52%,新场景收入增长195%。公司推出硅基员工,在物流和券商场景中部署,采用按结果收费的RaaS模式,并计划通过技术重构型AI Roll-up战略扩大业务。
Anthropic发布了Claude Fable 5.1和Mythos 5.1模型,在8项基准测试中排名第一,价格最高降低45%。新模型在科学研究和代码任务上表现突出,并引入了反蒸馏机制,通过签名验证防止思维链被篡改。此外,Mythos 5.1在蛋白质设计、金星地形图生成和GPU加速等科研应用中展示了显著成果。