Mastra 发布高级追踪查询、租户级删除及 Factory 看板更新
Mastra 发布 2026 年 9 月 9 日更新,核心亮点包括:新增高级追踪查询契约及 ClickHouse、DuckDB、Postgres 实现;支持租户级追踪删除与级联清理;为工作流控制流块添加元数据;Agent 频道新增 onAction 处理器;Factory 自定义看板成为一等公民。同时包含多项破坏性变更,涉及 @mastra/factory
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2397 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Mastra 发布 2026 年 9 月 9 日更新,核心亮点包括:新增高级追踪查询契约及 ClickHouse、DuckDB、Postgres 实现;支持租户级追踪删除与级联清理;为工作流控制流块添加元数据;Agent 频道新增 onAction 处理器;Factory 自定义看板成为一等公民。同时包含多项破坏性变更,涉及 @mastra/factory
OpenAI 关联账号宣称,其 AI 系统在约 1 万个智能体协作下,于 88 小时内解决了纳维-斯托克斯千年难题中的有限时间奇点问题,耗资超 4000 万美元,涉及 1300 亿 token。该方法基于多智能体强化学习和并行测试时计算,但未提供定理陈述或证明细节,数学界尚未验证。该事件引发关于 AI 研究能力与计算规模的热议。
蚂蚁集团百灵发布首个金融增强开放模型Ling-3.0-flash-Fin,该模型基于Ling-3.0-flash打造,具备124B总参数和256K长上下文,重点强化信息检索、研究推理、估值建模和研报撰写四项能力,旨在打通完整投研工作流。同时,蚂蚁百灵开源了金融搜索Agent评测基准FinFIRST,并开放模型权重和API体验。该模型在多个金融基准上表现优于部
Dart 提出了一种基于有向无环图(DAG)的声誉与激励机制框架,结合区块链治理,用于可信的 LLM 多智能体协作。该框架统一了 DAG 工作流编排、能力与声誉感知的任务分配、动态行为更新、多因素激励以及智能合约问责与 IPFS 存储。实验表明,Dart 在 GSM8K 上达到 93.6% 的 Pass@1,在 150 轮纵向试验中平均任务成功率为 93.3
MERIT 基准测试评估了工具使用型 LLM 代理中长期记忆的边际效用,通过 23,440 个带成本核算的片段发现,记忆可将依赖任务的成功率从 0 提升至 0.55-1.00,但嵌入检索在更新事实时表现不稳定,而结构化事实存储和 LLM 摘要等更新时写入的记忆更稳健。研究还表明,记忆实现的选择可导致任务成功率相差 60 个百分点,且完整重放不经济。该基准、测
SimTIO是一个基于仿真的多智能体大语言模型框架,用于组合式交通干预优化。该框架通过模拟未修改的SUMO场景生成瓶颈证据,由三个专家智能体基于仿真反馈选择参数细化方案,并在有限仿真预算内搜索兼容干预组合。在15个城市-种子案例中,SimTIO将Top-10瓶颈时间损失和网络范围延误降低了2.78%,在86.7%的案例中找到可行改进方案,优于基线方法。该框架
AutoFyn 是一种受专家迭代算法启发的智能体框架,通过持久化状态而非模型权重来适应冻结模型,每轮从全新上下文开始,仅通过显式接口引入持久信息。在 2026 年国际数学奥林匹克六道新题上,AutoFyn 使所有可改进模型的得分均高于其提供商的编码智能体;在 Spider 2.0 dbt 基准上构建了排名第一的智能体,并在 Next.js、MetaMask
本文综述了生成式AI(GenAI)和大语言模型(LLM)对需求工程(RE)未来的影响。作者认为,随着通用软件工程智能体的普及,实现成本降低,工程重心将从编写代码转向需求表达、验证与评估。文章回顾了AI在RE中的历史、LLM的最新进展(如提示编程和通用SE智能体),并预测RE实践将转向操作化规范与智能体指令。该研究旨在帮助RE研究者调整未来研究重点。
AhaBench 是一个用于评估语言代理在长时间跨度内能否从先前经验中持续学习的新基准,包含 Aha-Puzzle、Aha-Euler 和 Aha-Vending 三个组件。该基准通过初始分数、经验后分数和学习提升三个指标来区分模型的初始能力、利用显式支持的能力以及持久改进的能力。在八模型评测中,Claude Opus 4.6 在经验后总分上领先(64.3)
该研究提出一种基于目标导向需求工程(GORE)的MS-RGR机制,用于在智能体AI系统设计阶段建模和模拟安全自主性,通过结合认知遗憾和认知意外两种信号,解决安全自主性的三难问题(常规自主、反思推理或升级至人类)。在老年护理和自动驾驶两个工作流领域的随机模拟中,MS-RGR将静默失败率降至接近零,风险检测速度比传感器基线快约17.5倍,并通过LTL安全属性保持
arXiv 论文提出 capmas 架构,用于多智能体系统中的安全权限委派。该架构结合基于对比学习的语义范围划分管道与 Macaroon 令牌,实现离线、防篡改的委派,并减少不必要的权限。相比 OAuth 2.0 Token Exchange,capmas 的委派操作快 30 倍,延迟降低 2 倍,带宽使用减少 3 倍,语义范围划分在 17 毫秒内实现超过
CaseWeaver是一个多智能体框架,用于生成多模态虚拟临床病例。它基于时间线锚定的潜在临床病例图(LCCG)组织患者背景、疾病轨迹和模态证据,通过模态智能体生成临床记录、实验室结果、生理信号和医学图像。评估显示,CaseWeaver在临床可推断性和病例多样性上优于通用模型和智能体工作流基线。
该研究提出了GAMPO框架,基于321篇文献综合,用于设计受治理的自生成目标AI代理组织。在CHI-Bench医疗基准上的实验表明,治理收益受模型剩余能力限制:弱模型上完整程序无效甚至有害,而一句“验证写入”提示使pass@1翻倍;前沿模型上,基于案例的答案盲完成定义比通用程序更有效,将预授权成功率从40%提升至68%(单次)或84%(五次自洽)。研究为探索
蚂蚁国际的研究团队提出Code2Skill,一种从大规模代码库自动合成智能体技能(skill)的流水线。该方法通过排序、抽象和基于LLM的重建验证,将可复用的代码实现转化为带证据的技能记录,以支持智能体在推理时检索和执行。该工作旨在为通用和专用智能体提供可扩展、可验证的技能知识来源,弥补基于轨迹和文档方法的不足。
本研究对五个公开AI技能仓库的873次提交、143个技能文件和254次实质性编辑进行了纵向分析,发现所有编辑均由具名人类账户完成,其中62%带有AI合著者标记,表明技能维护目前是“人类主导、AI辅助”的循环,而非自主流程。研究还发现多数编辑为内容增补和修正,但规则相似性编码因可靠性不足而失败。作者发布了语料库、编码手册和重放协议,以支持自动化技能维护系统的评
NeoHorse-1 通过智能路由、结构化反馈循环和基于课程的知识蒸馏进行智能体后训练,以提升模型在智能体基准上的能力。该系统结合异构模型池与智能路由,将交互记录转化为训练示例,并采用三阶段课程和路由引导的在线蒸馏。在11个基准上,4B模型宏平均从58.94提升至64.87,9B模型从65.60提升至69.04,缩小了4B与9B模型间的差距。该工作为递归自我
SkyProduction(天工工作台)宣布第二期限免活动,9月9日至14日期间,MiniMax H3模型限时免费无限使用,首日会员免费,后续新开会员或充值积分可获赠限免天数。该模型支持文生视频、多模态参考和原生音画生成,旨在降低短剧、广告等创作者的试错成本。活动由昆仑万维旗下平台推出,并整合了剧本生成、翻译、出海改编等创作工具。
LiteLLM 发布 v1.102.0-dev.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项功能更新,如策略引擎支持流式响应的后调用护栏、MCP 服务器 OAuth 中继发现、Mistral 文本转语音支持,以及多项修复和优化。
OpenAI 宣布其智能体解决了千禧年大奖难题之一的纳维-斯托克斯存在性与光滑性问题,但该成果因被指控使用了 NYU 数学家 Tristan Buckmaster 和 Anthropic 员工 Levent Alpöge 的未署名工作而陷入争议。OpenAI 否认了这些指控,但事件凸显了前沿 AI 公司在数学研究中的角色以及学术合作规范的挑战。
另有 1 家信源报道
Claude Code 2.1.266 修复了 2.1.265 引入的回归问题,该问题影响 LLM-gateway 和代理设置。此前,未记录的 CLAUDE CODE USE GATEWAY 环境变量在 2.1.265 中会单独强制 Cloud-gateway 登录,导致与 API 密钥等配置冲突,请求失败。新版本中该变量单独设置时再次被忽略,无需更改配置。