评估分布式系统中智能体代码修复能力的新基准 DDBench
DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。
本文分析了多种深度研究代理(DRA)的推理轨迹,发现它们常出现“推理停滞”问题,即多数迭代对最终性能贡献甚微,且代理缺乏对自身轨迹的感知。为此,作者提出无监督信号和检索感知代理控制器(RAAC),帮助代理在每步选择最优动作,减少不必要的搜索调用并提升性能。在BrowseComp-Plus等基准上,RAAC平均减少14次搜索调用,准确率最高提升10%,平均提升
ETHOS 是一个为临床多智能体系统设计的模块化伦理框架,以治理元代理的形式集成到现有系统中,无需改变其底层架构。它通过分层治理(确定性检查、上下文审查和最终伦理批评)在运行时持续评估中间推理步骤和最终输出,以识别伦理风险、请求修订或抑制不符合安全标准的响应。在肝病学临床决策支持系统中的演示表明,ETHOS 通过检测不完整、不一致或超出范围的证据,并在无法支
该论文提出将保险作为AI风险基础设施,通过转移和吸收AI采用中的残余财务风险,以促进企业采用AI工具。作者开发了基于LLM的智能体社会模拟系统(LABSS),模拟300天内企业在有无保险情况下的AI采用决策。结果显示,有保险时AI最终采用率从74.97%提升至84.38%,破产企业数从4.33降至1.33,总资本更高。该框架通过风险池补偿严重AI相关损失,减
阿里云在韩国第三座数据中心正式上线,并推出Agentic AI相关服务,以满足当地AI及云计算需求。本轮扩建后,阿里云全球基础设施覆盖30个地域、104个可用区,并计划拓展至巴西。阿里云在亚太云计算市场排名第一,Qwen模型家族全球下载量超20亿次,衍生模型超30万个。韩国AI公司Gendive和Naver旗下Zepeto已采用阿里云相关服务。
清华团队创立的清昴智能专注于AI自进化Infra,通过AI优化AI技术提升国产算力效率,将复杂算子开发周期从两周压缩至约1小时,模型适配周期从一个月降至1天至1周。公司已适配数十款国产芯片,并基于此打造日均万亿级Token工厂,提供Token售卖和平台输出两种商业模式。
OPPO软件工程事业部总裁唐凯在支付宝AI生态合作伙伴大会上指出,当前Agent发展的结构性矛盾是模型能力已超过产业链的组织能力,尽管开发To C Agent产品不难,但形成商业闭环仍面临服务和生态孤岛问题。OPPO与支付宝合作构建AHA协议,实现端侧可信互联,已打通近200个常用功能,覆盖18个数字民生服务场景,为支付宝带来数百万日活增量。
VibeWorlding 是一个用于基准测试和训练多模态智能体的统一框架,旨在从用户查询端到端构建交互式 3D 开放世界。该框架包含 VWE-BENCH 基准(含 2,616 个 3D 资产、323 个种子世界和 6,828 个查询)和 VibeWorlding-Gym 强化学习训练环境。实验表明,当前前沿多模态大模型(如 GPT-5.5 和 Qwen3.8
支付公司 Stripe 以 70 亿美元收购 AI 模型路由平台 OpenRouter,交易在 90 天前其 13 亿美元 B 轮融资后完成。OpenRouter 年化收入 1.4 亿美元,毛利率约 70%,月处理 250 万亿 token,拥有 800 万开发者。该交易凸显模型聚合层的价值,但也引发对中间层利润压缩的担忧。
AI 自动化初创公司 Relay 宣布关闭,其创始人兼 CEO Jacob Bank 将重返谷歌,担任 Chrome 产品副总裁。Relay 的付费用户服务将于 9 月 14 日停止,免费用户已于 8 月 15 日失去访问权限。Bank 表示将把 AI 集成到 Chrome 中,以帮助用户更高效地完成任务。
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStar
SpaceXAI推出了Grok Bot,这是一个由持久化AI代理组成的系统,运行在专用云计算机上,能够与网站、应用、收件箱等工具交互,执行多步骤任务并在需要审批时返回给用户。与专注于编码的代理不同,Grok Bot旨在处理跨业务应用的更广泛工作流,支持并行运行多个代理、代理间通信以及通过共享线程交换上下文。该系统源自内部原型,用于销售、营销、运营和软件开发等
千问办公开源了首个项目MyContext,这是一个个人工作上下文基础设施,旨在从飞书和钉钉等工具中自动提取聊天、文档和会议记录,构建个人工作档案,供AI Agent调用。项目上线一周多已在GitHub获得超1k星,目前处于开发者预览阶段,存在安装门槛和功能限制。MyContext通过多步流程处理数据,强调数据主权和用户控制,但实际运行中仍有图谱生成失败等问题
AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinba
Grab 使用 AI 代理自动化分析工作流,将分析师处理的机械工单占比从 44% 降至 30%,并缩短了回答业务问题的时间。该公司采用五级自主模型,在保留人工监督的同时,让代理负责数据发现、查询执行和结果验证。Grab 还开发了 Spartan、Scarlet 和 ContextIQ 等系统,以支持自然语言分析、管道故障修复和上下文管理。
Import AI 第469期介绍了三个AI研究进展:DiG-bench基准测试通过70个游戏评估AI在未知环境中的发现能力,结果显示Opus 5和Fable 5表现最佳但远未达到人类水平;Paradigm Research发布了一个模拟递归自我改进的浏览器游戏;AI初创公司Inherent发布了论文,介绍其构建的AI科学家模型Faraday,用于监督前沿模
本文探讨了将代理型适应度函数(agentic fitness functions)扩展到进化式架构中,以处理那些无法通过确定性规则判断的架构问题。作者认为,确定性适应度函数应继续作为可测量不变量的主要执行机制,而代理型适应度函数则适用于证据充分但依赖判断的架构风险,如边界保真度、语义契约漂移等。文章强调,生产级实现应分离确定性门禁与代理型咨询信号,并采用版本
雷峰网报道了WorkBuddy升级其“资料库”功能,使普通用户能用自然语言生成、编辑和发布HTML页面,并支持CSV数据联动和多人协作。作者通过制作书影音世界地图和处理长播客文本两个案例,展示了HTML作为AI办公新载体的潜力,并探讨了知识沉淀与持续使用的重要性。文章还引用了“HTML is the new Markdown”的观点,指出机器需要结构、人需要
美团LongCat团队构建了MineExplorer评测基准,用于系统评估多模态大模型在开放世界中的长程任务能力。该基准包含813个人工验证的实例,通过隐藏前置条件、知识解耦和多智能体数据合成等创新设计,揭示了当前顶级模型在动态世界中感知强于推理、多跳任务成功率骤降等能力断层。评测显示最强模型Claude-Opus-4.6整体成功率仅41分,导航失败是主要错
美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。