返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月18日周二 · 14 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

评估分布式系统中智能体代码修复能力的新基准 DDBench

DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

检索感知代理控制器缓解深度研究代理的推理停滞

本文分析了多种深度研究代理(DRA)的推理轨迹,发现它们常出现“推理停滞”问题,即多数迭代对最终性能贡献甚微,且代理缺乏对自身轨迹的感知。为此,作者提出无监督信号和检索感知代理控制器(RAAC),帮助代理在每步选择最优动作,减少不必要的搜索调用并提升性能。在BrowseComp-Plus等基准上,RAAC平均减少14次搜索调用,准确率最高提升10%,平均提升

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ETHOS:面向临床多智能体系统的模块化伦理框架

ETHOS 是一个为临床多智能体系统设计的模块化伦理框架,以治理元代理的形式集成到现有系统中,无需改变其底层架构。它通过分层治理(确定性检查、上下文审查和最终伦理批评)在运行时持续评估中间推理步骤和最终输出,以识别伦理风险、请求修订或抑制不符合安全标准的响应。在肝病学临床决策支持系统中的演示表明,ETHOS 通过检测不完整、不一致或超出范围的证据,并在无法支

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

保险作为AI风险基础设施:生成式智能体模拟AI采用

该论文提出将保险作为AI风险基础设施,通过转移和吸收AI采用中的残余财务风险,以促进企业采用AI工具。作者开发了基于LLM的智能体社会模拟系统(LABSS),模拟300天内企业在有无保险情况下的AI采用决策。结果显示,有保险时AI最终采用率从74.97%提升至84.38%,破产企业数从4.33降至1.33,总资本更高。该框架通过风险池补偿严重AI相关损失,减

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

阿里云韩国第三座数据中心上线,推出Agentic AI服务

阿里云在韩国第三座数据中心正式上线,并推出Agentic AI相关服务,以满足当地AI及云计算需求。本轮扩建后,阿里云全球基础设施覆盖30个地域、104个可用区,并计划拓展至巴西。阿里云在亚太云计算市场排名第一,Qwen模型家族全球下载量超20亿次,衍生模型超30万个。韩国AI公司Gendive和Naver旗下Zepeto已采用阿里云相关服务。

正文结构化主题已通过公开置信门槛
量子位产品发布

清华团队AI优化AI,打造国产万亿Token工厂

清华团队创立的清昴智能专注于AI自进化Infra,通过AI优化AI技术提升国产算力效率,将复杂算子开发周期从两周压缩至约1小时,模型适配周期从一个月降至1天至1周。公司已适配数十款国产芯片,并基于此打造日均万亿级Token工厂,提供Token售卖和平台输出两种商业模式。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

OPPO唐凯:模型能力超产业链组织能力,与支付宝共建AHA协议

OPPO软件工程事业部总裁唐凯在支付宝AI生态合作伙伴大会上指出,当前Agent发展的结构性矛盾是模型能力已超过产业链的组织能力,尽管开发To C Agent产品不难,但形成商业闭环仍面临服务和生态孤岛问题。OPPO与支付宝合作构建AHA协议,实现端侧可信互联,已打通近200个常用功能,覆盖18个数字民生服务场景,为支付宝带来数百万日活增量。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

VibeWorlding:多模态智能体端到端构建 3D 开放世界的统一框架

VibeWorlding 是一个用于基准测试和训练多模态智能体的统一框架,旨在从用户查询端到端构建交互式 3D 开放世界。该框架包含 VWE-BENCH 基准(含 2,616 个 3D 资产、323 个种子世界和 6,828 个查询)和 VibeWorlding-Gym 强化学习训练环境。实验表明,当前前沿多模态大模型(如 GPT-5.5 和 Qwen3.8

正文结构化主题已通过公开置信门槛
Latent Space商业

Stripe 70 亿美元收购 OpenRouter,AI 路由层价值重估

支付公司 Stripe 以 70 亿美元收购 AI 模型路由平台 OpenRouter,交易在 90 天前其 13 亿美元 B 轮融资后完成。OpenRouter 年化收入 1.4 亿美元,毛利率约 70%,月处理 250 万亿 token,拥有 800 万开发者。该交易凸显模型聚合层的价值,但也引发对中间层利润压缩的担忧。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

AI 自动化初创公司 Relay 关闭,创始人加入谷歌 Chrome 团队

AI 自动化初创公司 Relay 宣布关闭,其创始人兼 CEO Jacob Bank 将重返谷歌,担任 Chrome 产品副总裁。Relay 的付费用户服务将于 9 月 14 日停止,免费用户已于 8 月 15 日失去访问权限。Bank 表示将把 AI 集成到 Chrome 中,以帮助用户更高效地完成任务。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart

AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStar

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

SpaceXAI推出Grok Bot:面向自主AI代理的持久化多代理系统

SpaceXAI推出了Grok Bot,这是一个由持久化AI代理组成的系统,运行在专用云计算机上,能够与网站、应用、收件箱等工具交互,执行多步骤任务并在需要审批时返回给用户。与专注于编码的代理不同,Grok Bot旨在处理跨业务应用的更广泛工作流,支持并行运行多个代理、代理间通信以及通过共享线程交换上下文。该系统源自内部原型,用于销售、营销、运营和软件开发等

正文结构化主题已通过公开置信门槛
智东西开源

千问办公开源MyContext:从飞书钉钉蒸馏个人工作档案

千问办公开源了首个项目MyContext,这是一个个人工作上下文基础设施,旨在从飞书和钉钉等工具中自动提取聊天、文档和会议记录,构建个人工作档案,供AI Agent调用。项目上线一周多已在GitHub获得超1k星,目前处于开发者预览阶段,存在安装门槛和功能限制。MyContext通过多步流程处理数据,强调数据主权和用户控制,但实际运行中仍有图谱生成失败等问题

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体自动交易

AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinba

8月17日周一 · 6 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering商业

Grab 用 AI 代理将机械分析工作从 44% 降至 30%

Grab 使用 AI 代理自动化分析工作流,将分析师处理的机械工单占比从 44% 降至 30%,并缩短了回答业务问题的时间。该公司采用五级自主模型,在保留人工监督的同时,让代理负责数据发现、查询执行和结果验证。Grab 还开发了 Spartan、Scarlet 和 ContextIQ 等系统,以支持自然语言分析、管道故障修复和上下文管理。

正文结构化主题已通过公开置信门槛
Import AI研究

Import AI 469:科学AI、RSI模拟器与扎克伯格的技术悲观主义

Import AI 第469期介绍了三个AI研究进展:DiG-bench基准测试通过70个游戏评估AI在未知环境中的发现能力,结果显示Opus 5和Fable 5表现最佳但远未达到人类水平;Paradigm Research发布了一个模拟递归自我改进的浏览器游戏;AI初创公司Inherent发布了论文,介绍其构建的AI科学家模型Faraday,用于监督前沿模

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

代理型适应度函数:将进化式架构扩展到确定性规则之外

本文探讨了将代理型适应度函数(agentic fitness functions)扩展到进化式架构中,以处理那些无法通过确定性规则判断的架构问题。作者认为,确定性适应度函数应继续作为可测量不变量的主要执行机制,而代理型适应度函数则适用于证据充分但依赖判断的架构风险,如边界保真度、语义契约漂移等。文章强调,生产级实现应分离确定性门禁与代理型咨询信号,并采用版本

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

WorkBuddy升级资料库:HTML成为AI办公新载体

雷峰网报道了WorkBuddy升级其“资料库”功能,使普通用户能用自然语言生成、编辑和发布HTML页面,并支持CSV数据联动和多人协作。作者通过制作书影音世界地图和处理长播客文本两个案例,展示了HTML作为AI办公新载体的潜力,并探讨了知识沉淀与持续使用的重要性。文章还引用了“HTML is the new Markdown”的观点,指出机器需要结构、人需要

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

MineExplorer评测基准揭示多模态大模型在动态世界中的能力断层

美团LongCat团队构建了MineExplorer评测基准,用于系统评估多模态大模型在开放世界中的长程任务能力。该基准包含813个人工验证的实例,通过隐藏前置条件、知识解耦和多智能体数据合成等创新设计,揭示了当前顶级模型在动态世界中感知强于推理、多跳任务成功率骤降等能力断层。评测显示最强模型Claude-Opus-4.6整体成功率仅41分,导航失败是主要错

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源开源

美团开源LoHoSearch:基于知识图谱的下一代搜索智能体评测基准

美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。