返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2397 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月11日周五 · 20 条
正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ORCH:组织原则赋能具身AI集体智能

研究提出 ORCH(Organizing Roles and Coordination Hierarchies)框架,将人类组织理论中的池化与顺序依赖原则操作化,用于组织大规模异构具身智能体。在 25 个野火响应任务中,使用 8 个大语言模型评估最多 50 个异构智能体,ORCH 组织在任务结果、执行效率、探索和计算资源使用上均优于四种代表性具身多智能体方法

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

子智能体与智能体技能:面向长周期任务的可复用知识执行

该论文研究如何让语言模型智能体有效利用可复用知识库解决长周期任务。作者对比了两种执行方式:将技能指令加载进主上下文的 agent skills,以及将技能包作为子智能体(subagent)在独立上下文中执行。在 SkillsBench 基准上,当技能包具有清晰输入输出契约并编码程序性知识时,子智能体执行显著优于 agent-skill 执行,代价是额外的通信

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

合成数据之殇:LLM智能体技能检索中的灾难性遗忘

该研究针对LLM智能体在34,396个技能库中的技能检索问题,发现使用合成数据微调虽能提升分布内检索,却会导致在真实和分布外(OOD)数据上的灾难性遗忘。作者评估了嵌入锚点正则化、LwF、EWC和L2初始化等持续学习方法,结果显示这些方法不仅保留了OOD检索性能,还将0.6B Qwen检索器和重排器的合成分布内检索提升了13.98%。研究提供了实用基准和针对

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

计算与合作的共同演化:自创生博弈论

该研究提出「自创生博弈论」(Autopoietic Game Theory),将社会互动、复制机制及其计算成本建模为内生且共同演化的过程。作者在随机初始化的 Z80 机器码环境中嵌入 STEAL 指令,把社会困境直接写入计算的物理机制中,发现资源稀缺时背叛会自我限制,演化出的程序会抑制偷窃行为,空间分布还能促进结构复杂性与任务表现。研究由 Google Pa

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体LLM系统用于临床问诊训练评估

研究团队开发了一个面向临床问诊训练的脚手架式多智能体LLM系统(AI标准化病人),包含病人智能体、导师智能体和回合级评估智能体。在100名医学生的随机对照试验中,多智能体脚手架条件相比结构化非LLM对照组提升了最终考试成绩,尤其在沟通、共情表达和病史采集行为上改善显著,但诊断准确率无显著差异。团队还发布了多专家标注数据集以支持后续研究。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向可信系统的生成式AI:健康检查模型

该论文基于对电信、汽车、国防、航空、银行、能源、政府和软件服务等八个行业十八位资深从业者的访谈,提出「可信自主性健康检查模型」。该模型用八个维度(系统层的智能体权限范围、保障机制、数据可信度、架构遏制、可追溯性与可理解性;组织层的治理、人类监督姿态、劳动力能力可持续性)和四种信任范式(运营、工程、统计、遏制)取代传统单维成熟度模型。作者强调模型是诊断性而非规

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

OpenDiscoveryTrace:评估 AI 科学家工作流的过程轨迹数据集

研究者发布 OpenDiscoveryTrace,首个公开的 AI 科学智能体过程轨迹数据集,包含 558 条完整轨迹,覆盖 7 个模型和 124 个科学任务。每条轨迹记录 9 字段的逐步推理过程(思维、工具调用、观察、错误、修正触发、置信度等),而非仅最终输出。初步分析显示,三个前沿模型成功率相近(84–89%),但错误类型差异显著:Claude Opus

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

AI智能体如何运行城镇经济?100个LLM智能体的26周模拟研究

研究团队在真实博卡拉湖畔地理环境中构建了一个由100个带记忆的LLM智能体组成的封闭、货币守恒的空间经济系统,运行长达26个模拟周(远超同类研究1-2周),共91次有效运行、244万次决策、215亿token。结果显示货币传导在到达企业后停止:12%的旅游需求冲击使企业收入上升4.62,但工资仅变动1.03,仅0.3%的菜单项被重新定价;随机现金转移后96.

正文结构化主题已通过公开置信门槛
量子位商业

量子位启动MEET2027智能未来大会,年度榜单征集进行中

量子位正式启动以「智行合一,驭见未来」为主题的MEET2027智能未来大会,这是该系列大会的第八年,将于2026年12月在北京举办。大会将聚焦智能体、具身智能与机器人、AI Infra与算力、世界模型等年度议题,并同步发布2026人工智能年度榜单及《2026年度AI十大趋势报告》。榜单从企业、产品、人物三大维度评选五类奖项,结果将在大会上公布。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

支付宝阿宝接入携程同程等酒旅商家,小米超级小爱跨端协同落地

在2026 Inclusion·外滩大会上,蚂蚁集团CEO韩歆毅宣布支付宝“阿宝”将推出智能体激励政策,连接用户需求与开发者、商家供给。携程、同程、锦江、粗门、大麦等酒旅及演出头部商家集体接入阿宝,黄山、万岁山等景区也陆续接入,覆盖出行、住宿、周边游、演出等场景。小米超级小爱首次公开与阿宝跨端协同,用户可通过语音办理生活服务,标志生活服务向全链路智能化升级。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

2026蚂蚁InTech奖揭晓:申报量增近4倍,三年投1亿扶持创业

2026蚂蚁InTech奖在外滩大会揭晓,10位青年科学家获科技奖(每人20万元),10位中国籍在读博士生获奖学金(每人5万元)。本届聚焦AGI、具身智能、数字医学、数据处理与安全隐私四大方向,申报量较首届增长近4倍。蚂蚁集团同时宣布未来三年投入1亿元扶持获奖者创业项目。

正文结构化主题已通过公开置信门槛
量子位商业

OpenAI被曝用千禧年难题刷Benchmark,下一道或为霍奇猜想

《纽约时报》追访披露OpenAI与纽约大学数学家Tristan Buckmaster围绕纳维-斯托克斯方程证明的争议细节,包括OpenAI更新用户数据说法、提出多种合作方案但要求排除Anthropic员工Levent Alpöge。OpenAI随后宣布在另一道千禧年难题上取得实质性进展,传闻指向霍奇猜想,可能由内部代号Aeon的模型完成。事件反映OpenAI

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

Google 提出 ToolGrad:用文本梯度高效生成工具使用数据集

Google Research 在 ACL 2026 发表 ToolGrad,一种「答案优先」的工具使用数据集生成框架:先生成工具调用链,再反向标注用户查询,并借鉴 TextGrad 的「文本梯度」迭代构建复杂 API 工作流。基于 ToolBench 的 1.6 万+ API 生成 ToolGrad-500 数据集,微调 Gemma-3(1B/4B/12B

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Slack 推出 Surfaces:可在聊天中用 AI 生成交互式图表和报告

Slack 推出新功能 Slackforce Surfaces,用户可在聊天中通过描述需求让 Slackbot 用 AI 从相关对话及 Google Drive、Salesforce 等已连接应用收集信息,生成交互式报告、投票、仪表盘、演示文稿和微型网站。生成的 Surface 可分享、固定到频道并支持评论互动。该功能面向所有启用 Slackbot 的客户(

正文结构化主题已通过公开置信门槛
OpenAI Agents JavaScript Releases一手来源开源

OpenAI Agents JavaScript v0.18.0 发布

OpenAI 发布 openai-agents-js v0.18.0,主要变更包括 Docker 文件 API 迁移至容器内运行、UnixLocalSandboxClient 新增可选的 fileIOProtection 文件保护选项,以及 imageGenerationTool() 支持 action 参数(generate/edit/auto)。此外还修

正文结构化主题已通过公开置信门槛
Google ADK Python Releases一手来源开源

Google ADK Python v2.9.0 发布:模型自动故障转移与 LiveKit 语音支持

Google 发布 ADK Python v2.9.0,重点提升智能体韧性并扩展生态集成。新版本引入 FallbackModel 实现主模型出错时自动故障转移,新增 LiveKit runner 支持语音与电话智能体,并支持从 YAML 声明式配置加载 ADK 2.0 图工作流。此外,该版本兼容 MCP SDK 2.x(默认仍解析 1.x),并包含工作流节点

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog商业

Shopify 移动端未来回归原生开发

Shopify 宣布其移动端未来将回归原生开发,从 React Native 迁回独立的 Swift 和 Kotlin 代码库。Shopify 表示,2020 年转向 React Native 是为了避免重复开发、让开发者跨栈工作并减少功能对齐成本,而如今 AI 代理已能承担足够的实现、翻译、测试和审查工作,使双平台维护成本不再是决定性因素。Shopify

正文结构化主题已通过公开置信门槛
TechCrunch AI安全

Anthropic 指控阿里、Moonshot AI 和 DeepSeek 发起蒸馏攻击

Anthropic 发布报告,指控阿里巴巴、Moonshot AI 和 DeepSeek 等中国 AI 公司对其 Claude 模型发起蒸馏攻击,以提取思维链能力。报告称观察到近 2 亿次相关交互,分属五个行动,其中阿里巴巴相关行动规模最大,达 1.51 亿次交互,疑似用于训练 Qwen 系列模型。Anthropic 还称 Moonshot AI 的部分请求

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Tiel-Coder-35B-A3B-GGUF:面向编程的量化 MoE 模型发布

Hugging Face 用户 peculiar-ragdoll 发布了 Tiel-Coder-35B-A3B-GGUF,这是对 ornith-ai/Ornith-1.5-35B-A3B 进行动态 imatrix 量化并内置 Sharp 聊天模板的 GGUF 版本,面向 agentic coding 与多轮对话。在 SWE-bench-Live 上 25 题

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Tiel-Coder-35B-A3B GGUF 量化版发布,主打本地智能体编程

Hugging Face 用户 peculiar-ragdoll 发布了 Tiel-Coder-35B-A3B-GGUF-MTP,这是对 ornith-ai/Ornith-1.5-35B-A3B 进行动态 imatrix 量化并内置 Sharp 聊天模板的 GGUF 版本,支持 MTP 投机解码。在 SWE-bench-Live 的 25 道题中修复 12