返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月21日周五 · 20 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示通用智能体架构

NVIDIA 研究项目 AVO 在 ARC-AGI-3 基准测试中取得 100.00 分,完成全部 183 个关卡。AVO 是一种通用智能体架构,通过持久记忆和监督机制支持长时间自主运行,此前已在 GPU 内核优化中展现性能提升。该结果表明,智能体系统的整体架构对模型能力转化为实际进展至关重要。

正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

Google DeepMind:从 Atari 到 EVE,游戏驱动 AI 研究 15 年

Google DeepMind 回顾了其 15 年来在游戏领域的研究历程,从 Atari 到 AlphaGo 再到 SIMA 智能体,并宣布与多家游戏开发商合作,推动 AI 与游戏的融合。SIMA 2 基于 Gemini 模型,能通过屏幕和键鼠操作理解自然语言指令,实现类人游戏表现,有望改变游戏体验和开发方式。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

用eBPF魔法增强AI与API:可观测性与控制

在InfoQ的演讲中,Isovalent(现属Cisco)的Dan Finneran讨论了AI生成代码带来的维护与责任问题,以及AI代理在生产环境中的不可预测行为。他介绍了eBPF作为Linux内核技术,可用于观察和控制AI应用,并提及Kubernetes中正在进行的AI网关标准化工作。演讲展示了基于eBPF的解决方案原型,旨在提升AI系统的可观测性和可控性

正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布

n8n 2.35.7 发布:提升 AI 助手令牌验证限制

n8n 发布了 2.35.7 版本,主要修复了一个核心问题:提高了 AI 助手模型验证令牌的限制。该修复通过 GitHub 提交实现,旨在改善 AI 助手功能的稳定性。

正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移

FastGPT 发布 v4.16.1 版本,主要更新包括:Agent Sandbox 镜像地址改为完整运行态镜像,并支持自定义 apt 源;MCP/HTTP 工具的 JSON Schema 统一为字符串存储,需按顺序执行迁移脚本;新增第三方发布渠道支持多模态文件、音频转录和引用,支持团队安装系统插件(进程模式)。此外,优化了 S3 key 命名、修复了多个工

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Azure DevOps 远程 MCP 服务器正式发布,但暂不支持 Claude、ChatGPT 或 Cursor

微软已将 Azure DevOps 远程 MCP 服务器正式发布,为 AI 助手提供托管端点以访问工作项、拉取请求、仓库和管道,无需安装。然而,Claude Desktop、Claude Code、ChatGPT 和 Cursor 等客户端目前无法连接,原因是微软 Entra 身份验证不支持动态 OAuth 客户端注册或客户端 ID 元数据文档。微软正在与

正文结构化主题已通过公开置信门槛
量子位产品发布

明略科技携手海康机器人亮相世界机器人大会,布局具身智能

明略科技与海康机器人联合参展2026世界机器人大会,展示餐饮清洁、工业物流、智能巡逻等商业服务场景的具身智能解决方案。明略科技正式布局具身智能赛道,其CEO吴明辉在大会主论坛发表演讲,强调机器人下半场的关键是“大脑”,并计划通过开源平台Octo实现人机协同的组织智能。此次合作旨在将数字世界的Agent能力延展至物理世界机器人,推动商用服务机器人的规模化应用。

正文结构化主题已通过公开置信门槛
量子位产品发布

雷鸟iO发布:轻至34g,全天候主动式AI眼镜

雷鸟创新发布全新雷鸟iO系列AI眼镜,主打轻至34g的日常佩戴设计、两天续航及全天候主动式AI功能,支持DeepSeek V4 Pro等大模型,并强调隐私保护。该产品定价1996元起,旨在推动AI眼镜从尝鲜品走向大众日常使用。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

明略科技吴明辉:机器人下半场需要两个大脑,开源连接人机协同

明略科技CEO吴明辉在2026世界机器人大会主论坛发表演讲,提出机器人进入生产系统需要个体大脑和组织大脑两个维度,并强调与海康机器人合作,通过开源Octo平台连接机器人与Agent,推动具身智能在服务业落地。他还提出AI原生组织的L1到L5演化路径,并呼吁行业拥抱开源。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

亚信携手火山引擎:TRAE助力企业级AI研发规模化落地

亚信科技与火山引擎合作,通过TRAE IDE在企业内部实现AI Coding的规模化落地,已部署6000+席位,AI编码贡献率达32%,SDLC整体提效15%。双方构建了涵盖知识工程、智能体矩阵和数据闭环的解决方案,并推出Token ERP实现AI成本治理。该合作验证了企业级AI研发的落地路径,为大型企业AI转型提供了可复制的标杆。

正文结构化主题已通过公开置信门槛
量子位产品发布

深势科技发布玻尔·科学空间,AI科学家接管科研全流程

深势科技发布了玻尔·科学空间公开测试版,这是一个面向科研人员的桌面端AI协同环境,旨在将文献调研、实验设计、计算模拟、结果分析和论文撰写等科研全流程自动化。该平台集成了SciMaster、BioMaster、PharmMaster、MatMaster等AI专家,并连接超过2亿篇文献和5万个科学计算工具,使科学家只需提问和确认,AI负责执行具体任务。此举有望显

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

阿里财报揭示AI商业化:云和芯片成最大赢家

阿里最新财报显示,阿里云营收达487.37亿元,同比增长45%,经调整EBITA同比增长133%,利润率升至11.6%。增长主要来自AI算力需求激增和MaaS收入增加,同时自研芯片出货和全栈优化提升利润。阿里全栈AI布局使其在商业化中更具优势,云厂商成为AI浪潮中的受益者。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.16.0 发布:支持自托管 Ask AI 并修复多项问题

Langfuse 发布了 v4.16.0 版本,主要新增了 Ask AI 对自托管部署的支持,扩展了注册归因分析到 LinkedIn、Reddit 和 X,并改进了会话过滤和代理运行指标。修复了多个问题,包括代理步骤截断、BullMQ 任务重试、MCP 占位符消息支持等。此外,移除了 LangChain 和 LangSmith 依赖,并增强了 Sentry

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.33.0 修复 Anthropic SDK 兼容性问题

PydanticAI 发布 v2.33.0 版本,修复了因 Anthropic SDK 1.0.0 基于 httpx2 重构而导致的兼容性问题。此前版本允许安装 anthropic 1.0.0 但运行时失败,新版本要求并支持 anthropic =1.0.0,并改用 httpx2 客户端。用户若需保留旧版 pydantic-ai,应固定 anthropic<

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

幻觉作为特征而非缺陷:多智能体架构将推测性语言模型输出转化为可测试科学假设的评估

本文提出一种基于Rust的多智能体架构,通过将高熵生成代理与基于网络搜索的评估代理分离,利用“认识论摩擦”将语言模型的幻觉输出转化为可测试的科学假设。实验表明,直接提示效果最差,但完整系统并不总是优于简单自我反思,其优势主要体现在假设需满足强物理、经验或制度约束时。研究强调,受控的推测性生成只有在架构、经验基础和显式评估的约束下才有价值。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

行为系统需要行为测试:AI智能体评估新视角

本文提出,随着AI智能体系统日益成为与动态环境交互的行为系统,现有评估方法仅关注性能结果而忽视行为过程,因此需要借鉴行为科学的方法,通过系统观察、扰动和解释来评估AI行为。作者建议开发严格的行为测试,包括从动作序列中恢复决策策略、构建隔离行为差异的环境以及探测多智能体系统中的涌现动态,并呼吁建立AI行为科学。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

评估上下文协议(ECP):AI代理评估的可移植契约

本文提出评估上下文协议(ECP),一个早期、供应商中立的框架,旨在为AI代理系统提供可移植的评估契约层。ECP定义了一个JSON-RPC接口,代理通过它暴露用户可见输出、工具调用和审计上下文,并支持跨框架和CI系统的统一程序化检查。论文还提供了包含LangChain、LlamaIndex、CrewAI和PydanticAI适配器的开源参考实现,并指出该协议是

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

奖励引导自回归图生成实现高效多智能体通信拓扑设计

RGA-Designer 是一种受 RLHF 启发的奖励引导自回归图生成方法,用于高效设计多智能体通信拓扑。它训练一个联合捕捉任务正确性和结构紧凑性的奖励模型,并以此微调预训练图生成器,在保持 ARG-Designer 任务准确率的同时,平均减少约 30% 的 token 消耗。该方法在六个基准上验证了有效性,代码已开源。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于证据的多智能体系统用于生物机器人高层设计

本文介绍了一个基于Qwen3.5-27B构建的离线多智能体系统micro biorobot agent,用于生物机器人高层设计。该系统通过共享工作空间协调约二十个专业组件,集成23,762条证据库,实现需求分析、模块检索、候选组装、冲突检查和独立评审。在50个查询的评估集上,系统平均得分7.35和8.04,为七种系统中最高,且源跟踪检查将虚假缺口从15降至3

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

将聚合移动统计蒸馏为语言模型策略用于赛后人群模拟

该研究提出一种方法,通过微调语言模型智能体,使人群模拟中的目的地分布与从聚合移动数据中观测到的OD流一致。研究者使用迭代比例拟合和重采样校正训练数据,避免了主导类别的过度膨胀。在棒球比赛数据上的实验表明,该方法将目的地份额误差降低了25%,且无需推理时校正。