返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月21日周五 · 16 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

石油工程师学会实践社区虚拟成员ATHENA:从原型到部署

本文介绍了为石油工程师学会(SPE)开发的虚拟助手ATHENA的演进过程,从原型到部署。ATHENA旨在支持油气行业实践社区的知识捕获、检索和传播,通过智能体检索、经验知识捕获和主动传播三大核心能力,帮助用户完成井规划等知识密集型任务。初步评估显示,与基于Claude Haiku 3.0的RAG基线相比,ATHENA使专家任务得分提高152%,生产力提高28

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

AI推理智能体的合谋风险要求市场决策认证

本文是一篇立场论文,认为具有思维链推理能力的AI智能体容易表现出合谋行为,应在影响经济市场决策前获得行为认证。实验使用DeepSeek-R1智能体在Bertrand寡头定价领域发现隐性合谋倾向,即使人类提示不要合谋也持续存在,且思维链可被引导至极端合谋或竞争行为而无法被其他LLM语义检测。作者认为部署推理智能体进行市场决策会导致合谋经济结果而无共谋证据,因此

正文结构化主题已通过公开置信门槛
量子位产品发布

墨奇智能WRC展示15分钟长程家务,MoRA架构主打Agentic-Native

墨奇智能在WRC 2026上展示了自研具身智能模型架构MoRA和轮式机器人MORPHI KINO,现场完成了15分钟的家居长程任务,包括桌面整理、冰箱补货和衣物洗烘折叠。MoRA采用Agentic-Native路线,将目标持续性、多层级记忆和进度认知内化为策略模型的原生能力,以解决传统分层架构中System 1执行能力不足的问题。公司强调数据质量重于数量,已

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

ASU魏华:大模型智能体重蹈强化学习覆辙,需跨越仿真到现实鸿沟

亚利桑那州立大学助理教授魏华在IJCAI 2026上指出,大模型智能体面临的脆弱性与强化学习中的“仿真到现实”差距本质相同,并提出了将域随机化等技术应用于大模型以提升鲁棒性。实验表明,经域随机化处理的3B参数模型在跨语言任务上可击败32B模型。魏华还强调了不确定性量化与人类在环的重要性,呼吁建立共通评估标准。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.32.2 发布:多项 bug 修复

PydanticAI 发布了 v2.32.2 版本,主要包含多项 bug 修复:修复了 pydantic evals 任务中异步可调用实例的等待问题、实时会话中 RunContext.cancel() 的问题、识别 m.youtube.com 的 VideoUrl、规范化 DeepSeek Responses 函数调用重放,以及让废弃的 TemporalAg

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

EnvHarness:唤醒静态世界以促进智能体学习

EnvHarness 提出了一种可编程插件层,通过动态重塑静态环境来针对智能体的弱点进行强化学习共进化。EnvRigger 将目标策略视为黑盒,通过观察执行轨迹合成组件并验证。在四个领域的五个基准测试中,EnvHarness 优于原始环境和领域特定的环境生成流程,在保留实例上实现了最高 9.0 分的提升,并减少了 9.8% 的执行步骤。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

中科大博士创立灵犀智涌 推ROSS Harness破工业具身落地困局

中科大机器人博士段逸凡在上海创立具身智能公司灵犀智涌,推出第一代工业具身Harness系统ROSS,采用“模型+Harness”架构解决工业具身智能落地难题。该系统已在第二届世界人形机器人运动会亮相,旨在将模型能力转化为稳定可控的工业生产能力。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

ChatGPT 推出 Apple Messages 插件,可代发短信

OpenAI 推出了适用于 Apple Messages 的 ChatGPT 插件,允许用户将消息收件箱与 ChatGPT 连接,以便排序、分析、编辑、删除、起草和发送消息。该插件还支持 Codex 和 ChatGPT Work,可用于专业场景。尽管 OpenAI 声称插件在本地运行且不创建消息索引,但隐私问题仍引发关注。

正文结构化主题已通过公开置信门槛
Latent Space产品发布

Matt Pocock 发布 /wayfinder 技能,助力 AI 代理在模糊规划中导航

Latent Space 发布了对 Matt Pocock 的访谈,介绍其新技能 /wayfinder,旨在帮助用户和 AI 代理在项目目标不明确时进行规划,通过分拆任务、原型制作和研究来管理上下文。Pocock 强调使用精确术语(如地图、票据、会话)来引导代理理解信息流,并已将其应用于工程和课程规划等场景。该技能基于“战争迷雾”概念,允许逐步决策,提升代理

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Runlayer与Rippling互撤诉讼,MCP网关之争成创始人警示

Runlayer 与 Rippling 于周三晚互相撤销诉讼,未达成和解或赔偿。Rippling 随即发布了其 MCP 网关产品,该产品是争议核心,与 Runlayer 竞争。此事件对创始人构成警示:在 AI 时代,竞争对手可能来自潜在客户。Rippling 借此进入 AI 网关和安全市场,与 Stripe、Docker 等竞争。

正文结构化主题已通过公开置信门槛
智东西商业

广州AI营销公司钛动科技获新一轮融资,深耕ChatGPT广告优化

广州AI营销公司钛动科技宣布完成新一轮融资,由华泰泛大西洋基金领投,资金将用于钛极专业大模型和Navos多智能体等AI技术研发。公司已成为ChatGPT Ads首批官方技术合作伙伴,并推出GEO解决方案,测试显示客户ROI提升至2.5倍。此前公司已递交港交所上市申请,2025年前9个月营收同比增长74.5%。

正文结构化主题已通过公开置信门槛
智东西产品发布

百度APP升级:办公Agent免费,搜索交互化

百度在AI Day上发布多项产品升级,包括百度搜索的GUI交互组件、文心老师教育功能升级,以及文心助手任务引擎2.0,后者从信息搜集到交付全流程免费。同日谷歌也发布类似功能,显示传统搜索引擎正通过AI和Agent技术进行转型。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock AgentCore 支持自然语言编写 Dogwood 策略

AWS 在 Amazon Bedrock AgentCore 中扩展了 Policy 功能,支持用自然语言编写 Dogwood 策略,并自动转换为正式规范。新功能支持时间约束、工具调用顺序和 Guardrails 集成,帮助团队在代理系统中实施治理控制。文章通过银行客服代理示例展示了策略转换过程。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源研究

扩展代理式AI:避免供应商锁定的企业模式

AWS 机器学习博客发布文章,探讨企业在多框架、多模型、多提供商的“多一切”环境中扩展代理式 AI 系统的架构模式,强调通过分离控制平面与执行平面、统一可观测性、集中治理等原则避免供应商锁定,并指出 Amazon SageMaker 在模型生命周期管理中发挥基础作用。文章基于企业实践,提出了管理复杂性的实用准则,旨在帮助 ML 团队在保持灵活性的同时实现规模

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出基于 Bedrock AgentCore 的多智能体框架加速云迁移

AWS 专业服务团队构建了一套基于 Amazon Bedrock AgentCore 的多智能体框架,用于加速企业云迁移。该框架包含四个智能体,覆盖从自动发现、基础设施即代码生成到迁移后主动运维的完整生命周期,将单个应用的 IaC 开发时间从 3-4 周缩短至分钟级。框架使用 Strands Agents SDK 和 MCP 工具,并通过 AgentCore

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出向量解决方案,助力代理式 AI 数据检索

AWS 发布了向量解决方案,旨在支持代理式 AI 应用,通过将向量搜索集成到现有数据存储中,避免数据迁移。该方案覆盖多种服务,如 OpenSearch、S3、Aurora 等,并提供决策模型帮助用户选择。此举可提升检索准确性,降低延迟和成本,推动代理式 AI 的落地。

8月20日周四 · 4 条
正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK 5.0.241 发布:修复流对象与工具执行问题

Vercel AI SDK 发布 5.0.241 版本,包含三项修复:拒绝 streamObject 结果承诺并在提供者流错误时报告失败完成;启用 ignoreIncompleteToolCalls 时过滤初步工具输出;当模型调用以不安全完成原因结束时阻止自动工具执行。这些修复增强了 SDK 的稳定性和安全性。

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK 6.0.260 发布:修复流式对象与工具执行问题

Vercel AI SDK 发布 6.0.260 版本,包含多项修复:拒绝 streamObject 结果承诺并在提供者流错误时报告失败完成;启用 ignoreIncompleteToolCalls 时过滤初步工具输出;当模型调用以不安全的结束原因结束时,阻止自动工具执行。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源产品发布

Mistral 发布 Agentic Search,提升复杂文档检索准确率

Mistral AI 发布了 Agentic Search,一种多步骤检索工具,使 AI 系统能够导航、阅读和验证复杂文档中的信息。在 FinanceBench 和 OfficeQA Pro 基准测试中,它显著提高了准确性(FinanceBench 上从 26.7% 提升至 86%),同时降低了延迟和 token 消耗。该工具通过 Mistral Searc

正文结构化主题已通过公开置信门槛
THE DECODER观点

前沿雷达:中国AI模型逼近,西方领先还剩什么?

THE DECODER 的 Frontier Radar 第四期指出,中国 AI 模型如 Kimi K3 和 GLM-5.3 已接近美国顶尖模型水平,西方实验室指责中国通过蒸馏和刷分追赶,但模型领先优势难以维持。西方在抽象测试、可靠性和前沿领域仍有优势,但整体领先已转向系统层面。文章还提到欧洲在 AI 竞赛中落后。