返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月24日周一 · 20 条
正文结构化主题已通过公开置信门槛
量子位研究

AI科研评价新标准:深度原理联合发布发现回合评估体系

中国AI4S企业深度原理联合微软研究院、斯坦福大学等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,用于系统评价AI在真实科研中的表现。该体系强调全程记录科研决策,并重新定义失败数据的价值。深度原理的MIRA平台已在多个基准测试中取得第一,展示了该评估框架的实践应

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.17.0 发布:新评估体验与 Anthropic 支持

Langfuse 发布 v4.17.0 版本,主要更新包括新的评估用户体验、从 trace 表和事件表创建标注队列、显示任意元数据、迁移 UI 默认显示、支持 Anthropic Messages 作为 Langfuse Assistant 的模型提供商,以及多项修复和优化。该版本还改进了 MCP 清理、评估器模型过滤和监控调度器,并移除了 Assistan

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Agno Releases一手来源产品发布

Agno v3.0.0 发布:重大更新,需数据库迁移

Agno 发布 v3.0.0 重大版本更新,引入工具结果和媒体数据卸载、CodeMode、FinanceTools 等新功能,并重构数据库结构,新增 runs 表以提升性能。该版本还增强了 AgentOS 的持久化后台执行和 Studio 3.0 的治理目录,同时更新了多个模型提供商的默认模型。所有 2.x 用户需在升级前执行数据库迁移。

正文结构化主题已通过公开置信门槛
Agno Releases一手来源产品发布

Agno 发布 v3.0.0a5 版本,修复调度与委派问题

Agno 发布了 v3.0.0a5 版本,包含多项修复和功能改进。主要修复了团队领导委派规则、调度循环、嵌套名册成员 ID 等问题,并新增了 Studio 调度守卫的可选 self dispatch 开关。此外,还修复了请求验证失败时返回 422 错误、评估运行 ID 唯一性等问题。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

Roblox 的 Prompt to Prod:构建自主软件开发的安全基础设施

Roblox 的工程加速团队经理 Andrew Swerdlow 在演讲中介绍了其“Prompt to Prod”计划,旨在通过 AI 代理实现从提示到生产的全自动化软件开发,同时解决代码信任问题。他强调,当前 AI 生成代码的能力已很强,但缺乏信任机制,导致技术债务和安全隐患。Roblox 通过构建对齐、安全防护和访问控制等基础设施,试图在提升自主性的同时

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 更新:实验 API、优雅关闭、多轮评判等

Mastra 发布 2026 年 8 月 21 日更新,引入调用方驱动的实验 API,支持外部编排器(如 Temporal)管理实验循环,同时保持 Mastra 作为记录系统。新增优雅关闭和 HTTP 排空控制,改进会话中“活动期间”消息传递,并增强工作流恢复的并发安全性。还新增多轮 LLM 评判评分器,用于评估多轮对话。

正文结构化主题已通过公开置信门槛
THE DECODER商业

英伟达洽谈投资Perplexity,估值超300亿美元

英伟达正洽谈投资AI搜索公司Perplexity,估值超过300亿美元,较一年前上一轮融资高出50%以上。Perplexity的年化收入从2.5亿美元增至7.5亿美元,部分得益于其AI代理产品“Perplexity Computer”。该投资将巩固英伟达作为AI行业主要财务支持者的地位,其投资资金往往通过购买芯片回流。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

五一视界发布物理AI蓝图,从自动驾驶扩展至机器人与太空

五一视界于2025年12月上市后,在2026年8月发布“物理AI宏伟蓝图2030”,计划从自动驾驶仿真业务扩展至具身智能和空天探索。公司推出AperData和AperOne两款产品,分别解决机器人数据采集与仿真训练问题,并已与多家机器人公司合作。其核心能力是将现实环境数字化,通过仿真、模型和数据闭环支持多种物理AI应用。

正文结构化主题已通过公开置信门槛
量子位产品发布

中诚华隆发布HL200推理芯片及万卡超节点集群

中诚华隆在北京发布HL200推理芯片及超节点智算集群方案,实现从单芯片到万卡集群的体系化突破。HL200支持FP4/FP8超低精度推理,能效比达5.12 TFLOPS/W,兼容主流技术栈,并在DeepSeek V4等模型测试中性能领先。公司同时与多家企业达成战略合作,推动国产推理算力生态建设。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

FINCHAL 金融预测挑战赛:区分运气与技能

Hugging Face 博客宣布举办 FINCHAL 金融预测挑战赛,这是一场 AI 与人类交易员的竞赛,涉及 NVIDIA、比特币、黄金和石油四种资产,总奖金 2000 美元。该竞赛旨在通过随机基准和自检评分代码来区分运气与技能,并允许 AI 代理与人类平等参与。竞赛采用仓位连续值(-1 到 1)的评分机制,并固定杠杆为 1,以避免过度投机。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ornith AI 发布 397B 自改进模型 Ornith-1.5,性能对标 Claude Opus 4.8

Ornith AI 发布了 Ornith-1.5-397B,这是一个 397B 参数的混合专家模型,通过端到端自我改进训练,在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,性能与 Claude Opus 4.8 相当,并优于 GLM-5.2 和 DeepSeek-V4-Flash-0731 等开源模型。该模型

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

PrimeAgentOrchestrator:记忆预置的代理生成系统用于个人AI基础设施

本文介绍了 PrimeAgentOrchestrator (PAO),一个为个人 AI 基础设施设计的系统,能够在启动时从用户的异构记忆后端(PostgreSQL 和 Cloudflare Worker 语义搜索)并行检索相关信息,并通过文件系统注入预加载到新生成的 Claude Code 编码代理中。PAO 管理代理的完整生命周期,包括信任预置、就绪轮询和

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

同行投票压力测试发现LLM智能体词汇趋同但无分布式来源优势

该研究提出PV-SST测试平台,通过448次试验和112个完整块,评估LLM智能体群体在社交反馈下的行为。结果显示,基于同行点赞的排名信息流显著提高了最终帖子的词汇相似度(核心面板平均差异+0.0082 TF-IDF余弦单位),但未发现分布式来源相比单一来源在改变立场上的可靠优势。研究强调其结论仅适用于合成LLM智能体群体,不直接推断人类行为。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

多模态智能体框架的基础与前沿:技术与应用综述

该综述系统分析了多模态智能体框架中感知、推理、规划、记忆和行动等核心模块,并提出了按模态分类的架构分类法。文章回顾了从文本智能体到多模态框架的演变,以及委托、晚期融合和早期融合等集成方式,并评估了在机器人、GUI与网页导航、多媒体内容生成与编辑、长视频理解与检索等领域的应用。最后讨论了性能、效率与可扩展性之间的权衡,并指出了未来研究方向。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

基于边缘智能体RAG的FHWA桥梁检查合规自动化系统

本文介绍了 BridgeGuard,一个完全离线(air-gapped)的基于智能体检索增强生成(RAG)的系统,用于自动化 FHWA 桥梁检查合规性验证。该系统在边缘硬件上本地运行,结合向量搜索和 SQL 查询,通过多步骤 ReAct 循环实现,在 Delaware 和 Texas 的桥梁数据上分别达到 99.77% 和 100% 的分类准确率,并实现 1

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

超越原始转录:基于LLM的数字孪生的结构化人物提取

本研究探讨了基于LLM的数字孪生中人物信息结构化的影响,提出固定BDE结构在同类任务上优于原始转录,但在异构任务上效果不佳。为此,作者提出自动结构发现流程,在13个多样化子研究中恢复性能,表明关键限制在于信息组织方式而非信息量。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

SDAD:面向AI原生软件开发生命周期的规格驱动智能体开发

该技术报告提出规格驱动智能体开发(SDAD)框架,将软件开发生命周期重构为意图捕获、机器可读规格、智能体合成和独立多智能体验证四个阶段。报告回顾了从瀑布到敏捷再到智能体时代的范式演变,并引入AI代码作为第四种生产范式。报告还定义了团队角色转型、量化治理指标(如歧义税、规格保真度)以及分阶段迁移蓝图,强调智能体速度将工程纪律上移至规格精确性。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

RecVerse:忠实模拟人类购物行为的 GUI 智能体

arXiv 论文提出 RecVerse,一种基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆)解决长会话记忆挑战,并用轨迹级强化学习优化整体行为分布和购物意图。实验表明 RecVerse 在行为保真度和意图一致性上优于现有基线,并发布了 USB 基准数据集。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

澄清后搜索:面向深度搜索的澄清基准与端到端信息恢复

该研究提出了一个用于评估深度搜索中澄清能力的基准,基于百度搜索的真实查询构建了518个实例,并采用闭卷协议和静态金标准来防止意图泄漏。实验表明,澄清能提升搜索效用,其中ERNIE-4.5-Turbo-128K在开源模型中表现最佳,甚至超过GPT-5.2等闭源模型。研究还发现,在严格闭卷条件下,系统常提出无法回答的区域性问题,导致交互效率低下。