返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2400 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月28日周五 · 20 条
正文结构化主题已通过公开置信门槛
量子位商业

云知声中期财报亮眼:Agent业务半年进账近5亿,Token收入暴涨500%

云知声发布2026年中期财报,上半年营收5.62亿元,同比增长38.7%,其中智能体业务收入4.78亿元,占总收入85.1%,Token业务收入近3000万元,Q2环比增长超500%。公司通过“强基模+深应用”战略,将Agent落地医疗、保险等场景,复购收入占比超60%,亏损收窄。文章认为云知声正验证一条类似Palantir的产业AI商业化路径,并总结Age

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

OpenAI 开发“持久模式”AI 代理,可主动持续工作

OpenAI 正在为其 AI 代理 Codex 开发“持久模式”,该模式使代理能够持续主动工作,直到被“休眠”,并具备“主动性”功能,可自主生成后续任务并跨会话工作。OpenAI 已向 WIRED 确认测试,但暂无发布计划。此举与 Sam Altman 将 ChatGPT 打造成全能个人助理的目标一致,但也引发了对安全性的担忧,因为 GPT-5.6 Sol

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

Agent点燃CPU市场,五年混战开启

英伟达GTC上黄仁勋展示独立CPU机柜,引发中国投资人重新关注CPU市场。Agent推理需求推动CPU需求与价格上升,未来五年被视为国内CPU公司关键窗口期。Arm路线公司率先受益,RISC-V面临生态挑战,x86、Arm、RISC-V三路线竞争加剧,最终比拼系统能力。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

Jalapeño 跑分炸场,GPU 推理路线开始分裂?

OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

Sora 为何输给 Codex:算力调度与工作负载架构的差异

OpenAI CEO 奥特曼在播客中表示,Sora 因算力消耗巨大而优先级低于 Codex,资源向后者倾斜。文章分析认为,Sora 的算力集中在连续的视频生成路径中,难以复用,而 Codex 的 Agent 工作流可将算力碎片化,通过缓存、批处理和调度优化提高 GPU 利用率。这种架构差异导致两者扩张速度不同。

正文结构化主题已通过公开置信门槛
Latent Space产品发布

OpenAI预计2026年底实现AGI,多款AI产品发布

OpenAI首席科学家Jakub Pachocki表示,未发布的Astra模型已达到其2026年9月设定的“自动化AI研究实习生”目标,而Sama在《时代》采访中估计OpenAI将在2026年12月内部宣布实现AGI。此外,Hugging Face与Pollen Robotics联合推出399美元的开源双足机器人Microduck,支持模拟训练和强化学习定制

正文结构化主题已通过公开置信门槛
量子位商业

2026奇点智能技术大会北京站官宣,Transformer联合作者领衔

2026奇点智能技术大会北京站将于11月20-21日举行,由奇点智能研究院与CSDN联合主办。大会汇聚70余位技术专家,围绕18个前沿主题,涵盖大模型、AI原生软件研发、C++及系统软件等方向。OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser已确认发表主题演讲。

正文结构化主题已通过公开置信门槛
量子位产品发布

Anthropic发布MHS标准,Claude开始控制物理世界硬件

Anthropic发布全新模型硬件标准MHS,旨在将不同厂商的硬件设备控制方式统一为Agent可调用的标准接口,使Claude等AI代理能直接控制物理世界中的设备,如机械臂、显微镜等。MHS源于与HHMI Janelia研究园区的合作,目前处于研究预览阶段,未来计划开源。该标准被视为物理世界的MCP,有望扩展AI代理的能力边界,并收集真实世界数据。

正文结构化主题已通过公开置信门槛
RAGFlow Releases一手来源产品发布

RAGFlow v0.27.1 发布:新增连接器与搜索提供商,修复多项问题

RAGFlow 发布 v0.27.1 版本,新增 Azure DevOps 数据源连接器、You.com 和 Serply 网络搜索提供商,以及 Synthorai 模型提供商,并补充了 DeepSeek 模型。该版本改进了检索 API,暴露 rerank candidates count 等参数,并将元数据过滤下推到索引层以加速检索。同时修复了多项 bug

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体系统风险与控制:跨组织边界部署AI智能体的分析框架

澳大利亚工业、科学和资源部委托Gradient Institute撰写了一份关于跨组织边界部署AI智能体的多智能体系统风险与控制分析框架报告。报告由Alistair Reid等人编写,旨在为AI智能体的部署提供风险评估和控制建议。该报告是此前关于受治理的基于LLM的多智能体系统风险分析技术的后续报告。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

CIFQA:确定性工具接地多智能体LLM框架用于金融问答

印度理工学院焦特布尔分校的研究团队提出了CIFQA,一个确定性的工具接地多智能体LLM框架,用于计算密集型金融问答。该框架将语言理解与数值执行分离,通过LLM智能体负责查询理解、路由、参数提取等,而确定性Python工具执行金融计算。在定期存款查询基准上,CIFQA达到95.54%的计算密集型查询准确率和90.87%的总体准确率,显著优于直接LLM基线,且1

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向安全加固的智能体AI遏制架构

本文提出了一种面向多智能体AI系统的安全加固架构,将安全视为架构属性,通过六种约束(职责分离、部署前一致性检查、价值流绑定、时间隔离、知识验证、结构完整性验证)强制执行Propose–Verify–Act–Verify执行模型。该架构将系统分析工件映射为可验证的契约,以防御提示注入、编排器操纵、跨会话状态污染和智能体共谋等威胁。通过简历筛选案例展示了在对抗条

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

MoRe:单智能体多角色混合实现多视角协同

arXiv 论文提出 Mixture of Roles (MoRe) 方法,通过可学习码本和查询感知路由器,将多个角色组合成单一 steering vector,在单智能体单次推理中实现多视角专业化。实验显示 MoRe 平均比单智能体基线高 2.2%,性能与多智能体系统相当,但显著降低 token 成本。该方法通过三阶段 SFT 和 GRPO 训练,且保持骨

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

可预测代理系统的Harness工程:确定性执行约束的实证研究

该研究通过实验证明,为LLM代理添加确定性执行层(有限状态控制器、强制单工具选择、输出验证、有界重试)对可复现性的影响是混合的:在四个模型-任务组合中,一个组合显著提升,两个显著降低,一个无显著影响。进一步诊断发现,自由文本规划步骤是剩余变异的主要来源;引入结构化规划(在执行前验证计划符合固定模式)后,所有组合的可复现性和确定性达到完美,任务成功率提升,但延

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

独立LLM与预定义智能体流水线解释ICU死亡率预测的可行性研究

马萨诸塞大学阿默斯特分校等机构的研究人员评估了独立LLM与预定义智能体流水线在解释ICU死亡率预测方面的可行性。基于eICU演示数据集(2353例ICU住院,死亡率8.1%),XGBoost模型AUROC为0.855。在38例解释子集上,独立LLM产生1例显式结果泄漏,而四步智能体流水线无泄漏;智能体流水线在指南依据、价值特异性和合理性方面得分更高,但SHA

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

PICasso:AI 驱动的硅光子器件自主优化设计框架

arXiv 论文提出 PICasso,一个基于 AI 的硅光子集成电路(PIC)设计框架,能从自然语言规格自动生成、验证和优化电路。PICasso 结合结构化 YAML 生成、PDK 知识注入、自动布局布线、DRC/LVS 验证和 SAX 仿真,并引入包含 36 个任务的基准 PIC-Set。实验显示,PICasso 将高复杂度电路的结构满足率提升至 92.

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

LLM智能体轨迹中的成本-效用对齐:剖析、归因、诊断、适应与评估

本文提出一个面向LLM智能体轨迹的成本-效用对齐框架,包含成本剖析、效用归因、错位诊断、定向适应和评估五个阶段,将资源消耗与任务贡献视为同一执行过程的双重账本。效用归因通过过程代理、信息依赖和反事实重放等方法提供因果证据,以指导诊断和适应。该框架为资源感知的智能体设计与部署提供了结构化基础,并分析了近期系统、归因方法和评估协议。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于账本控制的零样本自编排提升LLM编码性能研究

该研究比较了多智能体LLM系统与单模型基线在编码任务上的表现,发现引入管理器-工人脚手架的效果因模型而异:对部分模型(如Qwen3.8-27B、GPT-5.6-Luna等)有显著提升,对另一些模型(如Qwen3.6-35B)则无益或负面。管理器机制虽使token消耗增加约三倍,但相比升级更大模型,能以更低成本获得相近精度。研究还分析了增益机制,包括上下文管理

正文结构化主题已通过公开置信门槛
阿里 AgentScope Releases一手来源产品发布

AgentScope v2.0.7.post1 发布:新增 GoalPipeline 与多模态支持

阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response

正文结构化主题已通过公开置信门槛
Anthropic Newsroom一手来源产品发布

Anthropic 发布模型硬件标准预览,加速 AI 驱动实验室自动化

Anthropic 与 HHMI Janelia 研究园区合作,发布了模型硬件标准(MHS)的研究预览版,旨在让 AI 代理安全操作物理设备。MHS 通过标准化驱动和自然语言标签,将设备集成时间从数周缩短至数分钟,并支持多设备并行操作。该标准已提供给首批科研实验室和制造商,未来将开源。