返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2394 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月22日周二 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

千问加速打造Personal Agent,开放平台覆盖20多领域

在2026年云栖大会上,千问宣布加速打造Personal Agent,产品负责人郑嗣寿表示目标是让每个人拥有自己的AI助理。千问依托Qwen 3.8系列模型的Agentic能力,为3亿用户提供个性化服务,并公布在用户授权下接入健康、运动、理财等个人数据,开放平台覆盖20多个领域、申请入驻伙伴超1000家。理财场景中通过专项Harness优化使回复效果提升20

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

千问加速打造Personal Agent,服务3亿用户

在2026年云栖大会上,千问宣布将加速打造Personal Agent,产品负责人郑嗣寿表示目标是让每个人拥有自己的AI助理。千问依托Qwen 3.8系列模型的Agentic能力,为3亿用户提供持续、个性化的智能服务。阶段性进展包括:在用户授权下接入健康、运动等个人数据,接入专业理财数据及机构智能体并支持部分用户连接个人持仓,开放平台覆盖领域扩大至20多个,

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

对话 COBRA-Skills 一作:50 样本重构 Agent 技能降本路线

香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越

正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布

n8n 发布 2.41.0:修复 AI Builder 与核心执行多项缺陷

n8n 发布 2.41.0 版本,主要包含一系列缺陷修复,涉及 AI Builder、核心执行引擎、CLI 及安全相关模块。修复内容包括 Agent Builder 传递父级用户回答、多主模式下工作流发布静默失败、助手与构建器跟随用户语言、以及 HashiCorp Vault 外部密钥读取并发限制等。该版本为常规维护更新,提升了工作流自动化平台的稳定性与 A

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

从必死到求生:LLM 智能体社会中的智能体驱动自治

研究者提出 GovSim-SelfGovern,扩展 GovSim 公共池资源环境,让 LLM 智能体用可执行 Python 代码编写治理规则,经沙箱验证、投票后跨轮次生效。在资源充裕场景中,自治治理使完整社区存活率(ICS)从 45.0% 提升至 72.5%,但在资源紧张场景中 ICS 骤降至 5% 和 2.5%。增加财政能力、取消民主否决权以及提升推理深

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

面向任务的多智能体框架用于复杂可穿戴健康分析

该论文提出一种面向任务的多智能体框架,用于处理复杂的可穿戴健康查询。框架通过意图-任务层级将复合查询拆解为不同意图和带显式依赖的类型化任务,由专门智能体分别执行检索、分析和建议任务,并保持各意图状态隔离。在含一个月纵向可穿戴记录的合成数据集上,Query Agent 在检索问题上准确率优于直接调用 LLM 的基线,并将查询阶段平均 token 消耗从较高值降

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向输电控制室的治理感知LLM智能体数字孪生

该论文提出一种面向输电系统运营商控制室的治理感知型LLM编排智能体数字孪生系统。LLM仅负责选择并参数化白名单分析工具,所有动作必须经过模型无法绕过的治理层,该层强制执行四条规则:仅执行白名单工具、不超步数预算、有副作用的动作需操作员明确批准、答案中每个数字均由后端结果渲染并附带单位变量时间。在希腊输电网络数字孪生的118任务基准上,主模型590次运行工具选

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

识别、模拟与拒绝:LLM 智能体经典心理效应的污染感知研究

研究者提出 PsyAgentBench 基准,在 LLM 智能体上重跑经典心理学实验,通过「命名/盲测」与「教科书/反事实」交叉设计区分模型是真正具有类人偏差、识别实验后表演、还是复现记忆中的响应统计。在五个范式、最多三个开源模型家族、41,904 次试验中,类人效应通过不同路径出现,且一句人格提示可消除、削弱或反转这些效应。作者据此主张标量偏差易感性评分掩

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RRSI:智能体 harness 的正则化递归自我改进

Google Research 提出 RRSI(正则化递归自我改进)方法,用于自动优化 LLM 智能体的 harness(提示词、控制流、工具、记忆与上下文管理)。该方法通过时间退火预算约束候选编辑、并用 critic 与 pruner 筛选提案,以缓解递归进化对训练任务的过拟合。在涵盖编码、智能体工作区与工程设计等八项基准上,RRSI 在进化所用划分上最高

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源开源

Vercel AI SDK 发布 ai@7.0.109 修复补丁

Vercel AI SDK 发布 ai@7.0.109 补丁版本,修复了三处问题:在较早请求完成时保持替换补全请求处于加载且可取消状态;在推理提取流中保留重叠的文本块;在 harness 中将经过验证的 toolsContext 转发给宿主执行的工具,以与 ToolLoopAgent 保持一致。这些修复提升了流式补全与工具调用场景下的稳定性。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

在中国,别指望FDE能搞定AI落地

雷峰网 AI 科技评论发文指出,国内打着 FDE(Forward Deployed Engineer)旗号的厂商和培训机构鱼龙混杂,不少公司缺乏成熟 AI 产品与交付能力,FDE 岗位在实际操作中沦为外包、售前赠品或围着 PRD 转的 AI 操作员。文章认为,客户数字化基础薄弱、企业语义层复杂以及甲乙方权力失衡,使 FDE 难以真正推动 AI 落地。作者还指

正文结构化主题已通过公开置信门槛
量子位商业

阿里吴泳铭:未来机器思考总量将达人类1000倍以上

阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上发表演讲,提出机器智能时代三大基石为AI模型、AI芯片和AI云,并判断未来机器思考总量将达到人类的1000倍以上。他宣布Qwen团队在递归式自我改进RSI方面取得进展,计划训练5-10T参数规模模型;平头哥发布最强国产AI芯片真武V900,算力为M890的3倍,单集群可扩展至50万卡;阿里云目标到2032年全球

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

面向软件工程智能体的类别感知迭代专家训练

该论文提出面向软件工程智能体的类别感知迭代专家训练框架,通过 Refresh-Repair-Expand 迭代开发各类别专家,并用标签路由的多教师在线策略蒸馏(MOPD)将其整合为单一可部署模型。最终策略在 Pro-618 上达到 58.04%、在 SWE-bench Multilingual 上达到 59.00%,分别较基座模型提升 5.39 和 2.78

正文结构化主题已通过公开置信门槛
量子位产品发布

浪潮信息发布元脑SD200 Ultra与HC2000,破解智算能力与产能双重瓶颈

在AICC 2026上,IDC发布《2026年中国人工智能计算力发展评估报告》,指出Agent时代算力需求正从脉冲式调用转向持续负载,全球Token消耗量到2030年复合增长率达4822.6%,算力缺口绝对值将达3809亿美元。浪潮信息首席AI战略官刘军将算力问题拆分为Capability(能力型智算)与Capacity(容量型智算)两个方向,并发布超节点A

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI观点

打造苹果零售店的人不看好硅谷的AI购物押注

前苹果零售业务负责人 Ron Johnson 在采访中表示,硅谷对 AI 代理购物的押注被高估,消费者不会把购买笔记本电脑等高价商品完全交给 AI 代理,实体店仍将繁荣。他认为 AI 会改善线上购物体验、让消费者进店前更了解产品,但无法替代亲身体验。文章还提及 Google 的 Universal Commerce Protocol 和 OpenAI 将 C

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA 博客:从工具调用到任务完成的 AI Agent 评估方法

NVIDIA 技术博客发文梳理 AI Agent 评估方法的演进:从早期静态任务与单次函数调用评分(如 BFCL),转向需要完整执行环境、跨多步追踪状态的全任务评估。文章提出步骤级(过程评分)与端到端(结果评分)两层评分体系,并给出任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本等指标,强调不同基准在任务复杂度、状态性和验证方法上的差异会导

正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源产品发布

Strands Agents SDK 发布 harness-python v0.1.1

Strands Agents SDK 发布 harness-python v0.1.1,默认启用 opus 5 模型与高思考(high thinking)模式。该版本修复了 ContextManager 实例在 Agent contextManager 中的接受问题,并阻止工具 schema 归一化修改调用方拥有的 spec。此外还更新了文档、升级 ceda

正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源开源

Strands Agents SDK 发布 harness-typescript v0.1.0

Strands Agents SDK 发布 harness-typescript v0.1.0,这是该 TypeScript 包的首个版本。该版本默认启用 opus 5 模型与高思考(high thinking)模式,并上线了重新设计的 Strands 官网。此外还修复了 ContextManager 实例接受问题与工具 schema 规范化时修改调用方对象

正文结构化主题已通过公开置信门槛
Open WebUI Releases一手来源产品发布

Open WebUI v0.11.4:镜像大幅瘦身并增强终端技能

Open WebUI 发布 v0.11.4 版本,主要围绕镜像体积优化与终端/技能能力增强。slim 镜像降至约 175 MB(较上一版缩小约 89%),标准镜像也减少约 170 MB,移除了本地模型、冗余 Python、字体和未使用依赖。新版本还支持终端服务器技能、AGENTS.md 指令文件、自动技能发现、模型背景图、从聊天创建技能、终端命令标签页、文件

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

xAI 的 Grok 4.6 现已上线 Amazon Bedrock

xAI 的 Grok 4.6 模型正式上线 Amazon Bedrock,成为 xAI 在 Bedrock 上的第二个模型。该模型面向长时运行的 agent、编程和知识工作,提供 500K token 上下文窗口和四档可配置推理强度(low、medium、high、xhigh)。相比前代,Grok 4.6 同时支持 bedrock-mantle 和 bedr