返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2487 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月12日周三 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

AI流量超人类,字节谷歌转向API税时代

Cloudflare 数据显示 AI 机器人流量已占全球网页访问的 60.4%,超过人类,冲击传统互联网广告模式。字节跳动通过 API 封装和交易抽成(如豆包对酒旅订单收 12% 服务费)构建交易闭环,谷歌则依托实时信息库、地图数据和知识图谱向 AI 提供付费 API,两者均转向“API 税”模式。文章还介绍了硬件认证、行为指纹、内容混淆等人机识别技术,并指

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

XTransfer发布AI模型TradePilot,破解跨境支付风控难题

XTransfer在2026未来外贸大会上发布全球首个B2B跨境贸易支付垂直领域AI模型TradePilot,嵌入72个AI智能体,实现98.5%的自动化审核率和约0.003%的欺诈率。公司还推出本地收款账户服务,覆盖近60个国家和地区,服务超100万企业客户,2025年支付交易额达605亿美元。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

2026年前沿模型如何基于结果进行训练

本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

Vibe Coding 重构软件开发,OceanBase 应对数据库新挑战

雷峰网报道,Vibe Coding 趋势下 AI 生成应用激增,对数据库提出新挑战。蚂蚁 OceanBase 提出“逻辑独立、物理共享”方案,通过 JSON 存储和 SQL 翻译能力,支撑千万级动态数据空间,并强调数据库成为 AI 应用基础设施。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

华为云与滴普科技联合发布数据智能方案,加速制造零售AI落地

华为云与滴普科技在北京联合发布数据智能解决方案,面向智能制造和零售行业,旨在打通数据孤岛,加速从数据治理到智能体应用的一站式落地。双方将在技术、品牌营销和市场销售层面合作,华为云提供云基础设施和算力底座,滴普科技开放FastData和DeepWorks平台能力。华为云CEO周跃峰和滴普科技董事长赵杰辉均表示,合作将推动AI成为企业核心生产力。

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

AMD收购Taalas:为特定模型定制芯片的‘拖拉机’策略

AMD宣布收购AI推理芯片公司Taalas,计划将其技术纳入加速器路线图。Taalas采用模型硬化路线,将模型权重固化进硬件,以降低推理成本和提高速度,首款芯片HC1运行Llama 3.1 8B时生成速度达1.7万Token/s。该路线面临模型迭代风险,但Taalas通过可编程SRAM和掩膜修改应对。业内专家认为,AMD此举如同购买拖拉机,其价值取决于是否存

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

边际价值估计:高效深度研究智能体的剪枝策略研究

Hugging Face 每日论文发布了一篇关于深度研究智能体效率优化的研究论文。论文提出在长周期研究智能体的不同流水线阶段应用剪枝策略,以减少 token 使用和延迟,并发现早期剪枝能带来最大的效率提升。实验表明,轻量级启发式方法可减少高达 73% 的 token 使用且质量损失很小,但没有单一方法在所有指标上占优。该研究为设计高效的长周期智能体系统提供了

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DSAgentBench:评估智能体在真实环境中自动化数据科学工作流的能力

DSAgentBench 是首个在真实计算机环境中评估智能体自动化端到端数据科学工作流能力的基准,包含 275 个覆盖数据科学生命周期的任务。实验表明,最强智能体 Claude-4.6-Sonnet 的任务成功率仅为 56.70%,而所有开源智能体成功率均低于 1%,揭示了当前智能体系统与真实数据科学工作流之间的巨大能力差距。该基准已开源发布。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SkillZip:通过发现可复用结构实现无评估的自进化代理技能压缩

Hugging Face 每日论文发布了一篇题为《SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure》的论文。该论文提出了一种名为 SkillZip 的无评估技能压缩方法,通过发现可复用的结构来压缩自进化代

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

智能体系统中的协同进化:迈向超越人类设计的自导进化

该论文是一篇关于智能体系统协同进化的综述,提出了一种渐进式三阶段分类法,涵盖智能体间、智能体与环境以及元协同进化。文章讨论了评估、扩展和安全控制等开放挑战,旨在为构建超越人类固定设计路径的开放型智能体系统提供统一基础。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ComBodied Agents:以人为中心的代理式AI新范式

Hugging Face 每日论文发布了一篇题为《ComBodied Agents: a New Paradigm of Human-Centric Agentic AI》的论文,提出了一种名为 Combodied Agents 的新范式,将数字代理和具身代理整合到一个闭环框架中,以建模个体人类状态轨迹并提供基于同意、适度的支持。该框架通过事件驱动的多模态感

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

中国前沿大模型合作行为并非铁板一块:实验室间差异显著

本研究通过进化迭代囚徒困境实验,比较了四款中国前沿大模型(DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5、GLM-5.1)的合作倾向。研究发现,这些模型并非铁板一块,实验室间差异显著,且中国模型内部的差异大于中国与西方生态系统之间的平均差异。研究还发现,中国模型的合作倾向普遍性较弱,但这一结论受转换器选择影响。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ASCon:面向多智能体系统故障归因的方向感知互惠智能体-步骤上下文化模型

ASCon 是一种面向 LLM 多智能体系统故障归因的统一表示模型,通过方向感知图注意力、掩码步骤到智能体注意力和智能体条件步骤上下文化,将轨迹证据聚合为智能体和步骤表示,并适配多种归因目标。实验表明,ASCon 在故障智能体检测、故障步骤检测和故障模式检测上分别提升 5.83%+、10.63%+ 和 14.73%+,并能增强 LLM 方法在域外场景的归因能

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

超越现金流:用于临床阶段跨境生物技术估值的多智能体AI框架

本文提出一个面向临床阶段跨境生物技术公司的多智能体AI估值框架,该框架包含估值层、跨市场协调层和冲突融合机制,以解决传统现金流估值方法不适用于无收入生物技术公司的问题。作者曾作为中国首只跨境生物技术基金的投资组合经理,在16个月内实现127.17%的回报率(基准为50.67%),该框架旨在将该方法规模化。论文仅描述架构,未评估具体实现。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

LLM Agents Factory:领域特定 LLM 代理的检索框架

LLM Agents Factory 是一个基于检索的框架,利用超过 20K 个预定义代理配置文件,按需构建领域特定且基于 Wikipedia 的代理。该框架支持语义搜索检索和蒸馏两种模式,在 MMLU、BIG-bench 等基准测试中,其检索式代理构建在准确率上超越非代理基线,并以更低推理成本匹配 AutoGen 的生成质量。该研究将代理构建视为信息检索问

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

DocsChisel:面向LLM代理的自适应工具文档优化框架

该研究对LLM代理的工具文档进行了大规模实证分析,发现不同信息字段的效果因任务领域、LLM骨干和代理范式而异。为此,作者提出DocsChisel框架,通过分析失败轨迹并迭代增删或优化信息字段,将任务成功率较原始文档提升95.89%,较现有基线平均提升75.15%。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

自我进化harness跨语言与模型的编码机制研究

该研究通过固定自我进化配方,在8种编程语言和3个基础模型上分析编码智能体的自我进化机制。研究发现,进化产生的harness主要补偿可恢复的执行缺陷,而非基准过拟合;不同语言共享抽象策略但使用不同的生态系统工具,且共享核心可迁移至通用harness。该研究将自我进化harness重新定位为可解释的补偿层,受语言工程需求和模型行为差距共同塑造。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v1.107.4 修复两个安全漏洞

PydanticAI 发布 v1.107.4 版本,修复了两个安全问题:一个高危漏洞允许跨站请求触发开发 Web 聊天 UI 执行代理工具,现已要求 JSON 内容类型;另一个低危漏洞涉及重试提示内容未按设置脱敏。此前 v1.107.3 因构建工具问题未能发布,此版本包含相同修复。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

AI社会科学家研究挑战赛开启,探索AGI时代社会科学研究

清华大学计算社会科学与国家治理实验室和电子工程系联合举办AI社会科学家研究挑战赛,依托AgentSociety²平台,探索大模型智能体驱动的社会科学研究新范式。大赛设置七大研究方向,涵盖政策治理、政治制度、法律创新、数字经济、信息传播与社会演化等领域,奖金池共18万元,优秀作品可推荐至学术期刊。