返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2485 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月13日周四 · 20 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

OpenART:通过开放式环境演化扩展智能体红队测试

OpenART 是一个用于可扩展智能体红队测试的开放竞技场,通过环境演化来评估长周期 AI 智能体的安全性。它提供了超过 10,000 个跨 50 个领域的验证状态场景,并提出了 EMHA 攻击策略,该策略在无需参数更新的情况下实现了 85.0% 的总体攻击成功率。研究表明,随着任务复杂度的增加,环境演化能更有效地暴露安全失败,且智能体的运行时实现对其安全性

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.29.0 发布:支持 FastMCP 4 与 Azure AI Voice Live

PydanticAI 发布 v2.29.0 版本,新增对 FastMCP 4 和 MCP SDK v2 的支持,并添加 Azure AI Voice Live 功能。同时修复了 gzip 响应体静默截断、工具签名参数描述缺失、WebRTC 和 Azure 实时连接继承问题以及并发 provider 流关闭问题。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

视觉工具使用的幻觉:对图像思维模式的因果审计

该研究对多模态大语言模型的视觉工具使用进行了因果审计,发现尽管聚合准确率有所提升,但返回的视觉证据往往对答案没有因果影响,或调用计划不连贯。研究提出了视觉证据增益等干预指标,并在六个模型和五个基准上揭示了两种失败模式,将这种不一致称为视觉工具使用的幻觉。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

NCP-Bench:评估大语言模型在交互叙事中的长程一致性

Hugging Face 每日论文介绍了一项新研究,提出了叙事承诺保持(NCP)概念和 NCP-Bench 基准,用于评估大语言模型在交互式叙事中的长程逻辑一致性。基准包含 100 个基于电影情节的叙事环境,实验发现即使最强模型 GPT-5.2 在 20 轮后也只有 42% 的存活率,事实冲突率在 40% 到 68% 之间,表明当前模型在长程交互中难以保持一

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

TRACE Bench:任务驱动的角色扮演智能体检查表评估框架

TRACE Bench 是一个任务驱动的角色扮演智能体检查表评估框架,将角色档案分解为固定检查表,并通过用户智能体自然对话动态更新检查表状态,使评分可追溯到具体检查项和对话证据。实验显示,其覆盖率在更少轮次内达到 99.91%,而现有 M2 自由对话转录仅覆盖 73.74%。该框架支持 26 个模型的排名、能力分解和闭环基准演化,以提升评估的可审计性和可靠性

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

工具架构如何塑造编码智能体行为:接口设计的关键作用

该研究通过控制实验比较了六种工具架构对编码智能体行为的影响,涉及三个模型和11,700条轨迹。结果显示,即使工具能力相似,架构也会改变智能体行为:结构化低级接口提高一致性,自然语言搜索扩大探索范围,Python CodeAct风格接口减少41.6%步骤和56.3%令牌使用,而轻量级认知脚手架工具影响有限。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

上下文压缩中的约束丢失:评估与解决方案

宾夕法尼亚州立大学的研究团队发现,在上下文压缩过程中,用户发出的会话约束(如“未经确认不要删除邮件”)会被静默丢弃,导致AI系统违反用户指令。他们提出了CompInt评估套件,涵盖多轮对话、智能体轨迹和长周期研究三种场景,并测试了多种压缩器,结果显示平均仅保留17%的约束。团队还开发了一种与压缩器并行的SC感知提取器,在不修改压缩器或LLM的情况下,将约束保

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

重新思考代理安全:作为网络问题

本文提出将AI代理安全视为网络问题,主张采用确定性执行与上下文感知过滤相结合的网络架构,以解决现有代理中心防御的局限性。作者认为,依赖LLM推理的防御易受提示注入等攻击,无法提供强安全保证,而网络侧控制可提供更可靠的保障。文章还提出了参考架构,并指出了未来研究方向。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

Backtrader-Bench:基于自生成多选题的算法交易 LLM 智能体基准

Backtrader-Bench 是一个用于评估 LLM 智能体在算法交易中能力的基准框架,包含确定性 MCQ 管道和生成器-求解器过滤管道,可自动生成并验证问题。在 30 道精选题目上,工具增强的智能体(如 GPT-5.5 和 Opus 4.7)单次准确率达 90.0%,比最佳无工具基线(73.0%)高出 17 个百分点。该框架旨在生成训练语料,用于强化学

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

机构何时胜过智能?多智能体集体推理失败的结构性诊断

该研究探讨了多智能体系统中,更强的智能体能力并不必然带来更强的集体表现,而机构结构(如信息路由、验证、状态维护等)在修复集体推理失败中起关键作用。通过构建四类失败场景(访问与路由、接纳与依赖、维护与激励、表征与行动)的人工生态,实验发现机构干预仅在修复公共状态构建失败时有效,而当信号无信息量、智能体可直接完成转换或状态无法支持行动时,其优势消失。研究将智能与

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

超越记忆:面向长期 AI 代理的事务性连续性内核

本文提出了一种名为 Continuity Kernel (CK) 的激活契约,用于管理长期运行的 AI 代理的状态治理。CK 将候选评估与原子状态激活分离,通过短事务验证所有权、预状态权限、新鲜度和效果唯一性,并记录提交、拒绝、隔离或延迟四种处置。该协议通过有界可执行模型验证,覆盖 2,808,230 个可达状态和 5,526,474 个状态转换,未发现不变

正文结构化主题已通过公开置信门槛
量子位模型发布

DeepSeek V4 Pro正式版发布,Agent能力对标Fable 5

DeepSeek发布了V4 Pro正式版,API平台已更新至DeepSeek-V4-Pro-0813,多项基准测试显示其Agent能力接近或超越Fable 5和Opus 4.8。价格与预览版持平,但网友发现其思维链输出变得简略,可能影响写作能力。该发布被视为国产开源模型在性价比之外向SOTA发起冲击的标志。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

360与《知识就是力量》联合发布科普科幻AI大片创作平台

《知识就是力量》杂志社与360科技集团联合发布“知力·纳米”科普科幻AI大片创作平台,该平台基于360的纳米大片流水线,结合杂志社70年科普内容,提供从剧本到成片的AI视频生产全流程服务。平台面向学校、科研机构等,旨在将权威科普内容转化为可视化AI视频,推动科普内容生产的专业化与生态化。

正文结构化主题已通过公开置信门槛
量子位产品发布

360与《知识就是力量》联合发布科普科幻AI大片创作平台

《知识就是力量》杂志社与360科技集团联合发布“知力·纳米”科普科幻AI大片创作平台,该平台基于360纳米大片流水线,结合权威科普内容与AI视频生产能力,面向中小学、高校、科研机构等提供从剧本到成片的AI视频创作服务。平台旨在推动科普内容生产专业化、体系化,并已获得相关许可,作品可纳入官方平台。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

智能硬件出海龙头为何集体押注AhaCreator?

AhaCreator,一家AI原生海外达人营销平台,宣布与飞书深度集成,成为飞书首个海外达人营销AI Agent合作伙伴。该平台通过AI连接品牌与海外达人,提供从筛选、沟通到履约管理的全流程自动化,并建立风险识别与处理机制。目前,AhaCreator已服务400多个全球化品牌,覆盖智能硬件等多个领域,并完成Pre-A+轮融资,累计融资超千万美元。

正文结构化主题已通过公开置信门槛
量子位产品发布

荣耀发布全球首款机器人手机Robot Phone,开启具身交互时代

荣耀于2026年8月12日发布全球首款机器人手机荣耀Robot Phone,该手机配备四自由度钛合金灵巧云台和系统级Agent架构,支持多模态具身交互。荣耀与ARRI合作引入电影级影像技术,并搭载第五代骁龙8至尊版平台,售价9999元起。该产品旨在推动AI终端从数字智能迈向具身智能,开启人机伙伴关系新阶段。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Spark-to-Paper:作为可组合技能的研究论文端到端生成

Hugging Face 每日论文介绍了 Spark-to-Paper,一个在现有编码助手中以十三个可组合技能实现的研究论文端到端生成系统。该系统将规划与报告分离,通过完整性检查减少捏造,并生成可编辑的矢量图。在八个受控研究主题上,它实现了 99.5% 的引用有效性和 96.4% 的图形可编辑性,完整系统平均每篇手稿成本 8.1 美元,耗时 3.2 小时。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

MBA:面向真实世界商业构思的多模态基准与智能体

研究人员推出了MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准,包含六个领域的3万个样本。他们提出了MBA-b和MBA-k模型,通过LoRA微调和组相对策略优化,结合创造性和可行性奖励进行训练,显著优于文本和多模态基线。MBA-b和MBA-k分别比多模态基线提升25.6%和35.8%。

正文结构化主题已通过公开置信门槛
LangChain Releases一手来源API 更新

LangChain 发布 langchain-anthropic 1.5.6 修复更新

LangChain 发布了 langchain-anthropic 1.5.6 版本,主要修复了 tool search tool result 块的规范化问题,并更正了 Fable 5、Sonnet 5 和 Opus 4.1 的模型配置文件数据。该版本更新旨在提升 Anthropic 模型在 LangChain 框架中的兼容性和稳定性。

正文结构化主题已通过公开置信门槛
Latent Space模型发布

Grok 4.6 发布,AI 助手领域竞争白热化

xAI 发布了 Grok 4.6 模型,该模型在知识工作领域表现优异,价格远低于同类前沿模型,并已集成到 Cursor 和 SpaceX 团队的产品中。同日,阿里发布开源模型 Qwen3.8-Max,DeepSeek 推出 V4 Pro GA,微软也发布了自研推理模型 MAI-Thinking-1。这些发布标志着 AI 助手和知识工作领域的竞争加剧。