返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2491 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月11日周二 · 20 条
正文结构化主题已通过公开置信门槛
量子位研究

Claude 研究模型突破黎曼猜想纪录,零点比例下界提升至 67.2%

Anthropic 宣布其未公开的 Claude 研究模型在黎曼猜想上取得重大进展,将满足猜想的零点比例下界从 41.6% 提升至 67.2%。该研究由 60 个智能体协作完成,人类仅提供鼓励。结果已通过内部数学家审阅和形式化验证,但未完全解决猜想。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Ouroboros:自我进化的前沿编码智能体

Ouroboros是一个自我发展的智能体框架,通过审查提交来改进工具、提示和核心实现,支持递归自由进化和经验驱动进化两种模式。在Terminal-Bench 2.1上达到86.74%的准确率,在OSWorld-Verified上达到90.69%,并在CL-Bench上取得新的最优结果。其长期部署Hope运行了161天,在人类沟通下进行自由进化,同时强调安全护

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

有状态多智能体LLM实现汽车MBSE跨视图接口对齐

该研究提出了一种有状态的多智能体LLM验证流水线,用于汽车基于模型的系统工程中的跨视图接口对齐。该框架采用顺序生成矩阵和基于车辆信号规范的检索增强生成,并通过独立的AI验证器代理进行对抗性审计,以消除幻觉。在高级驾驶辅助系统场景中,该方法实现了97%的实体可追溯性和85%的F1分数,而标准RAG的实体可追溯性为0%。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

NeuroPilot:智能代理驱动的神经影像处理与质量控制流水线

NeuroPilot是一个多智能体系统,将神经影像处理、质量控制和数据管理数字化为三个LLM可调用的技能。该系统在17个队列(超过123,000名受试者)中部署,覆盖从婴儿到老年的多种MRI模态。QC代理筛选了558名生产受试者,婴儿处理流程在QC验证输入上实现了100%的完成率,并将传统2-3个月的训练和数据处理时间压缩到一周。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于主体的惯例转变模型:移动性、记忆与网络结构的影响

该研究提出一个基于主体的模拟框架,探讨移动性、有限记忆和网络拓扑如何共同影响少数派推动社会惯例转变的临界阈值。研究发现,在许多配置下,惯例转变几乎不可避免,因此重点转向收敛速度,并建立统一预测模型,表明移动性是主要加速因素,而记忆和连通性以系统方式调节收敛。该模型不仅适用于惯例转变,也适用于规范变化等传染类社会过程。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

验证驱动的闭环多智能体LLM框架实现合规结构设计

该研究提出一种验证驱动的闭环多智能体大语言模型框架,用于符合规范的结构设计。框架将外部物理验证器的反馈注入修复循环,结合三层有限元验证系统与双节点修复机制,使代码合规率从56.8%提升至98.6%,综合评分从63.8提升至71.4。研究还发现性能提升主要归因于外部验证器而非骨干模型,并开源了基准测试和实验脚本。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

VeloCity:去中心化多智能体城市交通管理框架

本文提出 VeloCity,一种面向网联自动驾驶汽车(CAV)的去中心化多智能体时空移动性规划框架,用于任意城市区域的交通管理。该框架将移动性优化分布到各车辆,通过本地协调器进行时空槽预留,无需场景特定调整即可保证无碰撞且物理可行的轨迹。在东京、曼哈顿、罗马和博洛尼亚四个真实城市地图上的大规模仿真表明,VeloCity 相比现有模型显著降低出行时间,并能在高

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

MasDrift:多智能体架构授权保留基准测试

arXiv 上发布了一项名为 MasDrift 的新基准,用于评估多智能体系统中的授权保留能力。该基准包含 600 个跨八个领域的良性生产力任务,比较了单智能体、集中式和去中心化协调架构。研究发现,集中式层级在任务完成率上更高(93.9-98.6%),但未授权操作发生率也更高(2.7-19.8%),而重新锚定授权证据的防御方法能有效减少未授权操作,但会轻微降

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

SkillConsist:通过双向图对齐检测代理技能不一致性

arXiv 论文提出 SkillConsist 方法,用于检测 LLM 代理技能中的声明与实现不一致问题。该方法通过 LLM 分离声明和实现内容,构建行为图并进行双向图对齐和差异比较,以识别冲突。在包含 633 个技能的基准测试中,SkillConsist 在包级检测上达到 87.93% 的 F1 分数,比最佳基线提升 20.43 个百分点。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

Search-G1:基于表征内在奖励的接地搜索代理

arXiv 论文提出 Search-G1,一种基于表征的内在奖励框架,用于训练搜索增强语言代理。该框架通过两个干预校准的读数(提示状态读数和答案承诺读数)衡量代理答案的操作性接地,以区分必要检索与冗余搜索,并在强化学习过程中周期性地重新拟合读数,使奖励与策略共同演化。实验表明,Search-G1 在多个基于搜索的问答基准上改善了接地与搜索成本的权衡,在保持竞

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

DocAtlas:将长文档理解视为可变状态交互

DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

LayoutDSL:在领域特定语言动作空间中学习室内布局策略

arXiv 上发布了一篇关于室内布局生成的研究论文,提出了 LayoutDSL 框架,利用领域特定语言(DSL)作为动作空间,通过 LLM 学习布局策略。该方法将布局推理转化为可解释的设计决策,并构建了 3D-FrontDSL 数据集,结合强化学习优化策略。实验表明,LayoutDSL 在空间合理性和设计逻辑性上优于现有方法。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

RoMeRL 提出了一种用于自进化 LLM 智能体的降阶记忆强化学习方法,通过固定维度的语义坐标表示记忆状态,解决反馈分散和记忆-奖励陷阱问题。在 ALFWorld 和 LifelongAgentBench 基准上,该方法将 Cold-Q 比率降低 80.0%,反馈密度提高约 6 倍,内存占用减少 84.4%,LLM 调用减少 21.1%。代码已开源。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Macaron-V1:面向开放持续学习的自改进与LoRA混合架构

Macaron-V1 是一个面向开放持续学习的智能体模型系列,通过递归改进版本化模型-工具对实现自适应,并采用 Mixture-of-LoRA 架构冻结基础模型、组合专家 LoRA 适配器。旗舰版 Macaron-V1-Venti 基于 744B GLM-5.2 基础模型,配备四个 LoRA 模块,而 Macaron-V1-Tall 基于 Qwen3.6 用

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SWE-Bench ProMax:多语言大规模代码重构基准

Hugging Face 发布 SWE-Bench ProMax,一个由专家策划的多语言代码重构基准,包含 170 个实例,覆盖七种编程语言。该基准通过重写问题描述和人工审查测试套件,解决了现有基准中测试缺陷和训练数据泄漏的问题。实验显示,前沿模型在两种代理框架下的最佳解决率仅为 41.2%,表明该基准对当前 AI 编码代理构成有意义的挑战。基准已在 Hug

正文结构化主题已通过公开置信门槛
OpenAI Agents Python Releases一手来源产品发布

OpenAI Agents Python SDK v0.20.0 发布:默认模型更新与 MCP 兼容性改进

OpenAI Agents Python SDK 发布 v0.20.0 版本,将默认模型改为 gpt-5.6-luna,并支持 MCP Python SDK v1 和 v2。该版本还引入了 RunState.add input() 用于暂存持久化用户输入,并增强了沙箱挂载的凭证安全验证。此更新对使用自定义 MCP HTTP 传输的应用可能产生破坏性影响,需要

正文结构化主题已通过公开置信门槛
量子位研究

中国AI安全方案DoGNAVY获全球第三,超越OpenAI与Anthropic

加州大学伯克利分校发布的CyberGym基准测试显示,国内机构与达酷诺威联合研发的DoGNAVY以90.8%的通过率排名全球第三、中国第一,超越OpenAI和Anthropic的模型。DoGNAVY仅使用开源的GLM-5.2模型,通过结构化工作流、漏洞可达性分析、动静结合分析和知识库实现高效漏洞挖掘。其背后的AgentDoG架构提供智能体安全诊断能力,用小模

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.27.1 发布:多项 Bug 修复

PydanticAI 发布了 v2.27.1 版本,主要包含多项 bug 修复。修复了失败参数验证时的工具跨度恢复、XaiStreamedResponse 的 finish reason 映射、离线 Web UI 托管指向自包含聊天 UI 构建、Anthropic 上允许自适应思考与工具输出及强制工具选择,以及根据 include content 门控 Re

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

DeepSeek回应取外号争议,千问办公助理收费,英伟达筹5000亿美元建AI基建

本期资讯涵盖多个AI相关动态:DeepSeek回应了用户被取外号的争议,解释为临时对话标签;千问办公助理推出收费服务;DeepSeek-V4-Flash正式版周调用量全球第一;英伟达计划筹集5000亿美元用于AI基建;扎克伯格呼吁美国放宽开源AI限制。此外,还包括携程反垄断罚单、苹果测试长鑫存储芯片、宇树科技IPO等商业新闻。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

OpenAI 扩展网络安全服务 Daybreak,推出防御模型 GPT-5.6-Cyber

OpenAI 宣布扩展其网络安全防御服务 Daybreak,新增 Blue 和 Red 两个层级,并推出专为防御任务设计的模型 GPT-5.6-Cyber。该模型基于 GPT-5.6 Sol,仅向 Accenture、IBM、CrowdStrike、Cloudflare 等可信客户提供。此举旨在应对日益增长的 AI 代理攻击,但也引发关于其作为营销机会的争议