返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2395 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月21日周一 · 20 条
正文结构化主题已通过公开置信门槛
量子位商业

天工工作台推 Seedance 2.5 特惠:0.27 元/秒并叠加流量与承制权益

昆仑万维旗下 SkyProduction(天工工作台)联合火山引擎推出中秋国庆促销,将 Seedance 2.5 720P 生成价格降至 0.27 元/秒,并叠加积分加赠、DramaWave 流量加权兑换码和短剧承制权益三重福利。文章以成本、流量、商业、入局四本账展开,引用 DataEye、昆仑万维财报等数据说明 AI 短剧制作成本下降但投放成本上升的行业现

正文结构化主题已通过公开置信门槛
量子位产品发布

长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全方案

9月19日,在第一届中国网络空间安全大会(CCSC 2026)的人工智能安全与应用治理论坛上,长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案,分别覆盖大模型内容安全、智能体应用安全与AIGC内容可信传播。实验室主任刘俊华发表主题演讲,介绍AI安全治理技术进展与产业实践,并称2025年已落地25个私有化项目、2026年日均调用次数突破数

正文结构化主题已通过公开置信门槛
量子位研究

OceanBase登顶国际Data Agent榜单,准确率首破90%

OceanBase团队提交的Data Agent方案Scout在国际数据智能体基准DAB上以90.62%准确率登顶,成为首个突破90%的参评方案。该方案基于国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型的方案。方案通过DataLens数据画像、执行路径规划与证据追踪校验形成闭环,相关能力将融入Oc

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

OceanBase Data Agent登顶国际DAB榜单,准确率超90%

OceanBase团队提交的Data Agent方案Scout在国际数据智能体基准DAB上以90.62%准确率登顶,成为首个突破90%的参评方案。该方案基于国产数据库OceanBase和国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型的方案。DAB由UC Berkeley EPIC Data Lab

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位开源

清华联手无问芯穹等开源具身智能体基础设施RPent

清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将通用大模型的任务规划能力与VLA等专家模型的精细操作能力结合,并加入记忆系统与统一接口,形成感知-决策-执行-反馈闭环。在LIBERO-PRO基准上达到92.6%任务成功率,Flash Mode将端到端任务完成速度优化7倍以上。RPent由RLinf核心团队打造,已覆盖多种仿真环境与真实机器

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

EvoOntology:面向数据智能体的自演化本体层

该论文提出 EvoOntology,一个面向数据智能体的自演化本体层,旨在弥合智能体与异构数据(表格、文件、数据库)之间的鸿沟。EvoOntology 将本体封装为包含模式层、内容层和工具层的 MCP 服务器,使智能体可在运行时主动查询本体,并通过构建智能体与自演化循环持续优化本体。在三个数据智能体基准和四个 LLM 基座上的实验表明,其性能持续优于强基线及

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

验证而非信任:面向大规模视频发现检索的智能体模型开发

论文提出 EvoPilot,一种面向长周期在线自动研究的人类把关方法,通过版本化领域技能、类型化适配器和确定性检查来验证实验结果。在 Video Deep Dive 的 37 天检索模型开发中,早期自动研究错误地将 22 个百分点的离线命中率下降归因于交互头,EvoPilot 验证后发现是评估缺陷导致输出深度异常,修复后匹配比较显示离线提升 3.20 个百分

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

DischargeBench:以患者人设模拟评估 LLM 出院教育能力

马萨诸塞大学洛厄尔分校与阿默斯特分校的研究者提出 DischargeBench,一个以患者人设为基础、开放式多轮对话的模拟框架,用于评估 LLM 作为出院教育者的能力。他们构建了包含 477 个病例、覆盖 24 个 ICD 章节的 MIMIC-IV-Ext-DischargeBench 数据集,并引入教育监督智能体来维持虚拟患者的真实感。评估从对话质量、主题

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

小语言模型驱动数据库代理的失败原因

该研究在生产级开源 SQL 客户端 LibreDB Studio 的 agent 模式上,用 39 个本地开源模型和 1 个托管对照模型进行了 11 天、8199 次运行、110711 条账本事件的测试。结果发现,2100 次归因于模型的 agent 模式失败中,75.7% 来自至少调用过一次工具的运行,说明失败主因并非模型能力不足,而是模型与服务器之间的传

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

为LLM智能体可控舆论动力学引入贝叶斯信念层

研究者提出 Bayesian Chronicle Agents (BCA),在 LLM 智能体的 persona 与语言生成之间加入一个显式贝叶斯信念层,将每个立场表示为概率,每听到一句话做一次贝叶斯更新,并用单一 prior-strength 参数控制固执程度。该参数可扫描出共识、持续分歧、坚定少数影响三种经典舆论动力学机制,并在四个 LLM 上验证了信念

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

Proxifield:基于语义邻近度的去中心化多智能体通信

该论文提出 Proxifield,一种去中心化的多智能体通信协议,通过智能体演化中的语义邻近度构建稀疏通信图,无需模型训练或集中式规划器,在推理时利用直接寻址、信息需求、计划对齐和信息互补四种路由信号连接智能体。在无人机搜救和 HiddenBench 集体推理两个领域,Proxifield 在最大规模模型(397B)下优于 Star 和 Shared Con

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

BI-Agent与BI-Bench:迈向端到端商业智能自动化

研究者从公开来源收集真实世界BI项目(.pbix文件),人工提取业务问题与标准答案,构建了首个端到端BI基准BI-Bench。测试发现前沿LLM在BI-Bench上准确率不足50%。为此提出工具增强的BI-Agent,将BI工作流分解为搜索、连接、转换等子任务,并开发后训练框架合成训练轨迹,结合SFT和RL进行训练。BI-Agent在BI-Bench上相比原

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源安全

Loopjacking:劫持人类在环审批的安全边界

该论文提出「Loopjacking」概念,指人类在环审批中,人类批准的操作与系统实际执行的操作不一致,导致审批安全边界失效。作者区分了表示型攻击(审批时展示不完整或误导性表示)和审批后状态替换攻击(审批后可变状态被替换)。在Agno AgentOS 3.0.9、LangGraph Agent Server 0.14.0和OpenClaw 2026.2.23等

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

BirdsongChat:多模态具身行为模拟的混合多智能体框架

研究者提出 BirdsongChat,一个混合多智能体框架,用于多模态具身行为模拟。该框架通过统一参数表示(UPR)将基于 LLM 的推理智能体与物理模拟智能体连接,把多模态输入转化为可解释的行为状态和控制参数,从而生成同步的 3D 运动、空间化声音和环境行为。原型系统以鸟类行为模拟为测试平台,在文本和图像引导场景中取得跨模态一致性 94.4%、情感一致性

正文结构化主题已通过公开置信门槛
量子位模型发布

阶跃发布 Step 5 Preview:600B MoE 架构,Agent 能力实测

阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,采用 MoE 架构,600B 总参数、激活参数仅 27B,支持 1M 上下文,在 Artificial Analysis 评测中取得 44 分,位列全球开源模型 Top 2。作者实测其 Agent 能力,用其操作 Blender 建模、制作 3D 游戏和 2D 小游戏,发现模型能自主补充 Prom

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RecreationWorld:可扩展可验证的混合计算机使用智能体环境

研究者提出 RecreationWorld,一个面向混合计算机使用智能体(CUA)的五平台框架,覆盖 Ubuntu、macOS、Windows、Android 和 Web,通过让智能体复现运行中的参考应用来提供可验证的执行奖励。基于高质量开源应用扩展轨迹生成后,模型在五个分布外编码与混合计算机使用基准上均有提升,并更频繁地验证渲染输出。团队同时发布 Recr

正文结构化主题已通过公开置信门槛
量子位商业

沙利文报告:商汤大装置居中国Neocloud市场第一

弗若斯特沙利文联合头豹研究院发布《中国全栈AI云服务市场报告 2026H1》,报告显示商汤大装置以近50%的市场份额位居中国Neocloud市场第一。报告将全栈AI云厂商分为综合云计算厂商与Neocloud两类,并指出2026年是Agentic AI元年,Agentic AI对算力要求较传统大模型提升10倍以上。商汤大装置强调端到端系统化能力、算电协同、国产

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Code2Skill:从代码大规模合成可验证智能体技能

该论文提出 Code2Skill,一个全自动流水线,可从源代码中提取可验证的程序性技能,构建出包含 1,006,822 条记录的 CodeSkillBank。在覆盖九种模型设置和八个基准的 72 项评估中,使用检索到的技能后模型平均提升 11.7%,并在 57 个案例中优于基线。研究还显示,从 AI 生成代码合成的技能通过率达 93.50%,略高于人类编写代

正文结构化主题已通过公开置信门槛
量子位商业

IDC评估中国AI算力管理平台:范式综合评分第一,四项维度满分

IDC发布《中国AI算力管理平台技术能力评估,2026》,对多家主流AI算力管理平台厂商进行评估,范式综合评分位列第一,并在算力资源管理、算力运维、技术架构、交付服务四个维度获满分。报告指出AI基础设施正从基础算力平台演进为企业智能化转型的核心IT基础设施,评估覆盖六大维度。范式以不绑定芯片厂商的统一管理软件为核心,已适配十余家主流芯片,并披露某政策性银行通

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

传化集团40周年开放300多个产业场景,投入3亿元拥抱AI

传化集团在创业40周年之际举办场景开放与AI共创生态大会,宣布全面拥抱AI时代。董事长徐冠巨提出AI生命力在产业场景,宣布开放300多个产业场景、首年投入不少于3亿元AI与数字化订单,并通过揭榜挂帅、孵化平台和基金体系推动共创。传化科技城发布AI+药械、AI+生物制造、AI+农业三大类10项场景,并与宇树科技、新石器无人车、浙江大学等多家机构签署科研与场景共