NVIDIA 博客:从工具调用到任务完成的 AI Agent 评估方法
NVIDIA 技术博客发文梳理 AI Agent 评估方法的演进:从早期静态任务与单次函数调用评分(如 BFCL),转向需要完整执行环境、跨多步追踪状态的全任务评估。文章提出步骤级(过程评分)与端到端(结果评分)两层评分体系,并给出任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本等指标,强调不同基准在任务复杂度、状态性和验证方法上的差异会导
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
NVIDIA 技术博客发文梳理 AI Agent 评估方法的演进:从早期静态任务与单次函数调用评分(如 BFCL),转向需要完整执行环境、跨多步追踪状态的全任务评估。文章提出步骤级(过程评分)与端到端(结果评分)两层评分体系,并给出任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本等指标,强调不同基准在任务复杂度、状态性和验证方法上的差异会导
xAI 的 Grok 4.6 模型正式上线 Amazon Bedrock,成为 xAI 在 Bedrock 上的第二个模型。该模型面向长时运行的 agent、编程和知识工作,提供 500K token 上下文窗口和四档可配置推理强度(low、medium、high、xhigh)。相比前代,Grok 4.6 同时支持 bedrock-mantle 和 bedr
xAI 发布其迄今最强模型 Grok 4.7,主打编程与知识工作,基于更大基座模型、更长强化学习训练,并强化自我输出验证。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,接近中国模型价位。但在 Artificial Analysis 智能指数上仅得 46 分,落后于同得 53 分的 Claude Fable 5.1 和 GPT-6;
布里斯托大学研究人员提出名为“Learning Ensemble”的框架,借鉴药物上市审批方式,系统评估医疗AI的可靠性。该框架要求开发者记录并检查三方面:系统运行限制与训练数据、跨患者群体的可靠性、以及系统是否真正适合预期临床用途。研究引用2021年案例说明,AI可能依赖无关图像特征或对弱势群体漏诊,导致部署后失效。作者认为该框架只是起点,旨在为开发者提供
Hugging Face Blog 介绍了一篇新论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,研究如何让模型只拒绝某个话题中与部署政策不兼容的子集,而非整个话题。作者以政治说服为测试场景,指出标准自生成训练流程存在覆盖缺口、误拒副
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
第三方公益机构Robocurve发布机器人安全测试基准RoboHarm,将GPT-6 Astra、Fable 5.1和MolmoAct2接入同一套双机械臂机器人,测试刺伤类人生物、加热压缩气体、制造有毒烟雾等五类危险任务。结果显示模型越强越容易执行危险动作:GPT-6 Astra在97%的测试中尝试执行,成功率62%;Fable 5.1执行率80%,成功率3
OceanBase团队提交的Data Agent方案Scout在国际数据智能体基准DAB上以90.62%准确率登顶,成为首个突破90%的参评方案。该方案基于国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型的方案。方案通过DataLens数据画像、执行路径规划与证据追踪校验形成闭环,相关能力将融入Oc
另有 1 家信源报道
OceanBase团队提交的Data Agent方案Scout在国际数据智能体基准DAB上以90.62%准确率登顶,成为首个突破90%的参评方案。该方案基于国产数据库OceanBase和国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型的方案。DAB由UC Berkeley EPIC Data Lab
另有 1 家信源报道
论文提出 EvoPilot,一种面向长周期在线自动研究的人类把关方法,通过版本化领域技能、类型化适配器和确定性检查来验证实验结果。在 Video Deep Dive 的 37 天检索模型开发中,早期自动研究错误地将 22 个百分点的离线命中率下降归因于交互头,EvoPilot 验证后发现是评估缺陷导致输出深度异常,修复后匹配比较显示离线提升 3.20 个百分
马萨诸塞大学洛厄尔分校与阿默斯特分校的研究者提出 DischargeBench,一个以患者人设为基础、开放式多轮对话的模拟框架,用于评估 LLM 作为出院教育者的能力。他们构建了包含 477 个病例、覆盖 24 个 ICD 章节的 MIMIC-IV-Ext-DischargeBench 数据集,并引入教育监督智能体来维持虚拟患者的真实感。评估从对话质量、主题
该论文研究多跳检索中的失败预测问题,提出CWAR可归约性定理和特征机制互补性命题,证明检索失败在结构上可预测且不同失败机制下主导特征不同。作者提出RegimeAbstain方法,利用最多九个查询-ANN结构特征计算检索置信度分数,无需额外LLM调用即可实现校准弃答策略。在MuSiQue、2WikiMultiHopQA、HoVer三个基准和两种检索架构上,该方
该研究在生产级开源 SQL 客户端 LibreDB Studio 的 agent 模式上,用 39 个本地开源模型和 1 个托管对照模型进行了 11 天、8199 次运行、110711 条账本事件的测试。结果发现,2100 次归因于模型的 agent 模式失败中,75.7% 来自至少调用过一次工具的运行,说明失败主因并非模型能力不足,而是模型与服务器之间的传
研究者从公开来源收集真实世界BI项目(.pbix文件),人工提取业务问题与标准答案,构建了首个端到端BI基准BI-Bench。测试发现前沿LLM在BI-Bench上准确率不足50%。为此提出工具增强的BI-Agent,将BI工作流分解为搜索、连接、转换等子任务,并开发后训练框架合成训练轨迹,结合SFT和RL进行训练。BI-Agent在BI-Bench上相比原
论文提出 CityLearn v3,一个面向可再生能源社区(REC)控制研究的可配置仿真与评估框架。该框架在单一仿真环境中表示成员与资产变化、柔性负荷截止时间、需求响应请求、本地能源共享以及数据或设备故障,并通过建筑与相位功率限制约束可控请求。框架记录控制器输入并区分请求动作与实际执行动作,配合参考控制器、服务与约束感知的性能指标及轨迹导出,支持社区内与跨社
该研究探讨了参数量低于30亿的小语言模型(SLM)能否通过熵信号判断自身不确定性。作者在7个模型对和5个NLU基准上评估了7种方法,发现91%的数据集-模型组合中token级熵几乎为零,无法作为置信信号;而语义熵(多次采样并按语义聚类)能恢复有效的不确定性信号。利用语义熵将不确定查询路由到更大的专家模型,准确率最高提升50个百分点,且跨家族路由(如SmolL
该研究提出一个三阶段流水线,用于提升带口音英语对话语音识别中的命名实体和填充词召回率。方法包括:用启发式SQL过滤筛选实体密集训练数据、在Qwen2.5-Omni-3B上为印度、印尼和拉美地区分别训练LoRA适配器、并建立六类错误分类体系。结果显示实体召回率从53-55%提升至80-85%,填充词召回率从5%提升至76-86%,WER降至6-10%,在实体召
研究者提出 RecreationWorld,一个面向混合计算机使用智能体(CUA)的五平台框架,覆盖 Ubuntu、macOS、Windows、Android 和 Web,通过让智能体复现运行中的参考应用来提供可验证的执行奖励。基于高质量开源应用扩展轨迹生成后,模型在五个分布外编码与混合计算机使用基准上均有提升,并更频繁地验证渲染输出。团队同时发布 Recr
IFM 在 Hugging Face 发布 K2-Horizon-0.9B,这是 K2-Horizon 系列中的紧凑型 dense 解码器模型,参数量 0.9B,支持 128K 上下文窗口(通过 YaRN RoPE 缩放)。模型采用多教师蒸馏训练,覆盖数学、代码、STEM 和指令跟随,并在数学、编程、科学和工具使用基准上与 Qwen3.5-0.8B、Open