返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月9日周三 · 7 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

代理治理何时有效:GAMPO框架与能力门控证据

该研究提出了GAMPO框架,基于321篇文献综合,用于设计受治理的自生成目标AI代理组织。在CHI-Bench医疗基准上的实验表明,治理收益受模型剩余能力限制:弱模型上完整程序无效甚至有害,而一句“验证写入”提示使pass@1翻倍;前沿模型上,基于案例的答案盲完成定义比通用程序更有效,将预授权成功率从40%提升至68%(单次)或84%(五次自洽)。研究为探索

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

CrossModalQA:面向多模态检索增强生成的跨模态多跳基准

本文提出了 CrossModalQA,一个用于评估多模态检索增强生成(RAG)的开域基准,包含 1,863 个问答对,基于 4,987 篇维基百科文章和 4,431 张维基共享图片构建,覆盖五种跨模态推理路径,平均推理深度为 3.50 跳。实验表明现有多模态 RAG 系统难以恢复完整证据链,且不完整检索可能引入干扰,导致性能低于闭卷模型;完整跨模态检索比生成

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

CriticGen:将生成感知评估转化为可操作的反馈

CriticGen是一个细粒度、生成感知的评估框架,旨在将评估转化为可操作的答案改进控制。它首先生成样本特定的评估维度和评分标准,然后基于这些标准联合生成分数、理由、可执行的改进建议和改进后的答案。实验表明,CriticGen提高了评估相关性和覆盖率,改善了分数相关性,并将基于标准的理由和可执行建议的F1分数从0.6369/0.5994提升到0.7554/0

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

群核科技联合多方发布三篇ECCV论文,为物理AI构建基础设施

群核科技联合英伟达、英特尔、Adobe、浙江大学等机构,在ECCV 2026上发表三篇论文,分别推出高保真具身仿真器SPEAR、在线自进化合成数据框架Syn-GRPO和交互式空间智能评测基准WalkerBench,旨在为物理AI构建涵盖仿真、训练、评测的基础设施。这些成果试图解决具身智能训练环境、数据质量和空间智能评估等核心瓶颈,并已在实验中展示性能提升。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

利用 Bedrock AgentCore 与 GitHub Actions 实现 agent 自动化评估

AWS 博客介绍了如何使用 Amazon Bedrock AgentCore 和 GitHub Actions 构建自动化 agent 评估的 CI/CD 质量门禁。该方案通过 CDK 部署 agent 和 MCP 服务器,利用 AgentCore Evaluate API 对 agent 响应进行评分,并在评分下降时阻止 PR 合并。文章详细说明了 OAu

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源研究

AWS 基准测试:G7 Blackwell 实例在小型 LLM 推理中优于 G5/G6

AWS 在 SageMaker AI 上对 30B MoE 模型(Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B)进行了 G7(Blackwell)与 G5、G6、G6e 实例的推理基准测试。结果显示,G7 凭借原生 FP4 支持和更高内存带宽,在吞吐量、延迟和成本效益上优于前代实例。文章介绍了使用 SageMake

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源研究

滴滴基于Amazon Bedrock构建智能客服质检系统

滴滴国际业务集团与AWS合作,基于Amazon Bedrock构建了智能客服质检系统,覆盖西班牙语和葡萄牙语的出行、外卖和金融服务。该系统包含意图验证、合规评估和客户之声分析三个核心流程,将意图验证准确率从38%提升至86%,合规评分准确率超过90%,并将人工摘要时间从数小时压缩至数分钟。文章详细介绍了系统架构、设计原则及面临的挑战。

9月7日周一 · 6 条
正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源研究

EdgeBench:衡量真实环境学习并发现新扩展定律

字节跳动Seed Research发布了EdgeBench,一个超长时程基准,用于衡量智能体在真实环境中的持续学习能力,包含134个任务,每个任务支持至少12小时交互。研究发现,智能体的环境学习性能遵循log-sigmoid曲线,拟合优度R²=0.998,且前沿模型的学习速度约每三个月翻倍。EdgeBench已开源51个任务和完整评估框架,以促进社区研究。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

MedProb:探测医学视觉问答中视觉语言模型的内部表示

MedProb 是一个轻量级线性探测框架,通过冻结视觉语言模型(VLM)的内部表示来预测医学视觉问答(Med-VQA)的多选题答案,无需自由文本生成。在 PATH-VQA、SLAKE 和 VQA-RAD 基准上,MedProb 比提示方法恢复了更多与答案相关的信号,并优于医学微调 VLM 和智能体系统。研究发现,生成式评估可能低估小型模型中的可恢复信号,且医

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

AI招聘系统综述:从匹配模型到招聘代理的评估与治理

这篇系统化综述梳理了AI招聘系统从匹配模型到智能招聘代理的演变,分析了从相似性匹配到互惠适配、从单一模型到复合工作流、从离线预测到证据与生产力对齐评估的三重转变。综述指出当前评估存在行为标签混淆、数据外部有效性有限、最终输出掩盖流程失败等问题,并提出分阶段映射评估证据与可辩护结论的框架,强调未来系统应具备证据基础、可审计性和成本风险约束。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

EvoHarnessBench:评估智能体在演化 harness 下的适应能力

EvoHarnessBench 是一个新基准,用于评估 LLM 智能体在工具、技能和智能体三个维度上不断演化的外部 harness 下的表现。它包含 17 个多阶段流、802 个任务、520 个工具、42 个技能和 62 个智能体,并区分部署评估和自进化适应评估。研究发现,harness 扩展会导致智能体在已解决任务上性能下降,即 harness 诱导的遗忘

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Harbor Adapters与Harbor-Index:大规模智能体评估基础设施与精选元数据集

Harbor Adapters 和 Harbor-Index 项目为大规模智能体评估提供了统一基础设施和精选元数据集。他们开发了适配器,将超过80个基准测试移植到Harbor框架,并对8个模型在54个基准上进行了大规模评估。Harbor-Index包含82个高质量任务,旨在保持挑战性的同时降低成本。所有代码、结果和数据集均已开源。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

Qdrant 发布 100 亿向量开源基准数据集及 Supernova 框架

Hugging Face 与 Qdrant、Vultr 合作发布了 Qdrant-FineWeb-10B,这是一个包含 100 亿向量的开源向量搜索基准数据集,基于 FineWeb 语料库生成。同时,Qdrant 开源了 Supernova 框架,用于自动化嵌入生成、暴力 ground truth 计算、数据库加载和评估。该数据集和框架旨在解决现有基准在规模

9月6日周日 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Artificial Analysis 更新智能指数,回应 GPT-6 Astra 评分质疑

Artificial Analysis 发布了其智能指数 4.2 版本,以回应此前对 GPT-6 Astra 评分准确性的质疑。更新后,GPT-6 Astra 的得分较前代提升 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1。新指数引入了两个新基准,并增加了私有测试数据的权重,以防止模型作弊。

9月4日周五 · 6 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

GPT-6 Astra 基准测试结果矛盾,ARC-AGI-3 效率超人类引关注

OpenAI 的 GPT-6 Astra 在不同基准测试中表现矛盾:Epoch AI 认为其领先,而 Artificial Analysis 认为其与前任持平。在 ARC-AGI-3 测试中,Astra 首次以高于人类的效率完成任务,ARC Prize 负责人 François Chollet 因此将 AGI 预测提前。Astra 在成本效率上表现突出,但部

正文结构化主题已通过公开置信门槛
Latent Space模型发布

OpenAI 发布 GPT-6 Astra:旗舰模型引发性能与治理争议

OpenAI 发布了旗舰模型 GPT-6 Astra,宣称其是最智能且最对齐的模型,主打计算机使用、软件工程、数学科学等能力,并逐步向组织、ChatGPT 用户、API 和 AWS 开放。发布过程出现延迟和访问问题,OpenAI 通过补偿机制缓解用户不满。第三方评测显示 Astra 在编码和智能指数上与竞品相当或略逊,但成本效率更高,同时引发了对可监控性和评

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

拒绝不可能:大语言模型代码幻觉的分类法与基准

该研究提出了一种代码幻觉的分类法,将代码幻觉定义为无根据的生成,区别于普通代码错误,并构建了包含270个不可满足提示的对抗性基准。对12个开源模型的评估显示,模型在约60%的不可满足提示上生成无根据代码,仅拒绝27%,且未错误拒绝可解控制任务。研究还发现,拒绝行为与表面合理性相关,模型能力提升对理论不可能性幻觉有改善,但对虚构包和API的幻觉影响甚微。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

反例作为智能体自我修正的反馈:A-CEGIS 框架

A-CEGIS 是一个轻量级框架,利用反例作为反馈来评估智能体在自然语言到正则表达式合成中的多轮自我修正能力。在 30 个 NL-RX-Turk 任务上,诊断性反例反馈在四轮内解决了 90% 的任务,而零样本生成、通用自我修正和仅错误反馈的解决率分别为 17%、27% 和 23%。完整诊断运行后,所有任务在最终轮次均被解决,平均成功轮次为 2.7,鲁棒成功率

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

现成LLM需求质量评估基准:性能、误报与漏检分析

弗吉尼亚理工大学和亚利桑那大学的研究人员首次对现成LLM在需求质量评估中的表现进行了基准测试,基于INCOSE标准评估了OpenAI和Anthropic两大家族共十个模型。结果显示,最佳Anthropic模型仅能检测出47%的专家识别问题,同时产生11%的误报,且对必要性和正确性问题的漏检严重。研究还发现模型代际进步非单调,温度采样影响有限,表明现成LLM尚

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

CHSR-RRF:面向教育RAG的课程门控混合检索框架与泄漏感知基准

CHSR-RRF 是一个面向教育领域 RAG 的课程门控混合检索框架,在检索前应用元数据约束,结合稀疏与稠密检索及倒数排名融合,以减少课程泄漏。作者还提出了 CERB 基准(126 个案例),实验显示预检索门控将泄漏率降低 4.6 倍,而检索后过滤会导致召回率归零。研究表明教育检索应视为约束选择问题,在候选池构建时强制有效性。