谷歌推出全球首个双盲 AI 评估,防止基准污染
Google DeepMind 推出了全球首个针对专有前沿 AI 模型的双盲评估,通过与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在加密环境中测试 Gemini Flash Lite 模型,以防止基准污染。该技术利用密码学手段确保外部评估问题在测试前不被模型看到,从而提升评估的完整性和可信度。此举旨在增强政策制定
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 推出了全球首个针对专有前沿 AI 模型的双盲评估,通过与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在加密环境中测试 Gemini Flash Lite 模型,以防止基准污染。该技术利用密码学手段确保外部评估问题在测试前不被模型看到,从而提升评估的完整性和可信度。此举旨在增强政策制定
AWS 发布了 Amazon Bedrock AgentCore Evaluations,该服务通过 OpenTelemetry 标准解耦了代理评估与具体框架,支持 LangGraph、LlamaIndex、OpenAI Agents SDK 等多种框架。它自动读取调用代理、推理和工具执行三类 span,并利用 LLM-as-a-judge 进行统一评分,无
MIT Technology Review 报道称,AI 模型在空间推理、记忆适应性和抽象视觉推理等智力测试中仍存在明显短板。哥伦比亚大学和谷歌等机构的研究显示,模型在 Connections 谜题上进步显著,但在心理旋转、骑士与无赖变体及 ARC-AGI 等任务上仍常出错。文章通过多个示例谜题,展示了人类与 AI 认知方式的差异,并邀请读者测试自己能否在这
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安
博洛尼亚大学和伦敦大学学院的研究人员调查了大型语言模型(LLM)生成文本的创造力自动评估方法的可靠性。他们收集了人类对WritingPrompts数据集中人类和AI生成短故事的11个创造力维度的评估,并与自动客观指标和LLM-as-a-Judge评估进行比较。实验发现自动评估与人类判断存在显著不一致,LLM法官系统性地偏好AI生成的故事,而广泛使用的自动指标
Anthropic 宣布启动一项 500 万美元的资助计划,用于资助独立研究,以评估 AI 对用户幸福感的影响。该计划将为受资助者提供资金、模型访问权限和技术支持,帮助他们构建开源评估工具,并发布供开发者使用的开源项目。Anthropic 强调幸福感评估的复杂性,并寻求涉及临床专家、反映真实多轮对话场景的评估方案。申请截止日期为 9 月 21 日。
Hugging Face 发布了 ArmBench-ASR v0.1,一个用于评估亚美尼亚语自动语音识别(ASR)模型的基准,包含近30个模型和约20.7小时的音频。Gemini 2.5 Pro 以14.31%的严格WER排名第一,而最强的开源模型是 NVIDIA 的 Armenian FastConformer,排名第9。基准显示模型性能高度依赖领域,电影
LitReview Arena 是一个用于评估文献综述智能体的竞技场式平台,通过领域专家对匿名草稿进行多维度的偏好投票。研究收集了约3000条专家判断,发现最强模型在整体效用上仅以23.0%的胜率击败人类草稿,而Sonar Deep Research等智能体LLM比基础模型性能提升超过60%。此外,现有LLM-as-a-judge方法与人类专家存在显著不一致
arXiv 论文提出 Cora(反事实可观察冗余审计)框架,用于可审计的网站冗余 AI 审计。Cora 将冗余分解为重复负载、正常使用税和故障域恢复储备三个维度,并通过版本化视觉语言模型提出注释,经类型化验证和发布检查后选择性发布分数。在透明机制测试台上,Cora 的分解表示优于标量负载基线,但两个小型视觉语言模型因未满足发布要求而被拒绝自动评分。该框架定位
该论文研究了引用在人类和LLM偏好判断中的作用,基于SciArena和ResearchQA两个科学问答数据集,使用混合效应模型分析。主要发现包括:人类偏好引用更多样但总数更少的回答;LLM对引用的偏好与人类不同,且不同LLM之间也存在差异。研究结果对偏好数据收集和奖励建模具有启示意义。
Wazobia Labs 发布了 Wazobia Eval,一个针对尼日利亚皮钦语的情感理解、讽刺检测和文化推理的基准测试。该基准基于包含超过550个示例的手动标注数据集,并引入了一个16类别的文化情感分类体系。其目标是填补现有评估基准对尼日利亚皮钦语等低资源语言覆盖不足的空白,为尼日利亚语言AI提供标准化的评估基础设施。数据集已在 Hugging Face
本文重新审视了用于轮播推荐评估的N2DCG指标,指出其理想排序违反轮播约束且折扣函数不符合用户实际浏览行为。作者提出了一种改进的N2DCG公式,通过尊重约束进行归一化,并采用基于经验数据的折扣函数。在真实眼动数据上的验证表明,新指标能更好地反映用户行为,并更准确地预测轮播布局的比较结果。
原力灵机发布具身智能模型DM0.5,登顶RoboDojo基准测试,综合得分24.90,平均成功率19.34%,并在记忆任务中表现突出。该模型在LIBERO、RoboTwin 2.0等多个评测中取得领先,并已全面开源,包括模型权重、训练框架和下游工作流。DM0.5通过长记忆、具身思维链和高效推理优化,实现了9.29倍加速,旨在推动具身智能生态发展。
纽约大学阿布扎比分校与阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings发表论文,构建了首个多语言医疗错误评测基准MedErrBench,覆盖英语、中文和阿拉伯语,测试了GPT-4o、Gemini、Llama、Qwen、DeepSeek等模型。研究发现医疗专用模型在错误检测任务上不如通用模型,且英文原生模型在中文原生数据上表现更好。该基准旨在
NVIDIA 技术博客介绍了 SemiAnalysis 的 AgentX 基准测试,用于评估 AI 基础设施在代理式编码推理中的性能。该基准通过重放真实编码代理会话,测量每兆瓦吞吐量等指标。NVIDIA 公布的预览结果显示,Vera Rubin NVL72 在 AgentX 工作负载下每兆瓦吞吐量比 GB300 NVL72 高出 30 倍,而 GB300 N
中国AI4S企业深度原理联合微软研究院、斯坦福大学等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,用于系统评价AI在真实科研中的表现。该体系强调全程记录科研决策,并重新定义失败数据的价值。深度原理的MIRA平台已在多个基准测试中取得第一,展示了该评估框架的实践应
Langfuse 发布 v4.17.0 版本,主要更新包括新的评估用户体验、从 trace 表和事件表创建标注队列、显示任意元数据、迁移 UI 默认显示、支持 Anthropic Messages 作为 Langfuse Assistant 的模型提供商,以及多项修复和优化。该版本还改进了 MCP 清理、评估器模型过滤和监控调度器,并移除了 Assistan
Mastra 发布 2026 年 8 月 21 日更新,引入调用方驱动的实验 API,支持外部编排器(如 Temporal)管理实验循环,同时保持 Mastra 作为记录系统。新增优雅关闭和 HTTP 排空控制,改进会话中“活动期间”消息传递,并增强工作流恢复的并发安全性。还新增多轮 LLM 评判评分器,用于评估多轮对话。
Hugging Face 团队在构建药物预测基准 LEADBOARD 时发现,数据分割方式对模型性能评估影响巨大:时间分割与随机分割在同一数据集上 AUROC 相差 0.21。此外,跨文献的标签噪声(噪声下限)显著,hERG 数据中 90% 的重复测量差异超过 20 倍。团队因此采用时间或骨架分割,并公开噪声下限以帮助解读排名。
Hugging Face 博客宣布举办 FINCHAL 金融预测挑战赛,这是一场 AI 与人类交易员的竞赛,涉及 NVIDIA、比特币、黄金和石油四种资产,总奖金 2000 美元。该竞赛旨在通过随机基准和自检评分代码来区分运气与技能,并允许 AI 代理与人类平等参与。竞赛采用仓位连续值(-1 到 1)的评分机制,并固定杠杆为 1,以避免过度投机。