返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

3月18日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

DeepMind 发布认知框架衡量 AGI 进展

Google DeepMind 发布了一篇新论文,提出基于认知科学的框架来衡量 AI 系统的通用智能进展。该框架定义了 10 种关键认知能力,并提出了三阶段评估协议。同时,DeepMind 与 Kaggle 合作举办黑客马拉松,总奖金 20 万美元,邀请社区为其中五种认知能力设计评估方案。

2月20日周五 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Gemini 3.1 Pro 发布:推理能力大幅提升,覆盖多平台

Google DeepMind 发布了 Gemini 3.1 Pro,这是 Gemini 3 系列的核心推理升级版,旨在解决科学、研究和工程领域的复杂任务。该模型已在开发者产品(如 Gemini API、AI Studio、Antigravity)和企业产品(如 Vertex AI、Gemini Enterprise)以及消费者应用(如 Gemini 应用和

2月14日周六 · 1 条
正文结构化主题已通过公开置信门槛
OpenCompass Releases一手来源产品发布

OpenCompass v0.5.2 发布:新增多项基准测试与模型支持

OpenCompass 发布 v0.5.2 版本,新增多个科学和通用基准测试支持,包括 SciReasoner、Biology Instructions、Mol Instructions、CMPhysBench、IFBench、LCB-pro 等。同时增加了对 Intern-S1-Pro 模型和 TeleChat API 的评估支持,并修复了多个 bug,改

2月13日周五 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Gemini 3 Deep Think 升级:推动科学、研究与工程前沿

Google DeepMind 发布了 Gemini 3 Deep Think 推理模式的重要升级,该模式专为科学、研究和工程领域设计,可处理缺乏明确规则和数据的复杂问题。新版 Deep Think 在多个基准测试中创下新高,如 Humanity's Last Exam 得分 48.4%、ARC-AGI-2 得分 84.6%、Codeforces Elo 3

12月9日周二 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

Google DeepMind联合Kaggle发布FACTS基准套件,系统评估大模型事实性

Google DeepMind与Kaggle合作推出FACTS Benchmark Suite,扩展了原有FACTS Grounding Benchmark,新增参数化、搜索和多模态三个事实性基准,并更新了Grounding Benchmark v2。该套件共包含3,513个公开示例,由Kaggle管理私有测试集并主持公共排行榜,用于系统评估大语言模型的事实

11月23日周日 · 1 条
正文结构化主题已通过公开置信门槛
Eugene Yan教程

产品评估三步骤:标注、对齐与实验

Eugene Yan 撰文介绍产品评估(product evals)的三个基本步骤:标注小数据集、对齐 LLM 评估器、运行实验与评估框架。他建议使用二元标签(通过/失败或胜/负),并强调收集 50-100 个失败案例的重要性,同时避免使用合成缺陷,推荐使用较小模型生成有机失败样本。他还提出为每个维度单独构建评估器,并处理位置偏差,以确保评估器的一致性和泛化

10月17日周五 · 1 条
正文结构化主题已通过公开置信门槛
9月1日周一 · 1 条
正文结构化主题已通过公开置信门槛
OpenCompass Releases一手来源产品发布

OpenCompass v0.5.0 发布:新增科学基准与级联评估器

OpenCompass 发布 v0.5.0 版本,新增了 10+ 科学基准数据集(如 MedXpertQA、ClimaQA、ProteinLMBench),支持级联评估器(Cascade Evaluator)和 Rjob Runner,并改进了 OpenAI SDK 流式支持。该版本还修复了多个 bug,增加了文档和评估示例,并欢迎了多位新贡献者。这些更新增

6月22日周日 · 1 条
正文结构化主题已通过公开置信门槛
Eugene Yan观点

评估长上下文问答系统:忠实性与有用性

Eugene Yan 撰文探讨长上下文问答系统的评估方法,提出忠实性和有用性两个核心维度,并讨论了评估数据集构建、人类标注与 LLM 评估器,以及多个基准测试。文章强调忠实性要求答案严格基于文档,有用性则需相关、全面且简洁,并指出两者间的张力。最后给出针对具体用例的评估建议。

7月25日周四 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog观点

构建生成式 AI 平台:通用架构与关键组件解析

Chip Huyen 在博客中概述了构建生成式 AI 平台的通用架构,从最简单的查询-模型响应开始,逐步添加上下文增强(如 RAG)、护栏、模型路由、缓存等组件,并强调可观测性和编排的重要性。文章指出上下文构建类似于经典机器学习中的特征工程,RAG 是常见的上下文增强模式,并介绍了基于术语和基于嵌入的检索方法。该架构旨在帮助企业高效部署生成式 AI 应用,提

7月7日周日 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

大语言模型的外在幻觉:成因与检测

Lil'Log 博客文章聚焦大语言模型的外在幻觉问题,将其定义为输出与预训练数据或世界知识不符的捏造内容。文章分析了幻觉的成因,包括预训练数据问题及微调引入新知识的影响,并介绍了幻觉检测方法,如 FactualityPrompt 基准和 FActScore 指标。

2月28日周三 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog研究

预测性人类偏好:从模型排名到模型路由

Chip Huyen 在博客中探讨了预测性人类偏好(Predictive Human Preference)的概念,旨在预测用户对特定提示词更偏好哪个模型,并应用于模型路由和可解释性。她使用 LMSYS Chatbot Arena 的公开数据(2023年7月,33K 比较)作为基准,评估了 Bradley-Terry 等排名算法的准确性,并构建了一个玩具偏好