DeepMind 发布认知框架衡量 AGI 进展
Google DeepMind 发布了一篇新论文,提出基于认知科学的框架来衡量 AI 系统的通用智能进展。该框架定义了 10 种关键认知能力,并提出了三阶段评估协议。同时,DeepMind 与 Kaggle 合作举办黑客马拉松,总奖金 20 万美元,邀请社区为其中五种认知能力设计评估方案。
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 发布了一篇新论文,提出基于认知科学的框架来衡量 AI 系统的通用智能进展。该框架定义了 10 种关键认知能力,并提出了三阶段评估协议。同时,DeepMind 与 Kaggle 合作举办黑客马拉松,总奖金 20 万美元,邀请社区为其中五种认知能力设计评估方案。
Google DeepMind 发布了 Gemini 3.1 Pro,这是 Gemini 3 系列的核心推理升级版,旨在解决科学、研究和工程领域的复杂任务。该模型已在开发者产品(如 Gemini API、AI Studio、Antigravity)和企业产品(如 Vertex AI、Gemini Enterprise)以及消费者应用(如 Gemini 应用和
OpenCompass 发布 v0.5.2 版本,新增多个科学和通用基准测试支持,包括 SciReasoner、Biology Instructions、Mol Instructions、CMPhysBench、IFBench、LCB-pro 等。同时增加了对 Intern-S1-Pro 模型和 TeleChat API 的评估支持,并修复了多个 bug,改
Google DeepMind 发布了 Gemini 3 Deep Think 推理模式的重要升级,该模式专为科学、研究和工程领域设计,可处理缺乏明确规则和数据的复杂问题。新版 Deep Think 在多个基准测试中创下新高,如 Humanity's Last Exam 得分 48.4%、ARC-AGI-2 得分 84.6%、Codeforces Elo 3
Google DeepMind与Kaggle合作推出FACTS Benchmark Suite,扩展了原有FACTS Grounding Benchmark,新增参数化、搜索和多模态三个事实性基准,并更新了Grounding Benchmark v2。该套件共包含3,513个公开示例,由Kaggle管理私有测试集并主持公共排行榜,用于系统评估大语言模型的事实
Eugene Yan 撰文介绍产品评估(product evals)的三个基本步骤:标注小数据集、对齐 LLM 评估器、运行实验与评估框架。他建议使用二元标签(通过/失败或胜/负),并强调收集 50-100 个失败案例的重要性,同时避免使用合成缺陷,推荐使用较小模型生成有机失败样本。他还提出为每个维度单独构建评估器,并处理位置偏差,以确保评估器的一致性和泛化
OpenCompass 发布 v0.5.1.post1 版本,新增基于 ChatML 格式的快速数据集集成与评估方法,简化了数据集集成流程。同时集成了 SeedBench 和 BeyondAIME 两个新基准,并修复了多个 bug,更新了 CI/CD 流程。
OpenCompass 发布 v0.5.0 版本,新增了 10+ 科学基准数据集(如 MedXpertQA、ClimaQA、ProteinLMBench),支持级联评估器(Cascade Evaluator)和 Rjob Runner,并改进了 OpenAI SDK 流式支持。该版本还修复了多个 bug,增加了文档和评估示例,并欢迎了多位新贡献者。这些更新增
Eugene Yan 撰文探讨长上下文问答系统的评估方法,提出忠实性和有用性两个核心维度,并讨论了评估数据集构建、人类标注与 LLM 评估器,以及多个基准测试。文章强调忠实性要求答案严格基于文档,有用性则需相关、全面且简洁,并指出两者间的张力。最后给出针对具体用例的评估建议。
Chip Huyen 在博客中概述了构建生成式 AI 平台的通用架构,从最简单的查询-模型响应开始,逐步添加上下文增强(如 RAG)、护栏、模型路由、缓存等组件,并强调可观测性和编排的重要性。文章指出上下文构建类似于经典机器学习中的特征工程,RAG 是常见的上下文增强模式,并介绍了基于术语和基于嵌入的检索方法。该架构旨在帮助企业高效部署生成式 AI 应用,提
Lil'Log 博客文章聚焦大语言模型的外在幻觉问题,将其定义为输出与预训练数据或世界知识不符的捏造内容。文章分析了幻觉的成因,包括预训练数据问题及微调引入新知识的影响,并介绍了幻觉检测方法,如 FactualityPrompt 基准和 FActScore 指标。
Chip Huyen 在博客中探讨了预测性人类偏好(Predictive Human Preference)的概念,旨在预测用户对特定提示词更偏好哪个模型,并应用于模型路由和可解释性。她使用 LMSYS Chatbot Arena 的公开数据(2023年7月,33K 比较)作为基准,评估了 Bradley-Terry 等排名算法的准确性,并构建了一个玩具偏好