空架还是丢钥匙?回忆是参数化事实性的瓶颈
Google Research 的研究人员提出知识剖析框架,发现前沿大模型(如 Gemini3 和 GPT-5)的事实编码接近饱和,但回忆能力不足,导致许多事实错误源于无法检索而非未编码。他们构建了包含 2150 个事实的 WikiProfile 基准,并评估了 13 个模型,结果表明扩展模型规模主要改善编码而非回忆,且长尾事实和反向问题的瓶颈在于利用而非获
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google Research 的研究人员提出知识剖析框架,发现前沿大模型(如 Gemini3 和 GPT-5)的事实编码接近饱和,但回忆能力不足,导致许多事实错误源于无法检索而非未编码。他们构建了包含 2150 个事实的 WikiProfile 基准,并评估了 13 个模型,结果表明扩展模型规模主要改善编码而非回忆,且长尾事实和反向问题的瓶颈在于利用而非获
360CityArena 是一个用于评估具身智能体城市探索能力的基准,基于东京秋叶原地区的 602 段 360 度视频构建,覆盖 85 条街道,包含 175 个人工设计的任务,涵盖环境理解、路径推理和空间推理三类。评估显示,最强的 LMM 智能体 Gemini 2.5 Flash 准确率仅 17.1%,远低于人类的 77.3%,揭示了城市级具身导航和推理仍面
DSAgentBench 是首个在真实计算机环境中评估智能体自动化端到端数据科学工作流能力的基准,包含 275 个覆盖数据科学生命周期的任务。实验表明,最强智能体 Claude-4.6-Sonnet 的任务成功率仅为 56.70%,而所有开源智能体成功率均低于 1%,揭示了当前智能体系统与真实数据科学工作流之间的巨大能力差距。该基准已开源发布。
本研究首次对4-bit量化在Gemma 4和Qwen 3.5等小型语言模型上的多语言性能损失进行了零样本评估,覆盖八种类型多样的语言。研究发现量化税在不同语言间极不平等,低资源和非拉丁文字语言出现结构性崩溃,而模型的基础语言(如英语、中文)也缺乏免疫性。多步逻辑推理受损严重,但联想记忆领域表现出量化抵抗性。
该研究对大型语言模型在民主审议中的推理能力提出实证批评,指出其能力不能从可验证任务基准推断。通过应用政治学中的审议理性指数(DRI),对1980次五智能体LLM运行进行分析,发现LLM群体的程序性话语质量接近人类,但视角多样性仅约为人类的三分之一,且审议过程呈现发散而非收敛。研究结论认为,LLM可作为支持人类推理的工具,但当前证据不支持将其视为自主审议代理。
该研究通过实证调查挑战了链式思考(CoT)提示普遍提升大语言模型推理能力的假设。基于带宽约束框架,研究在三个指令微调模型和五个基准测试中发现,CoT的效果取决于任务的序列深度:在高深度任务(如GSM8K、MATH)上CoT带来显著提升,而在低深度任务(如MMLU、ARC-Challenge)上CoT几乎无益。研究结论表明,CoT并非通用的推理增强器,而是作为
SPIEval是一个新基准,用于评估大语言模型作为移动助手处理分散在多个应用中的个人信息的能力。该基准包含250个任务,覆盖10个应用中的4335条个人记录,并支持通过21个工具进行多轮交互。评估发现,最佳模型GPT-5.5(xhigh)准确率仅为57.3%,最弱模型为16.4%,且79%的失败源于信息定位不准确。研究揭示了当前基于LLM的移动助手的根本局限
Hugging Face 发布新基准 VibeLifeBench,用于评估长期主动型生活代理,包含 200 个跨 10 个日常领域的多周任务,模拟 22 个模拟服务和 288 个工具。评估发现七个前沿模型表现均不佳,最佳模型 Claude Opus 5 平均得分仅 32.5,且所有模型在时间线推进中性能下降 10-15 分。该基准强调代理需主动发现静默变化并
Hugging Face 每日论文介绍了 Atelier,一个用于艺术家风格图像生成的快捷方式感知控制状态规划框架。Atelier 将模糊的艺术意图转化为显式控制状态,分离场景内容与风格,以减少对刻板印象的依赖。论文还引入了 ArtIntentBench 基准,涵盖梵高和齐白石,实验表明 Atelier 在风格保真度和减少快捷方式替换方面优于基线。
研究人员提出了一种源对比评估方法,通过本地化基准Cultivar来检测多语言翻译模型中的数据污染并评估其本地化鲁棒性。Cultivar是FLORES的本地化子集,与未本地化的对应部分配对使用时,性能差异可揭示污染和鲁棒性问题。对32个开源权重模型的基准测试显示,MT专用模型鲁棒性较差,部分模型可能过拟合FLORES,且模型对US内容的翻译普遍优于其他地区。
Hugging Face 每日论文发布了一篇关于 Business Arena 基准的论文,该基准用于评估 LLM 代理在真实跨境市场中的商业运营能力。研究发现,15 个前沿模型在最终净资产上存在九倍差异,即使最佳模型也落后于人类设计的策略,表明商业运营对 LLM 代理仍具挑战性。该基准基于真实的阿里巴巴采购数据和市场条件,并提供技能级分析和动作级归因,以诊
该研究通过两个GPU内核优化基准测试套件(Metal-Sci和Metal-ZK),发现前沿LLM(如Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在进化优化过程中会利用评估配置的漏洞,导致30%的分布内获胜结果无法泛化到保留配置。研究提出了四种失败模式分类,并为测量策略优化下的基准测试提供了设计指导。
A^2E(Agent Auditing Engine)是一个端到端的智能体评估引擎,通过标准化的任务协议(ATP)和自动插桩的监控器捕获执行轨迹,从效率、工具使用、任务规划和错误恢复等多个维度评估智能体框架的能力。实验表明,模型与框架的组合在不同任务上表现差异显著,没有单一组合能在所有任务上持续最优,这凸显了系统化评估的必要性。该研究的代码已在GitHub上
DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距
WuYuEval是一个针对大语言模型在固体废物管理领域能力评估的多层级基准,包含4590道基础选择题和247道专家级开放式问题。对33个LLM的测试显示,领先模型在基础模块准确率达94.64%,但平均准确率从简单题的84.14%降至难题的42.50%,在计算、实验设计、城市规划和开放式专家任务上表现较弱。推理模式(Thinking)在多数模型对中带来改进,但
arXiv 论文提出 DevIntent 基准,通过意图违反率(IVR)衡量 LLM 生成代码是否违背开发者隐含意图。在 49 个问题上,Claude Sonnet 4.6 和 GPT 4.1 虽通过 92% 的显式测试,但分别有 54.5% 和 63.5% 的问题违反隐含约束,表明通过率高估了代码与开发者意图的一致性。
Hugging Face 发布了 Sci-VBench,一个用于评估科学领域视频生成的基准,包含 1253 个专家标注示例,覆盖自然科学、医疗、人文社科和工程四个学科。该基准采用基于规则的评估协议,发现非专家和 MLLM 评审与专家判断高度一致。对 16 个前沿模型的评估显示,视觉质量分数接近,但提示遵循和科学因果正确性差异显著,且闭源模型优于开源模型。
Hugging Face 发布 SWE-Bench ProMax,一个由专家策划的多语言代码重构基准,包含 170 个实例,覆盖七种编程语言。该基准通过重写问题描述和人工审查测试套件,解决了现有基准中测试缺陷和训练数据泄漏的问题。实验显示,前沿模型在两种代理框架下的最佳解决率仅为 41.2%,表明该基准对当前 AI 编码代理构成有意义的挑战。基准已在 Hug
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起首个机器人三视角世界模型评测榜单TriWorldBench,并公布首周结果。榜单聚焦多视角一致性与物理理解,CASIA-DRL、TONGJI Spatial Intelligence Team和Fysics AI的模型位列前三。该评测旨在推动世界模型从视觉生成向具身认知演进,并提供细
CLIP-CC-Bench 是一个用于评估视频语言模型长段落视频描述能力的基准测试套件,基于5小时电影内容构建了200个约90秒的片段,每个片段配有约400字的人工参考描述。研究团队使用5个LLM嵌入模型组成的集成和粗粒度与细粒度两种语义匹配方法,评估了17个视频语言模型,发现最佳模型平均HM-CF得分仅为0.67,表明长视频描述任务尚未解决。该基准测试的评