立场:推理是可学习的基于规则的过程
这篇立场论文指出,生成式AI领域对“推理”缺乏统一定义,导致推理评估的构念效度无法验证,阻碍了可信自主推理的进展。作者提出将有效且合理的推理视为一种可学习的、基于规则的过程,并提供了操作化定义和最佳实践清单,以促进研究交流。
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
这篇立场论文指出,生成式AI领域对“推理”缺乏统一定义,导致推理评估的构念效度无法验证,阻碍了可信自主推理的进展。作者提出将有效且合理的推理视为一种可学习的、基于规则的过程,并提供了操作化定义和最佳实践清单,以促进研究交流。
Z.ai 发布了 GLM-5.3 模型,目前仅在编程计划中提供,API 即将上线,两周后开放权重。该模型在多个基准测试中超越了 Moonshot AI 的 Kimi K3,部分指标甚至超过 Claude Fable 5 和 GPT-5.6-Sol,且参数量仅为 Kimi K3 的三分之一。Z.ai 表示 GLM-5.3 基于 GLM-5.2 的相同基础模型,
普林斯顿大学与英国AI安全研究所联合发布了一项研究,通过“影子评估”方法测试前沿AI模型(如Claude Opus 4.8和GPT-5.6)的自主研究能力。结果显示,这些模型能完成工程任务,但在研究判断、创造性问题解决和资源管理上存在系统性缺陷,生成的两篇论文均被原审稿人拒绝。该研究对Anthropic和OpenAI关于AI可加速自身研究的说法提出了质疑。
H2R-Bench是一个用于评估视频生成模型将人类操作视频转换为机器人中心演示的基准,涵盖跨具身约束和交互保真度。该基准包含人类演示视频、目标具身约束和源接地注释,通过五个维度评估生成视频。研究团队对11个最先进的视频生成模型在六个操作家族和两个机器人具身上进行了基准测试,发现当前视频世界模型在人类到机器人操作转移方面仍存在局限,即使在具身一致性、功能交互和
该研究对七种主流向量数据库系统(FAISS、Qdrant、Milvus、Weaviate、Chroma、pgvector、LanceDB)进行了全面实证评估,覆盖六个数据集、超过400万向量,测量了检索质量、查询性能和资源消耗等15项指标。结果显示FAISS吞吐量最高但缺乏数据库功能,Weaviate召回率最佳,Qdrant延迟最低,LanceDB索引构建更
本研究首次系统性地评估了多模态大语言模型(MLLM)生成网页的跨环境兼容性。研究者构建了包含2032个标注实例的WebCompat数据集,涵盖8种AI工具生成的网页在9种浏览器和设备组合下的渲染情况。研究发现68%的生成网页存在至少一个兼容性问题,主要症状为页面级布局失败(88.3%),根因包括缺失viewport meta标签(46%)和缺乏弹性布局(29
该研究针对代码大语言模型(LLM)的记忆化诊断方法在模型规模扩大时失效的问题,提出传统探针(如同义词模糊测试、死代码插入)在大型模型上无法有效暴露记忆化现象。通过应用可逆数学变换分离表示负载与记忆化,发现大型编码器能吸收表示负载并保持正确求解,表明评估应关注模型对表面形式变化的适应性,而非单纯依赖记忆化检测。
DarwinX 提出了一种通过自然选择进化智能体 harness(提示、工具、技能和控制流)的方法,在冻结基础模型的情况下,利用种群选择和验证器评估来提升性能。在多个基准测试中,该方法平均提升约 17 个百分点,例如 Terminal-Bench 2.1 从 75.5% 提升至 83.2%,WebArena-Infinity 从 43.5% 提升至 93.0
Hugging Face 每日论文介绍了 PlayWorld,这是一个用于评估交互式视频世界模型的新基准。它使用多模态智能体玩家在长时程目标下与模型交互,评估几何一致性、交互保真度和状态演化等维度。实验发现当前最先进的世界模型在长时程交互目标上仍不可靠,尤其是在空间一致性和持续状态演化方面。
VIDRAFT 推出了 AX-Ray,一个用于 AI 和 AX 部署的安全诊断层,基于 FINAL-Bench Diagnostics 构建。AX-Ray 在公开诊断中识别出 Zyphra/Zamba2-1.2B 和 nvidia/Nemotron-H-8B-Base-8K 两个模型存在因果泄漏缺陷,即前缀行为依赖未来 token,属于结构性正确性失败。该缺
Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。
Hugging Face 每日论文介绍了一项新研究,提出了叙事承诺保持(NCP)概念和 NCP-Bench 基准,用于评估大语言模型在交互式叙事中的长程逻辑一致性。基准包含 100 个基于电影情节的叙事环境,实验发现即使最强模型 GPT-5.2 在 20 轮后也只有 42% 的存活率,事实冲突率在 40% 到 68% 之间,表明当前模型在长程交互中难以保持一
TRACE Bench 是一个任务驱动的角色扮演智能体检查表评估框架,将角色档案分解为固定检查表,并通过用户智能体自然对话动态更新检查表状态,使评分可追溯到具体检查项和对话证据。实验显示,其覆盖率在更少轮次内达到 99.91%,而现有 M2 自由对话转录仅覆盖 73.74%。该框架支持 26 个模型的排名、能力分解和闭环基准演化,以提升评估的可审计性和可靠性
宾夕法尼亚州立大学的研究团队发现,在上下文压缩过程中,用户发出的会话约束(如“未经确认不要删除邮件”)会被静默丢弃,导致AI系统违反用户指令。他们提出了CompInt评估套件,涵盖多轮对话、智能体轨迹和长周期研究三种场景,并测试了多种压缩器,结果显示平均仅保留17%的约束。团队还开发了一种与压缩器并行的SC感知提取器,在不修改压缩器或LLM的情况下,将约束保
Backtrader-Bench 是一个用于评估 LLM 智能体在算法交易中能力的基准框架,包含确定性 MCQ 管道和生成器-求解器过滤管道,可自动生成并验证问题。在 30 道精选题目上,工具增强的智能体(如 GPT-5.5 和 Opus 4.7)单次准确率达 90.0%,比最佳无工具基线(73.0%)高出 17 个百分点。该框架旨在生成训练语料,用于强化学
TRACES 基准测试通过 42 篇撤稿、欺诈或伪科学论文,评估大语言模型在科学推理中的认知可靠性。测试发现,30 个模型在 71% 以上的智能体探针中失败,22 个模型失败率超过 90%,表明模型拒绝不可靠前提的能力主要基于主题安全行为而非真正的认知能力。该研究呼吁为科学部署的语言模型建立防护基础设施。
研究人员推出了MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准,包含六个领域的3万个样本。他们提出了MBA-b和MBA-k模型,通过LoRA微调和组相对策略优化,结合创造性和可行性奖励进行训练,显著优于文本和多模态基线。MBA-b和MBA-k分别比多模态基线提升25.6%和35.8%。
微软研究院推出新基准 MindTopo,用于评估多模态大语言模型的拓扑推理能力,涵盖连通性、封闭、顺序、分离和打结等概念。研究发现,当前模型在静态图像识别上表现较好,但在交互式规划任务中显著下降,错误多出现在规划阶段而非感知阶段。该基准旨在为机器人及交互环境中的 AI 系统提供诊断工具,并指出需要显式拓扑状态或保持拓扑的世界模型。
Hugging Face 博客发布了对 9 个小麦穗检测模型(YOLOv8、YOLOv11、YOLOv26、RF-DETR)在 GWHD 2021 数据集上的按国家分层评估结果。所有模型在中国子集上表现最佳,而多数 YOLO 模型在美国子集上表现最差,RF-DETR 则在澳大利亚表现最差,表明聚合分数掩盖了显著的领域偏移。该分析基于自建的 per-image
用户因在DavidAU的模型页面询问现代基准测试分数而被删除帖子并封禁,随后发布了对DavidAU 390多个模型的分析。分析指出这些模型仅使用2018-2019年的饱和基准(如ARC-C),且声称的智能水平基于单一基准的小幅提升,并引用论文证明ARC-C的难度是评估方法造成的假象。该事件揭示了模型评估中基准选择的问题及社区管理中的争议。