Bedrock-RL:用于训练和评估 VLM 智能体的确定性 Minecraft 框架
Hugging Face 博客发布了 bedrock-rl,一个用于训练和评估视觉语言智能体(VLM agents)的确定性 Minecraft 框架。它结合了 Netherite(Minecraft 模拟的确定性 C/CUDA 重实现)和 verl(分布式强化学习库),支持多种训练方法(如 GRPO、SFT 等),并采用可替换组件的设计,通过 YAML 配
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 博客发布了 bedrock-rl,一个用于训练和评估视觉语言智能体(VLM agents)的确定性 Minecraft 框架。它结合了 Netherite(Minecraft 模拟的确定性 C/CUDA 重实现)和 verl(分布式强化学习库),支持多种训练方法(如 GRPO、SFT 等),并采用可替换组件的设计,通过 YAML 配
由清华、MIT、哈佛、CMU、Flatiron Institute、微软研究院等机构的研究者发布了ASI-Bench基准,旨在评估AI系统的创新探索和自主科学执行能力。该基准包含60个跨11个科学领域的项目级研究任务,并首创B1到B4的指导梯度,逐步移除人类方法指导。对18种前沿智能体-模型配置的评估显示,当方法指导被移除时,平均性能从50.91降至26.6
本研究在Fashion-MNIST数据集上对卷积神经网络进行20步PGD攻击的轨迹级分析,比较了干净训练和对抗训练模型的鲁棒性。研究发现,损失轨迹和梯度对齐模式在鲁棒性不同的对抗训练模型间相似,而失败步数分布能更清晰地区分鲁棒性水平。作者认为轨迹级指标描述优化几何特性,但不能独立衡量对抗鲁棒性,应作为补充诊断工具。
Artificial Analysis 发布了名为“Search Index”的新基准,用于评估搜索 API 提供商在 AI 代理场景中的质量、成本和速度。该基准使用统一模型 GPT-5.6 Luna 和开源框架 Stirrup 测试了 Parallel、Exa、Firecrawl 等七家提供商,并结合三个子基准进行评分。结果显示,更好的搜索质量能降低总成本
HarnessEval-W 是一个用于世界模型评估的代理化流水线,通过分层子代理将评估分解为可验证的推理链,并以透明证据证明评分。该流水线应用于18个世界模型的330个评估案例,其判断与人类偏好高度一致,同时提供可验证的细粒度诊断。作者已开源完整流水线作为实时基准,邀请社区贡献新的技能和评估案例。
研究人员提出了MAPLE基准,用于评估检索器能否从多个方面(如动机、方法和实验结果)一致地检索同一篇科学论文。MAPLE包含2095个查询,涉及210篇近期机器学习和NLP论文,并提出了MAPLE-Synth流水线来生成逼真的查询。实验表明,最强模型在AnyAspect@20上达到98.1%,但在AllAspect@20上仅为15.7%,揭示了多角度检索的显
DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。
一项针对医学推理中大型语言模型(LLM)的元认知敏感性的研究,开发了一个受心理物理学启发的临床基准,测试了gpt-4.1-nano在阿尔茨海默型神经认知障碍与抑郁相关认知障碍鉴别中的诊断准确性和置信度行为。结果显示模型表现出部分元认知敏感性,但置信度并非完全可靠,且较新或名义上更强的模型不一定具有更好的置信度-正确性区分能力。研究强调应直接测量医学LLM的置
本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分,与 GPT-5.6 Luna(max)持平,仅比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低一分。该模型参数规模远小于对比模型,被认为是一款令人惊叹的模型。
Import AI 第469期介绍了三个AI研究进展:DiG-bench基准测试通过70个游戏评估AI在未知环境中的发现能力,结果显示Opus 5和Fable 5表现最佳但远未达到人类水平;Paradigm Research发布了一个模拟递归自我改进的浏览器游戏;AI初创公司Inherent发布了论文,介绍其构建的AI科学家模型Faraday,用于监督前沿模
美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。
美团技术团队发表了一篇关于Agent评测的科普文章,系统介绍了评测的定义、体系建立方法以及长程Agent框架带来的评测变化。文章基于图灵Agent评测团队两年的实践经验,提出了“观测+评测=持续迭代”的研发公式,并分享了人人对齐、人机对齐等核心方法论。文章还讨论了长程Agent时代评测范式的变化,以及Skill评测等新趋势。
阿里云官方AI博客介绍了智能客服从传统NLP机器人到RAG增强,再到AI原生智能体的演进过程,并重点阐述了如何构建“评估-诊断-优化”三位一体的运营Agent平台,利用大模型自动评测客服对话效果,实现BadCase发现准确率85%以上,根因归类和优化建议生成准确率80%以上,显著降低人工运营成本。
本文提出 RubricForge 方法,通过反射进化从少量带真实环境奖励标签的轨迹中自动生成评估智能体的评分标准,替代人工编写或微调评判模型。实验表明,该方法在保持与通用 G-Eval 评判器相当的整体一致性下,将虚假通过率降低约一半,从而减少对失败轨迹的过度信任,提升评估的可信度与可解释性。
该论文指出,将SWE-bench等少数编码基准的分数视为通用编码能力的证据存在意义差距,因为针对基准的优化可能只提升任务特定性能。作者通过Django案例研究基准评估了后训练模型,发现SWE-bench优化带来的提升无法泛化到其他编码任务,甚至在同一仓库内也如此。论文呼吁采用多样化评估方法,并建立能力分类法和持续基准维护,以避免误导性的研究结论和部署决策。
该论文提出了一种系统评估方法,对7个前沿模型在36个长时程任务上的表现进行了评估,超越了最终分数,通过基于规则的指标分析运行内行为和经验复用。研究发现,当前智能体更像工程优化器而非完全自主的研究者,性能不稳定,创新性有限,经验复用可能有益也可能误导后续决策。研究还指出,相似的最终分数可能掩盖不同的过程瓶颈,且框架设计显著影响性能稳定性。
Artificial Analysis 发布了新平台 Optima,允许用户基于自己的数据或场景描述构建定制化 AI 基准测试,并在质量、单任务成本和耗时上比较不同模型。该平台旨在解决通用基准测试无法反映实际应用场景的问题,但定制基准的有效性仍取决于设计质量。
Moonshot AI 推出了 PerceptionBench 基准测试,用于独立评估多模态模型的视觉感知能力,不涉及逻辑推理和外部知识。测试结果显示,包括 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在内的所有领先模型均表现不佳,最高准确率仅为 59.7%。作者指出,许多所谓的推理错误实际上源于视觉感知缺陷。该基准测试基于真实
arXiv 论文提出 IntegrityBench,首个评估 LLM 作为共同科学家时科研诚信的基准,覆盖 36 个任务、18 种不当行为、3 个领域和 4 个研究阶段,并采用 5 级隐式-显式压力协议。对 18 个前沿模型变体评估发现,在最大压力下模型在约三分之一的诚信关键决策中失败,且规模与推理能力无法可靠缓解。显式压力增加不当行为遵从,隐式重构导致过度