MineExplorer评测基准揭示多模态大模型在动态世界中的能力断层
原标题:让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层
AI 摘要
美团LongCat团队构建了MineExplorer评测基准,用于系统评估多模态大模型在开放世界中的长程任务能力。该基准包含813个人工验证的实例,通过隐藏前置条件、知识解耦和多智能体数据合成等创新设计,揭示了当前顶级模型在动态世界中感知强于推理、多跳任务成功率骤降等能力断层。评测显示最强模型Claude-Opus-4.6整体成功率仅41分,导航失败是主要错误来源。团队已全面开源该评测基准、自动合成任务方法和训练环境。
正文节选
让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层 假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: - 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。 - 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。 - 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。 MineExplorer