GPT-6 Astra 在空间推理基准测试中展现阶跃式提升
原标题:GPT-6 Astra appears to show a "step change" in spatial reasoning based on early benchmarks
AI 摘要
OpenAI 的 GPT-6 Astra 在一个名为 StationeryBench 的新机器人基准测试中展现出空间推理能力的显著提升。该测试让 Astra 与 Ai2 的 MolmoAct2 在相同双臂 YAM 机器人上完成五类桌面物体任务,共 200 次试验。Astra 完整完成 7/100 任务,MolmoAct2 为零;Astra 中位进度分 46,MolmoAct2 为 12。康奈尔大学与 Google DeepMind 的研究员 Yoav Artzi 称其为空间推理的“阶跃变化”,并推测 OpenAI 使用了大量 3D 数据(如 Blender 场景)进行训练。
正文节选
GPT-6 Astra appears to show a "step change" in spatial reasoning based on early benchmarks GPT-6 Astra appears to be a big leap forward for spatial reasoning. A new robotics benchmark called StationeryBench pits OpenAI's GPT-6 Astra against Ai2's MolmoAct2 across five desk-object tasks like uncapping a marker, pouring out paper clips, or passing a ruler between two robot arms. Both models controlled the same dual-arm YAM robots across 200 trials. Astra fully completed 7 out of 100 tasks; MolmoAc