返回全部动态

清华与NVIDIA新研究:VLM大模型当具身教练,Gemini领跑,VLM-AR3L降本增效

原标题:把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

雷峰网 AI科技评论研究质量 79

AI 摘要

国立清华大学与NVIDIA联合研究将Gemini 2.0、GPT-4.1等主流VLM大模型置于《我的世界》等具身任务中评估其视觉裁决能力,发现Gemini综合表现最佳,开源小模型在特定任务中反超。针对直接调用大模型的高成本和绝对打分缺陷,团队提出VLM-AR3L框架,通过双奖励融合与离线蒸馏将API查询降低约20倍,并在复杂任务中超越人类手写奖励。该研究为大模型与具身智能结合提供了低成本高效的新范式。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。 过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。 为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。 论文链接:https://arxiv.org/pdf/2607.00483 01 研究团队选用的 10 个典型任务,涵盖了具身智能的四大主流仿真套件。 其中既有 Cart Pole(倒立摆平衡)这类考察基础刚体平衡控制的任务;也包含了 Straighten Rope(


发布时间:2026-09-03 18:09
抓取时间:2026-09-03 20:19
来源机构:雷峰网
阅读原文leiphone.com