返回全部动态

IJCAI 2026综述:人类视频如何桥接机器人动作学习

原标题:IJCAI 2026 专访:机器人想学会人类动作,还差一座桥 | GAIR Paper 118

雷峰网 AI科技评论研究质量 80

AI 摘要

清华大学、香港科技大学、微软亚洲研究院等机构在IJCAI 2026发表综述论文,提出人类视频与机器人动作之间的‘表示桥’框架,将现有方法分为潜在动作、显式2D、显式3D和世界模型四条路线。论文指出这些路线本质是选择不同的监督信号层级,可叠加使用,并分析了各自局限与开放挑战。作者冯志远认为世界模型研究逻辑更完整,但工业界目前VLA+RL效果更好,具身智能的GPT-3.5时刻可能还很远。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨邓哲敏 编辑丨齐铖湧 大模型时代,规模化的数据能带来能力跃迁,这一规律已被反复验证。 当这套范式进入机器人领域,问题变得复杂。机器人需要的不仅是大量数据,而且是能够转化为动作能力的数据。 人类视频近期成为研究者关注的新来源。它规模巨大、获取成本低、覆盖场景丰富,但它毕竟不是机器人数据,视频里没有机器人动作标签,人类手部运动也无法直接对应机器人的控制信号。 问题由此产生:人类视频进入机器人学习流程后,究竟应该被表示成什么? 过去一年,研究者给出了不同答案:有人把动作压缩到隐空间,有人让模型学习视频背后的世界规律,也有人直接提取二维、三维轨迹。但这些路线究竟是彼此竞争,还是在解决同一个问题? 今年 IJCAI 2026 ,一篇来自清华大学、香港科技大学、微软亚洲研究院等机构联合推出的综述论文,试图重新梳理这一领域:不同方法的本质,都是在人类视频与机器人动作之间搭建一座 representation bridge。 AI科技评论(雷峰网公众号)采访了论文一作、清华大学博士生、微软亚洲研究院实习研究员冯志远,拆解这篇论文背后的技术路线与行业判断。 01 在语言模型快速发展的这几年,一


发布时间:2026-08-07 14:09
抓取时间:2026-08-07 17:10
来源机构:雷峰网
阅读原文leiphone.com