返回全部动态
李飞飞等联手提出MVA:机器人直接借用视频模型,15小时实现跨本体泛化
原标题:李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIR Paper 115
AI 摘要
斯坦福李飞飞、吴佳俊、张吕民及哈佛Yilun Du等学者联合发表论文MVA,提出将机器人动作转化为像素遮罩轨迹,直接利用现成视频生成模型Wan2.2,仅用15小时数据微调即可实现跨本体泛化。该方法通过URDF和逆运动学解算,解决了机器人跨机型迁移难题,挑战了机器人需专属大模型的主流认知,对具身智能产业影响深远。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 作者丨邓哲敏 编辑丨齐铖湧 今年视频生成和具身智能领域,阵容最为豪华的一篇“融合体论文”出现了。 前几天,一篇名叫Masked Visual Actions for Unified World Modeling的论文,挂在 arxiv 上,这篇工作还未在学术圈传开,但绝对马上就要爆了。 因为它的署名栏和论文内容都实在太炸裂了,大家自己看吧。 不仅包括李飞飞,ImageNet 缔造者,如今全力押注空间智能;吴佳俊,斯坦福助理教授,物理推理方向代表人物,刚获得热乎的 IJCAI 2026 计算机与思维奖,还没领奖;张吕民,ControlNet 作者,如果你用过 AI 绘画里照着姿势生成人物的功能,你已经在用他的技术。 还有斯坦福计算成像实验室负责人 Gordon Wetzstein、机器人基础模型核心推动者黄文龙等十多位顶尖学者。 更让AI科技评论(雷峰网(公众号:雷峰网)公众号)意外的是哈佛助理教授 Yilun Du,也在其中。 因为大家可能知道,他和李飞飞,恰好是具身智能领域两条路线的代表人物。一个主张让 AI 直接在看得懂的画面里思考,一个主张把一切先压缩成抽象数字再思考,学术交
发布时间:2026-08-06 18:42
抓取时间:2026-08-06 21:00
来源机构:雷峰网