返回全部动态
李飞飞发布全球首个多模态世界模型Atlas
原标题:李飞飞发布:全球首个多模态世界模型
AI 摘要
李飞飞创立的World Labs发布了全球首个多模态世界模型Atlas,该模型能够基于单张图片生成具有像素级相机控制的视频,并完成3D重建和时空模拟。Atlas采用多模态自回归扩散Transformer架构,支持机器人Real-to-Sim工作流,为具身智能训练提供新途径。目前Atlas已向部分合作伙伴开放早期访问。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
李飞飞发布:全球首个多模态世界模型 一张图补全3D世界,还能给机器人造训练场 鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI 「全球首个」多模态世界模型,来了! 来自李飞飞World Labs。 World Labs对这个名为Atlas的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟: 建模世界,移动相机,模拟空间和时间。 就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且空间和时间都能理解。 李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶: Atlas为从视觉特效到机器人的众多应用场景打开了大门。 飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。 具体来说,Atlas是一个多模态自回归扩散Transformer,它的能力包括: 相机控制生成:仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。 空间重建:Atlas可以基于一张到数十张输入图像,重建真实世界场
发布时间:2026-09-02 09:07
抓取时间:2026-09-02 09:23
来源机构:量子位