英伟达发布 Cosmos 3 世界基础模型,欲统一具身智能全模态
原标题:英伟达 Cosmos 3 深度拆解:它想做具身智能时代的「安卓系统」| RSS 2026
AI 摘要
英伟达在悉尼 RSS 2026 上发布 Cosmos 3,这是一个面向物理 AI 的多模态世界基础模型,在单一 Transformer 架构下统一了文本、视觉、音频和动作模态。Cosmos 3 提供 Edge(4B)、Nano(16B)和 Super(64B)三个版本,支持世界理解、未来模拟和动作执行,并完全开源。英伟达物理 AI 专家 Max Li 在演讲中强调,该模型旨在成为具身智能时代的标准化基础,通过边缘端优化让模型在 Jetson 设备上实时运行。
正文节选
0 编辑丨岑峰 2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。 AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。 这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界对规模效应的“迷信”正面交锋。 就在这场范式撞击的火山口上,英伟达物理AI专家Max Li,为我们拆解了其新发布的重量级产品——Cosmos 3。 这不再仅仅是一个更逼真的视频生成器:它是全球首个在同一个 Transformer 架构下,彻底打通了文本、视觉、音频和动作全模态的世界基础模型。如果说过去两年的具身智能还处于“组装机”时代:开发者需要吃力地将视觉模型、语言模型和控制算法像乐高一样拼凑在一起,那么 Cosmos 3 的出现,则宣告了“整机一体化”时代的到来。