NUS Show Lab 寿政:融合自回归与离散扩散,打造具身大模型底座
原标题:NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
AI 摘要
新加坡国立大学 Show Lab 负责人寿政教授在 ECCV 2026 上介绍了 Show-o 系列统一多模态模型,该架构在单个 Transformer 中融合自回归预测与离散掩码扩散生成,解决文本离散性与视觉连续性难以统一的问题。团队进一步提出循环一致性监督实现理解与生成的双向反哺,并通过 3D Tokenizer 与时空双向注意力提升连续视频生成质量。研究还将统一架构延伸至具身智能,提出 VLA、世界模型与世界动作模型(WAM),并采用云端大模型加端侧微调模型的部署策略实现低延迟控制。
正文节选
告别模型拼贴套路,自回归与离散扩散的融合,正在开启 AI 的体验时代。 作者丨张璐 编辑丨岑峰 “理解”和“生成”真的无法在同一个模型底座中完美融合吗?不同于拼接独立模型的传统做法,NUS Show Lab 选择了一条更原生的架构路线:在单个 Transformer 中同时打通自回归预测与离散扩散生成。作为多模态领域的重磅成果,Show-o 系列不仅打破了模态壁垒,更将触角延伸至具身机器人决策。在 ECCV 2026 现场,Show Lab 负责人寿政教授详细还原了他们如何用闭环算法破解数据稀缺、消除连续视频帧卡顿,并实现云端大模型与端侧低延迟控制的完美配合。寿政教授此次披露的研究成果,不仅是一次性能的跨越,更是多模态架构从“实验玩具”向“具身大脑”进化的分水岭。其核心突破点在于以下三个维度的重构:首先,在架构底层,Showo 架构打破了文本离散性与视觉连续性的“死