返回全部动态

HelixWorld 1.0发布:实时可交互音视频世界模型,将完全开源

原标题:终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

量子位模型发布质量 81

AI 摘要

Noiz AI联合香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员发布了实时可交互音视频世界模型HelixWorld 1.0,支持24 FPS画面和48kHz立体声实时生成,画面与声音由原生Transformer架构统一生成。该模型通过四步技术路线实现声画同步响应动作,并将在未来几周完全开源。团队认为这补上了世界模型在声音方面的短板,并计划向多智能体、多人现场等方向发展。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成 即将完全开源 允中 发自 凹非寺 量子位 | 公众号QbitAI 太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。 4K、物理一致性,画面越来越真,时长也越来越长。 但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。 世界模型带来的变化,恰恰在这里。 它会跟随操作实时渲染、动态生成世界。 按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。 你不再是被动的观看者,而是真正的参与者。 而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。 放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。 可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。 你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不


发布时间:2026-08-17 15:39
抓取时间:2026-08-17 16:33
来源机构:量子位
阅读原文qbitai.com