返回全部动态

Spatial-TTT:2B模型流式空间记忆超越GPT-5

原标题:腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026

雷峰网 AI科技评论研究质量 83

AI 摘要

清华、腾讯混元与南洋理工研究团队在ECCV 2026发表论文,提出Spatial-TTT架构,通过测试时训练让2B模型在推理时动态更新参数,以流式处理长视频并构建三维空间记忆。该模型在VSI-Bench和MindCube-Tiny基准上超越GPT-5和Gemini-3-pro,解决了算力与记忆断裂问题。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Spatial-TTT 给 2B 模型装上“流式空间记忆” ,在空间基准上超越 GPT-5。     作者丨张   璐     编辑丨幸丽娟                                                                                                         单纯拉长上下文,可以解决“能塞进多少信息”的问题。但面对状态变化、时序关联这类长程任务时,注意力还是容易被稀释,关键证据也容易找不回来。当场景扩展到具身机器人、自动驾驶和智能硬件这些需要与三维物理世界实时交互的领域时,这一矛盾被进一步放大。与纯文本或静态图文不同,真实物理世界的输入天然是持续涌入、没有明确边界的视频流。智能体在空间中移动时,视角不断切换、物体频繁被遮挡,这些都要求系统必须具备流式空间智能——一边接收视频流,一边实时构建并更新环境的三维空间记忆。主流方案在处理这种连续视频流时,普遍在工程与架构上面临两重限制: - 算力与显存边界的硬性制约:基于标准 Transformer 自注意力机制的计算与 KV Cache 显存开销随序列长


发布时间:2026-09-09 10:26
抓取时间:2026-09-09 13:23
来源机构:雷峰网
阅读原文leiphone.com