AtlasVLA:通过持久世界-自我状态建模提升具身AI长时程操作
原标题:AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
AI 摘要
AtlasVLA 提出了一种用于视觉-语言-动作模型的新框架,通过持久世界-自我状态建模,将反应式控制转变为主动推理,以解决部分可观察和长时程任务中的感知遗忘和任务进度遗忘问题。该框架采用双记忆架构,包括4D持久世界状态记忆和自我工作状态记忆,并基于扩散变换器进行条件生成。在LIBERO、RLBench和真实世界基准测试中,AtlasVLA仅使用腕部相机即达到最先进性能,在LIBERO-Long和真实世界长时程任务中分别比多视角基线高出9.4%和17.5%的绝对成功率。
正文节选
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models Abstract AtlasVLA improves embodied AI by replacing reactive control with proactive reasoning via persistent world-ego memory, enabling robust long-horizon manipulation from a single wrist camera. While Vision-Language-Action (VLA) models have advanced embodied AI, their fundamentally reactive paradigm severely limits performance in partially observable and long-horizon tasks. When restricted to a single wrist-mounte