返回全部动态

AtlasVLA:通过持久世界-自我状态建模提升具身AI长时程操作

原标题:AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

Hugging Face Daily Papers一手来源研究质量 88

AI 摘要

AtlasVLA 提出了一种用于视觉-语言-动作模型的新框架,通过持久世界-自我状态建模,将反应式控制转变为主动推理,以解决部分可观察和长时程任务中的感知遗忘和任务进度遗忘问题。该框架采用双记忆架构,包括4D持久世界状态记忆和自我工作状态记忆,并基于扩散变换器进行条件生成。在LIBERO、RLBench和真实世界基准测试中,AtlasVLA仅使用腕部相机即达到最先进性能,在LIBERO-Long和真实世界长时程任务中分别比多视角基线高出9.4%和17.5%的绝对成功率。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models Abstract AtlasVLA improves embodied AI by replacing reactive control with proactive reasoning via persistent world-ego memory, enabling robust long-horizon manipulation from a single wrist camera. While Vision-Language-Action (VLA) models have advanced embodied AI, their fundamentally reactive paradigm severely limits performance in partially observable and long-horizon tasks. When restricted to a single wrist-mounte


发布时间:—
抓取时间:2026-08-13 12:59
来源机构:Hugging Face
阅读原文huggingface.co