AtlasVLA | arxiv 2026.8.7 | Paper Reading
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
这同样是一篇关于记忆VLA的文章,特色的地方是文章强调了优势在于只使用了第一视角作为图像观测的输入并通过设计的记忆机制使得在只有有限视角输入的情况下依然取得了超过很多优秀baseline的结果,比较值得我学习,毕竟实验室目前采用的就是单一腕部相机视角进行实验的。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 首次 | memory+VLA | wrist camera | 2026-08-07 |
1.What?
AtlasVLA,一种通过持久化世界-自我状态(world-ego state)从直接反应式操作过渡到主动推理的新框架。AtlasVLA采用双记忆架构:4D持久世界状态记忆(4D Persistent World State Memory),将瞬时2D观测提升为全局更新的体素哈希空间状态,以解决视觉盲区;以及自我-工作状态记忆(Ego-Working State Memory),用于跟踪历史自我状态和任务进度。通过将扩散Transformer(DiT)基于这一联合WorldEgo状态进行条件化,AtlasVLA实现了稳健的空间推理。
2.Why?
当前的VLA模型本质上仍以反应式范式运作。它们主要充当反射式引擎,直接将即时观察映射为动作,高度依赖瞬时视觉输入来支配物理行为。如图一(封面图所示)反应式模式在非结构化、部分可观测的环境中部署时暴露了两个关键瓶颈,尤其是在严格的单个腕装相机设置下。首先,反应式VLA模型会因部分可观测性而遭受严重的感知遗忘(图1(A))
从根本上说,相机瞬间的视野(FoV)并不等同于真实的世界状态。当机器人操作物体时,腕部相机随末端执行器动态移动,不断改变视野。关键的任务相关物体和空间结构一旦离开视野,便会立即被遗忘。如果没有持久内部状态,智能体就会失去对其周边空间环境的追踪(例如,“箱子在哪里?”),从而在脱离高度仪器化的多视角设置的环境下运行时导致灾难性的执行失败。其次,反应式模型在长时程操作中饱受任务进度遗忘的困扰(图1(B))。复杂任务,例如按顺序整理物体或更改配置,要求智能体执行多个子步骤,同时对其进度保持清晰的认知意识。标准VLA模型(Intelligence等,2025;Li等,2024)缺乏历史上下文来记忆已经完成的内容。如果没有关于任务进度和自身状态的内部记忆,智能体很容易在整体执行序列中迷失位置,导致错误累积,并重复或遗漏关键子步骤。
人类认知并不依赖始终可见的全知摄像头来与世界互动。相反,人脑通过维持一个内部世界模型——一种持续的认知地图,即使在物体、结构和动态离开直接视线时也能对其进行追踪——来无缝应对部分可观测性。要实现真正的自主性,具身智能体必须超越反应式行为,发展出构建并维持持久世界-自身状态的能力。这需要从无记忆观测的范式转变为由连续循环主导的范式:局部观测 → 潜在状态更新 → 持久世界状态 → 未来动作。为了克服这两个瓶颈,具身智能体必须超越反应式行为,发展出维持持久隐藏状态的能力。
3.How?

AtlasVLA,一种新颖的、由世界-自身状态增强的VLA框架,旨在将范式从反应式观察转变为主动式长时程操作(图1©)。AtlasVLA通过双记忆架构,从有限的自我中心观测中持续重建和更新环境的隐藏状态。首先,为了解决部分可观测性问题,AtlasVLA采用了持久世界状态记忆。它利用流式深度估计和空间反投影将瞬时的2D腕部观测提升到4D潜在空间。通过邻域融合和滑动窗口,持续更新全局的、体素哈希的持久世界状态,使智能体能够保留全面的工作空间观测,并有效克服腕部相机有限的视场。其次,为防止历史遗忘,持久世界状态与自我工作状态记忆(Ego-Working State Memory)集成。该模块建立了以自我为中心的高层语义记忆,隐式表示历史自我状态和任务进度,确保智能体始终记住已完成的操作以及下一步需要执行的操作。凭借这种世界-自我双记忆架构,AtlasVLA在持久世界状态和自我工作状态上执行逐步条件化的扩散变换器(DiT),生成稳健且准确的动作。
遵循先前的工作(Kim等人,2024;Black等人,2024),我们将VLA驱动的机器人操作建模为序列决策问题。与先前严重依赖第三人称或多视角输入的方法(Kim, Finn, and Liang 2025; Black等人,2024; Li等人,2025a)不同,我们施加了严格的仅手腕观测约束。形式上,在任意给定时间步t,智能体仅接收腕载视觉观测Otw、本体感觉机器人状态St以及语言任务指令L。目标是学习一个映射函数πθ(·),生成一系列未来动作: At = [at, at+1, . . . , at+k−1] ∼ πθ(· | Owt, St, L) (1) 其中At表示大小为k的动作块。每个动作at ∈ R7是一个7维向量,包含6自由度末端执行器姿态和夹爪的二进制状态。概述。如图2所示,AtlasVLA仅依赖单视角手腕观测,将持久的世界-自我记忆组织为三个核心模块:首先,持久世界状态记忆(第3.2节)通过Depth Anything v3(Lin等人,2025)和空间反投影将2D标记提升到3D潜在空间,注入时空嵌入以形成4D世界表示。它通过邻域融合、滑动窗口和永久的首帧锚点动态维护全局体素哈希地图,以保留全局世界状态。其次,自我工作记忆(第3.2节)通过意图感知查询和冗余感知整合来跟踪自我工作状态和子任务进展,动态更新自我工作记忆库以防止意图漂移。最后,世界-自我引导的动作生成(第3.4节)执行双路径检索以落地动作专家。在这些上下文的引导下,逐步条件的DiT依次应用自我工作注意力和世界状态注意力来生成鲁棒的动作。
持久世界状态记忆
瞬时世界状态构建。给定当前时间步t的腕部相机观测Itw,我们利用冻结的视觉编码器提取2D视觉标记。同时,通过Depth Anything v3(Lin等人,2025)估计深度,我们利用流式模型(Lin等人,2025)的历史帧来增强时间深度一致性。此外,我们主动获取相机的内参Tin和外参Ttex。具体地,通过利用当前机器人状态St和手眼标定矩阵Th2e,我们可以推导出腕部相机的外参 Tex = ψ(St) · Th2e,其中ψ(·)表示从末端执行器状态到位姿矩阵的变换。随后,我们提出一个空间反投影模块,将2D视觉标记提升到3D潜在空间: mt, Pt = Back-Projection(Xtw, Dwt, Tin, Text), (2) 其中mt表示当前局部世界状态,其本质上由带有3D位置的2D潜在标记组成。时空嵌入。为了赋予世界状态精确的时空感知能力并促进其后续融合到全局世界状态记忆中,我们提出了一种双时空位置嵌入机制。虽然我们将2D标记对齐到全局3D空间,但表示本身仍然缺乏显式的空间和时间上下文建模,这不可避免地导致空间混叠和时间退化。为缓解该问题,我们通过可学习的位置编码将3D空间坐标和时间戳纳入以增强标记: mb t = mt + Espatial(Pt) + Etemporal(t), (3) 其中Espatial(·)编码3D位置以保留几何结构,Etemporal(·)注入时间位置编码以捕获顺序。两者均由MLP参数化。通过纠缠时空线索,瞬时世界状态从孤立的观测池转变为统一的4D表示。世界状态时空更新。我们基于每个时间步t提取的局部世界状态mt维护一个持久的世界状态记忆Mt。**随着长时程操作的进行,直接累积工作记忆不可避免地导致严重的空间冗余和计算瓶颈。为解决此问题,我们引入了一个局部空间融合机制和时间滑动窗口来执行记忆更新。在空间上,我们采用类似于截断符号距离函数(TSDF)地图整合(Newcombe等,2011)的体素哈希策略。**整个3D空间被划分为均匀的体素。对于对应于相同物理区域的输入令牌,我们在每个局部体素内对其潜在特征进行加权聚合。令v表示体素的3D坐标。当新获取的世界状态mt(v)及其置信权重wt被投影到全局世界时,全局世界记忆Mt(v)及其累积权重Wt(v)动态更新: Mt(v) = Wt−1(v)Mt−1(v) + wtmt(v) Wt−1(v) + wt . (4) 其中置信权重wt反映当前观测的可靠性,并直接由深度估计置信度得出: wt(v) = ct(v), Wt(v) = λWt−1(v) + wt(v). (5) 更高置信度的深度观测对全局记忆贡献更大,而不确定测量在聚合过程中被抑制。在时间上,全局记忆维护最大时间窗口大小W,它将通过滑动窗口不断更新和遗忘。
自我工作状态记忆
意图感知查询。长时程操作中的一个关键挑战是,在持续的低层感官流中,防止智能体迷失全局目标。为解决这一问题,我们为VLA模型配备了一种意图感知查询机制,以自我为中心地建模和跟踪任务意图(状态、进度)。我们定义一组可学习查询作为意图查询,记为Qego ∈ RN×d。在每个决策步骤,Qego被输入VLM以聚合目标导向的信息。**形式上,这些查询通过交叉注意力机制关注所有令牌: Zego = Softmax QegoKT √d V, (6) 其中K和V是令牌的键和值投影,Zego表示提取出的自我工作潜在令牌。**通过将广泛的时空上下文压缩到这些聚焦的意图令牌中,我们的模型保持了连贯的全局感受野。这明确地防止了意图遗忘,并显著增强了智能体在长时程内执行复杂的多阶段任务的能力。
自我工作记忆库。在长时程操作中,任务意图会随着中间子目标动态演变。为捕获这些转变,同时避免无界记忆增长和语义冗余,我们通过冗余感知的潜在整合来维护一个时间意图记忆库Mego。给定累积记忆Mego t−1,新提取的自我工作令牌 Z ego t 首先检索相关历史上下文,该上下文被自适应地融合到当前表示中。记忆库更新如下: Mego t = Cons Mego t−1 ∪ {Zego t + Etemporal(t)} , (7) 其中 Cons(·) 表示将时间相邻且语义相似的意图令牌进行合并的整合操作。
3.4 世界-自我引导的动作生成
自我工作记忆检索。为了利用历史上下文,当前自我工作令牌 Ztint 通过交叉注意力从整合后的记忆 Mego t 中检索相关信息:
C ego t = CrossAttn(Zego t , Mego t , Mego t )。 (8)
通过提取最相关的过去意图,检索到的上下文 Cego t 确保了时间上连贯的动作解码。
自我引导的世界检索。为了将动作锚定在3D环境中,智能体通过自我引导的世界检索模块检索与任务相关的世界状态。具体来说,历史自我工作上下文 Cego t 作为查询,通过交叉注意力关注全局世界记忆 Mt:
C world t = AddNorm (FFN (IntentAttn(Cego t , Mt, Mt))) , (9)
其中 Mt 同时提供键和值。这种自我引导的检索能够选择性地提取相关的世界状态,同时抑制空间冗余,生成一个自我对齐的表示,用于精确的动作生成。
世界-自我引导的动作 DiT。与采用全局条件的标准扩散模型不同,我们的 DiT 采用了解耦的逐步条件机制。动作生成同时以用于任务进展的自我工作状态和用于几何锚定的检索世界状态为条件。在每个扩散步骤 k,带噪声的动作令牌 ak 由世界-自我引导的动作 DiT 块处理。首先,令牌通过一个自我工作注意力层关注自我工作上下文 Cego t,以捕捉当前的自我工作状态和任务进展。然后,它们通过一个世界状态注意力层关注检索到的世界表示 Cworld t,以引入更全面的世界观察。两个注意力模块及其后的 FFN 都遵循带有 Add & Norm 层的标准 Transformer 设计。经过 k 个扩散步骤后,精炼后的令牌由动作解码器解码为最终动作 At。
4.Takeaways:
关键的是,由于第一帧通常提供最佳视野并准确反映操作的初始状态,我们强制执行严格的“永久初始化”规则。由初始帧构建的时空记忆被永久锚定,以提供持久的全局上下文。
局限性&未来工作:
未提到
AtlasVLA | arxiv 2026.8.7 | Paper Reading








