MemoryVLA++ | arxiv 2026.6.8 | Paper Reading

MemoryVLA++ | arxiv 2026.6.8 | Paper Reading

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

作者在上一篇MemoryVLA的基础上增加了世界模型预测未来的能力从而进一步提升了模型的能力。

工作类型(首次/改进) 技术路线 创新点 日期
改进 VLA memory 2026-06-08

1.What?

MemoryVLA++是一个完整的时间建模框架,为VLA模型配备了用于机器人操作的内存与想象能力。一个预训练的VLM将当前观测编码为感知和认知令牌,形成工作记忆。这些令牌查询一个感知-认知记忆库以检索相关的历史上下文。该记忆库存储来自过去交互的低级细节和高级语义,并通过冗余感知整合进行更新。一个世界模型在去噪潜在空间中想象未来状态,并在记忆引导下整合所想象的潜在表示,形成完整的时间感知令牌。最终生成的令牌条件化一个扩散动作专家,以预测时间一致的动作序列。

2.Why?

Comparison of the main ideas of three paradigms
典型的VLA模型如OpenVLA[1]和π0[2]仅依赖当前观测,因此忽略了时间依赖,在长时域任务上表现不佳。如图1(a)所示,按钮按压任务需要记忆,因为按压前后观测几乎无视觉差异,难以判断按钮是否已被按下。同时,动态传送带抓取任务需要想象力,因为感知物体在动态传送带上的运动方式,能使机器人在更合适的时机进行抓取。这些示例表明,有效的机器人操作既需要记住过去的交互,也需要预测场景未来的演变。一种直接的方法是扩展VLA输入,加入来自过去和未来的额外帧级观测。具体而言,将最近的N帧历史图像[10][12]以及预测的未来视频帧[13]–[16]输入VLA模型。然而,简单扩展视觉观测序列对于机器人操作而言效率低下。在过去方面,拼接连续历史帧会带来二次自注意力成本,并引入大量时间冗余,限制了可用上下文长度,削弱了长期依赖建模能力。这一问题在机器人操作中尤为突出,因为缓慢的动作使得与决策相关的交互跨越更长的时间跨度。在未来方面,未来视频预测计算成本高昂,且通常关注像素级保真度而非与控制相关的动态。将预测帧直接输入VLA模型可能进一步将视觉预测误差传播到动作生成中。这促使我们设计一个时间建模框架,能够高效地将过去经验压缩为长期记忆,并通过紧凑的、与决策相关的想象力捕捉未来动态。

3.How?

Overall architecture
给定当前观测和语言指令,VLM首先将其编码为感知和认知令牌作为工作记忆。为了融入历史上下文,我们引入了感知-认知记忆库(PCMB),该记忆库存储来自先前交互的高层语义和细粒度感知细节。工作记忆通过查询PCMB检索与决策相关的历史表示,然后通过门控机制与当前表示自适应融合。同时,PCMB通过冗余感知合并进行更新,当记忆容量达到上限时,将时间相邻且语义相似的条目合并。为了进一步建模未来动态,当前观测和语言指令被输入到一个预训练的世界模型中,该模型执行部分去噪以生成多尺度的想象潜在表示。在记忆增强表征的引导下,这些想象潜在表示与它们自适应地整合,从而保留与决策相关的未来线索,同时抑制不相关的预测。最终得到的全时间感知表征被用于条件化一个扩散动作专家,以预测未来T个7自由度动作的序列。

视觉-语言-认知模块从视觉观测和语言指令中生成用于细粒度视觉细节的感知令牌和用于高层语义的认知令牌。我们基于一个70亿参数的Prismatic VLM [8]构建该模块,该模型在大规模跨具身真实机器人数据集Open-X Embodiment [4]上进行了进一步预训练。给定来自一个或多个相机视角的RGB观测,记为I = {Iv}vV=1,我们使用并行的DINOv2 [28]和SigLIP [29]编码器从每个视角提取视觉特征,并将其输出拼接为原始视觉令牌。这些令牌随后由两个并行分支处理。在感知分支中,一个基于SE瓶颈的压缩模块[69]降低原始视觉令牌的通道维度,生成感知令牌p ∈ RNp×dp,这些令牌保留了用于操作的细粒度视觉线索。在认知分支中,原始视觉令牌被投影到语言嵌入空间,并与分词后的指令拼接。得到的多模态序列被输入LLaMA-7B [41],句尾(EOS)位置的输出被用作认知令牌c ∈ R1×dc,捕获紧凑的高层语义。感知令牌p和认知令牌c共同构成工作记忆。

基于世界模型的想象建模

尽管感知-认知记忆提供了来自历史交互的上下文,机器人操作还需要预测当前场景在不久的将来如何演变。我们不是显式预测未来的 RGB 帧(这计算昂贵且常引入与控制无关的像素细节),而是使用视频生成世界模型作为潜在想象模块。世界模型从部分去噪的特征中提取紧凑的未来线索,记忆引导的集成模块进一步抑制无关的想象内容,生成用于动作预测的完整时间感知令牌。

  1. 面向操作的世界模型适配:我们使用 Stable Video Diffusion (SVD) [62] 实例化世界模型,这是一个在大型互联网视频上预训练的 1.5B 参数视频扩散模型。遵循 VPP [66],我们将 SVD 的条件设定为当前观测 I 和指令 L,其中 L 由 CLIP 编码并通过交叉注意力注入时空 UNet。尽管 SVD 提供了强大的视觉动态先验,我们将其在操作视频上适配以更好地对齐机器人操作。给定训练样本 (I, L, x0) ∼ D_wm,其中 x0 表示目标未来视频序列,我们在扩散时间步 τ 下采样其噪声版本 xτ:xτ = √ᾱ_τ x0 + √(1 − ᾱ_τ) ε, ε ∼ N(0, 1)。(13) 这里,ᾱ_τ 表示累积噪声调度。世界模型 W_φ 被训练为在 I 和 L 条件下重构干净的未来视频序列:L_wm = E{(I,L,x0)∼D_wm, ε, τ} [ ||W_φ(xτ, τ, I, L) - x0||^2_2 ]。(14) 适配数据集 D_wm 包含用于学习未来状态演化的机器人中心先验的操作视频。
    Details of imagination module

  2. 想象生成:如图 5(a) 所示,在 VLA 训练期间,操作适配的世界模型被冻结,仅用于潜在想象。我们不解码未来 RGB 帧,而是进行部分去噪并提取多尺度中间 UNet 特征 {U_s}{s=1}^S,其中 U_s ∈ R^{K×C_s×H_s×W_s}。这里 S 是特征尺度数,K 是想象的未来步数。使用 FPN [70] 将这些特征聚合成潜在令牌:z = FPN({U_s}{s=1}^S), z ∈ R^{K×N_z×d_p},(15) 其中 N_z 是每步想象的潜在令牌数,d_p 与感知令牌维度匹配。可学习的时间嵌入 e_time ∈ R^{K×1×d_p} 被添加为 z̄ = z + e_time。(16) 然后我们使用想象形成器压缩潜在令牌。可学习查询 q ∈ R^{K×N_q×d_p} 通过基于查询的空间注意力关注潜在令牌:q̂_k = SpatAttn(q_k, z̄_k, z̄_k), k = 1, …, K。(17) 查询进一步经过时间注意力处理:z_img = FFN(TempAttn(q̂_{1:K}))。(18) 生成的zimg ∈ R^(K×N_q×d_p) 编码了紧凑的未来状态演化。

  3. 想象集成:尽管zimg捕捉了未来动态,但仍可能包含不可靠或与决策无关的预测。为抑制此类噪声,我们引入了一个记忆引导的想象集成模块,如图5(b)所示。具体地,记忆增强的感知令牌p̃通过交叉注意力查询想象令牌zimg,随后经过FFN:

h = FFN (CrossAttn(p̃, zimg, zimg)) 。 (19)

然后表示h与p̃进行自适应融合:

g = σ MLP(concat[h, p̃]) , (20)

p̄ = g ⊙ p̃ + (1 − g) ⊙ h, (21)

其中σ表示sigmoid激活函数,⊙表示逐元素乘法。最后,p̄与c̃组合为完整的全时域令牌:

Ftemp = {p̄, c̃}。 (22)

E. 全时域动作专家
Details of full temporal-aware action expert
如图6所示,全时域令牌Ftemp = {p̄, c̃}用于条件化下游动作专家以进行动作预测。由于机器人控制处于连续的多模态动作空间中,我们采用基于扩散的Transformer(DiT)[71],并通过去噪扩散隐式模型(DDIM)[72]实现。从噪声动作序列A_τ开始,模型逐步去噪以预测目标动作序列A。具体地,在去噪时间步τ,正弦时间步嵌入TE(τ)被添加到认知令牌c̃,所得表示与噪声动作序列A_τ拼接。

随后,认知注意力层对拼接后的令牌执行自注意力以提供高层语义引导:

h_c = CogAttn [ c̃ + TE(τ); A_τ ] 。 (23)

随后,认知注意力层对拼接后的令牌执行自注意力以提供高层语义引导:

h_c = CogAttn [ c̃ + TE(τ); A_τ ] 。 (23)

认知感知特征进一步通过感知注意力层关注感知令牌p̄以注入细粒度视觉细节,随后经过FFN:

Â_0 = FFN (PerAttn(h_c, p̄, p̄)) 。 (24)

模型通过预测与目标动作序列之间的均方误差(MSE)损失进行训练,最终去噪表示经MLP投影以生成连续的7自由度机器人动作。

4.Takeaways:

Analysis of memory modeling in real-world and simulation tasks
忆机制分析:为了直接展示记忆机制如何运作,图10可视化了在真实世界和仿真任务中检索到的记忆元素及其注意力权重。模型持续关注那些能够解决决策相关的当前观测中缺少相关的歧义信息的过去帧。在实际的"更换食物"任务中,当第一个食物被放置到一旁后,当前帧显示桌上有两个食物,无法从单次观测中判断接下来应拿起哪一个。因此,我们的方法强烈关注反映近期运动趋势的邻近帧,以及歧义出现前的最后一个决定性帧。在Mikasa-Robo仿真基准测试中的"壳游戏触摸"任务中,机器人被短暂展示立方体的位置,随后它被杯子覆盖。模型始终关注初始揭示帧,这些帧提供了识别正确杯子的唯一可靠线索。这些结果表明,我们的方法能够提取用于消除下一动作歧义的关键时间线索,而非仅仅回忆冗余的视觉历史。

Visualization of world model imagination
2) 想象机制分析:如图12所示,我们可视化了来自世界模型的想象未来轨迹,并将其与真值未来观测进行对比。在仿真与现实任务中,生成的轨迹均保留了场景的主要语义演变。值得注意的是,仅使用1个去噪步就已捕捉到有意义的未来动态,这支持了我们为高效机器人决策的潜空间想象力设计。表IX在完全去噪设置下,定量评估了仿真和真实机器人数据集上的想象力质量。PSNR [98]衡量像素级保真度,SSIM [99]衡量帧级结构相似性,LPIPS [100]利用深层特征衡量感知相似性。FVD [101]评估视频级分布质量,而Flow-EPE [102]使用光流端点误差衡量运动一致性。结果表明,世界模型能够捕捉未来的语义和运动动态。

局限性&未来工作:

没有详细说

MemoryVLA++ | arxiv 2026.6.8 | Paper Reading

https://fanchenlex.github.io/reandings/MemoryVLA++/

Author

Wenzhuo Li

Posted on

2026-07-29

Updated on

2026-07-29

Licensed under

WeChatQQGoogle ScholarWeeklyLogRSS