VPWEM | arxiv 2026.05.05 | Paper Reading
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
作者了提出的VPWEM总体上和MemoryVLA类似,通过工作记忆和情景记忆增强扩散策略。但是在实验上略有不同可以阅读来加深理解。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | VLA | memory | 2026-05-05 |
1.What?
VPWEM是一种配备工作记忆与情景记忆的非马尔可夫视觉运动策略。VPWEM保留近期观测令牌的滑动窗口作为短期工作记忆,并引入基于Transformer的上下文记忆压缩器,将窗口外的观测递归压缩为固定数量的情景记忆令牌。该压缩器通过对历史摘要令牌缓存运用自注意力机制,并对历史观测缓存运用交叉注意力机制,与策略联合训练。
2.Why?
大多数视觉运动策略仍依赖于单步观测或短上下文历史,导致其难以应对需要长期记忆的非马尔可夫任务。简单扩展上下文窗口会带来巨大的计算与存储成本,并助长对虚假相关性的过拟合,进而导致在分布偏移下出现灾难性失败,并违反机器人系统的实时性约束。
近期一些VLA研究也解决了长期记忆问题。例如,CronusVLA通过后训练将单帧VLA扩展到多帧范式;ContextVLA通过平均池化压缩VLM骨干网络中的多帧中间特征;MemoryVLA构建了一个感知-认知记忆库,检索并融合与决策相关的条目以生成动作。与这些方法不同,我们的方法通过学习一个外部的上下文记忆压缩器,旨在编码完整的轨迹历史,并提供互补的短期工作记忆和长期情景记忆,以条件化动作生成。
3.How?

图2展示了我们的VPWEM框架总览。除将上下文窗口内的观测用作工作记忆(第IV-A节)外,我们利用情境记忆压缩器,将窗口外的观测令牌中的关键信息蒸馏为固定大小的摘要令牌(第IV-B节)。由此产生的短期工作记忆与长期情景记忆提供互补的条件信号,共同指导动作生成过程。
工作记忆
遵循第III节的问题形式化,我们采用多模态编码器从多种观测类型中提取特征。具体而言,给定 Nc 个相机,我们使用 Nc 个图像编码器处理原始RGBD观测 Inc,t ∈ RH×W ×C (其中 nc ≤ Nc),生成视觉特征 oI,t ∈ RDI。并行地,我们将低维本体感知状态编码为 oP,t ∈ RDP。这些特征经拼接后通过一个MLP,得到联合特征向量 ot ∈ RD,用于捕获时间步 t 单帧的关键信息。我们将工作记忆定义为预定义滑动窗口内的观测令牌: wt ≜ ot−L:t = concat(ot−L+1, · · · , ot−1, ot) ∈ RL×D,并通过先进先出(FIFO)策略进行维护。该设计缓解了二次计算开销并降低了过拟合风险,因此被先前工作广泛采用。然而,丢弃早期历史信息导致对于需要超越固定上下文窗口 L 的长程依赖的非马尔可夫任务而言,该方式并不充分,这激发了对互补长期情景信息的需求。
情景记忆
尽管长程信息存在于观测历史 o≤t−L = concat(o0, o1, · · · , ot−L) 中,但朴素地依赖这一持续增长的观测历史并不现实。因此,我们采用基于Transformer的压缩器,将窗口外的观测递归整合为长期情境记忆令牌。形式上,给定刚退出短期上下文窗口的单帧观测令牌 oτ,我们通过添加位置编码(PE)进一步融入时间信息:fτ = oτ + PE(τ ) ∈ RD,其中 τ 标识该帧在回合中的时间步。该令牌随后被推入窗口外观测缓存 Cf ← M(Cf ∪ fτ ),其中 M 是一种缓存管理方法(如FIFO),用于维持最大缓存大小 S。为从长观测历史中提取关键信息,我们采用基于标准Transformer编码器架构[16]的情境记忆压缩器。该压缩器的每个模块包含:用于**与历史摘要令牌交互的自注意力层、用于与观测令牌交互的交叉注意力层,以及前馈网络。层归一化与残差连接分别应用于各子模块前后。**情境记忆压缩过程可形式化表示为:
q1,τ = q, (1)
x1,n = qn,τ + attn(qn,τ Qs, C ̄q,nKs, C ̄q,nVs), (2)
x2,n = x1,n + attn(x1Qc, C ̄f Kc, C ̄f Vc), (3)
qn+1,τ = x2,n + MLP(x2,n), (4)
eτ = MLP(qN,τ ). (5)
具体而言,每个索引为 n ≤ N 的Transformer块对 M 个查询令牌 qn,τ ∈ RM×D 进行操作。第一层 q1,τ 的初始查询令牌为可训练模型参数 q。与观测缓存类似,每个块维护一个摘要缓存 Cq,n,存储来自先前时间步的查询令牌,并在每一步更新为 Cq,n ← M(Cq,n ∪ qn,τ ),其中 M 同样采用 FIFO 策略。我们将观测缓存拼接为 C ̄f = concat(Cf ) ∈ RS×D,将摘要缓存拼接为 C ̄q = concat(Cq) ∈ RS×M×D。 等式(2)中的自注意力机制利用 qn,τ 查询 C ̄q,生成输出 x1,n,该输出紧凑地总结了截至当前时间步的过往记忆。x1,n 随后作为等式(3)交叉注意力机制的查询,关注 C ̄f 中的多帧观测特征,从而捕获跨帧的长程依赖。该模块的输出继而成为下一模块的输入查询。最终,最后一层的输出 qN,τ 经投影得到情景记忆 eτ ∈ RM×D。
基于工作记忆和情景记忆的动作生成
扩散模型[57]的核心思想是通过一系列去噪步骤,将简单的噪声分布迭代地转化为复杂的目标分布,并可选择性地以上下文信息为条件。当应用于机器人任务[10]时,现有方法[10][47]中的条件上下文通常是机器人的观测历史。在VPWEM中,**在每个时间步t,动作生成以工作记忆wt和情景记忆eτ为条件。**从初始高斯噪声样本aK ∼ N (0, I)开始,扩散主干网络通过K个时间步逐步对序列进行去噪,最终输出a0,即机器人的动作块at:t+H。注意,L是观测视野,H是动作预测视野。我们在图2中展示了VPWEM的训练和推理过程。
训练。扩散策略的训练包括两个主要过程:前向(加噪)过程和反向(去噪)过程。在前向过程中,我们从演示数据集中随机采样示例(o≤t, at:t+H),简记为(o, a0)。由于我们的框架利用完整轨迹历史进行动作生成,导致观测输入长度不一,这与使用固定上下文窗口的方法不同。为解决这一问题,我们首先按样本在片段中的位置排序,并按相似序列长度分组,使小批量内的样本具有可比的输入尺寸。尽管仍存细微不匹配,我们用每个片段的起始帧填充其开头,以实现策略的并行批训练。为增强鲁棒性,我们将每条轨迹按指定子采样比例划分为多个片段,并从每个片段中随机选取一帧,构建上下文记忆压缩器的输入。此外,在将fτ和qn,τ存入观测缓存和摘要缓存之前,我们将其从计算图中分离。这防止了梯度随时间反向传播,确保历史信息仅通过摘要令牌传播,从而大幅降低内存消耗并缓解过拟合问题。对于每个采样的(o, a0),我们可在**任意去噪时间步k ∈ [1, K]生成带噪动作序列ak = √ᾱk a0 + √1 − ᾱk ε,**其中ᾱk和αk是依赖于噪声调度器的k的函数,且ε ∼ N (0, I)。在反向过程中,神经网络εθ被训练用于从带噪输入ak中预测噪声ε,并以工作记忆wt、情景记忆eτ和时间步k为条件。该网络采用Transformer解码器架构,并通过交叉注意力掩码来调节动作块的生成[10][52]。训练目标为:
L = E(o,a0),ε [‖ε − εθ(√ᾱk a0 + √1 − ᾱk ε, wt, eτ, k)‖²] (6)
注意,eτ是上下文记忆压缩器的输出,如式(1)-(5)所定义。因此,该压缩器与行为克隆损失联合优化,以从历史中提取任务相关信息。
推理。在推理时,我们维护一个观测令牌队列,该队列提供先前观测数据的上下文信息,使多模态编码器能专注于未见帧。上下文窗口内的令牌作为工作记忆,而超出窗口的令牌则由训练有素的上下文记忆压缩器压缩为情景记忆。由此产生的长期情景记忆与短期工作记忆共同用于预测动作块。去噪网络可通过K步去噪,将噪声序列aK迭代转化为aK-1, aK-2, · · ·, a2, a1,并最终生成机器人动作a0:
ak-1 = (1/√αk) [ak − (1 − αk)/√(1 − ᾱk) · εθ(ak, wt, eτ, k)] + σk z (7)
其中z ∼ N (0, I),σk同样是基于噪声调度器得出的k的函数。
4.Takeaways:
消融实验:
观察到DP的性能随着观测视野的增加而下降,而DPPTP在较长上下文下取得了更好的性能,MaIL优于DP,主要归功于去噪网络中状态空间模型(SSM)的递归特性。所有这些方法在此任务上表现不佳,因为它们依赖截断的观测历史。相反,我们提出的方法中的L1S1(即一个长期情景记忆token和一个短期工作记忆token)变体已实现65%的成功率,超越所有先前基线。随着长期或短期记忆token数量的增加,性能通常会提升,但使用过多token时性能可能最终下降。因此,我们在主要实验中采用L2S2变体。
压缩器层数。我们使用L1S1变体研究了压缩器层数的影响。结果显示明确趋势:更大的压缩器网络能生成信息更丰富的摘要token,并为动作生成过程提供更好的条件,从而提升性能。
最大缓存容量。我们观察到,随着最大缓存容量增加(保留更多历史信息),性能有所提升。但当容量超过8时,增益开始饱和。这表明长观测历史中存在冗余,同时说明记忆压缩器能将必要信息浓缩到少量token中且不牺牲性能。

缓存管理方法。除了最简单的先进先出(FIFO)策略外,我们还研究了多种缓存管理方法:随机方法会在缓存超出最大长度时随机丢弃一个token;K-Means通过迭代将token分配给最近聚类中心并更新中心来划分token簇;AdjSim [50]计算相邻缓存条目间的余弦相似度并合并相似度最高的一对。结果表明,除随机方法外,所有方法性能相近,因此我们在主要实验中采用最简单的FIFO。这等于帮我验证了之前想用k-means聚类长期记忆的想法有可能不会有很大提升。
局限性&未来工作:
未来工作包括将我们的框架扩展到更广泛的基策略、引入重建等辅助目标,以及在真实机器人系统上的部署。
VPWEM | arxiv 2026.05.05 | Paper Reading









