EventVLA | arxiv 2026.6.18 | Paper Reading
EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies
作者提出了一个基于稀疏视觉证据记忆概念构建的端到端框架用于解决多帧存储类型的记忆VLA的问题
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | benchmark | memory | 2026-05-11 |
1.What?
本文提出一种基于稀疏视觉证据记忆概念构建的端到端框架,主要包括两个核心组件:维持初始与短期上下文的基础视觉锚点,以及动态关键帧证据记忆(KEM)模块。具体而言,KEM直接从VLA的潜在嵌入中预测未来关键帧概率,从而自主捕获并存储稀疏的、任务关键的视觉事件。
此外作者提出RoboTwin-MeM,一个专为评估具有交互式视觉证据的非马尔可夫操作任务而设计的诊断基准。广泛评估表明,在17项需要记忆的模拟任务与4项现实世界双手操作任务中,EventVLA相较于最先进的记忆增强VLA取得了平均成功率提高40%的效果。
2.Why?
作者认为现有的VLA普遍基于严格马尔可夫假设,而现实世界中物理工作空间动态变化,智能体需持续保留中间状态(如被移动物体的原始位置)以引导后续动作,为了应对这一非马尔可夫挑战,三类范式下的记忆感知VLA应运而生[6]:其一,双系统记忆VLA[7,8,9]通过解耦认知与控制实现,却面临高延迟与严重误差传播问题;其二,循环架构[10,11]将历史信息压缩为隐状态,导致信息瓶颈,致使精细视觉细节丢失;其三,记忆缓冲区[12,13]虽保留视觉保真度,却因缺乏选择性机制而盲目累积冗余帧。
由此衍生关键问题:VLA应在何时、以何种形式保留哪些视觉证据,方能在不突破计算极限的前提下最大化执行成功率?
3.How?
作者首先定义了一个基础视觉锚点:
记忆缓冲区被构造为(\mathcal{M}_t = \mathcal{A}_t \cup \mathcal{E}_t),无缝融合了基础视觉锚点(\mathcal{A}_t)与交互驱动的事件关键帧(\mathcal{E}t)。基础视觉锚点(\mathcal{A}t)代表一种确定性的、基于规则的基线,旨在捕获永久的场景布局和即时的时间上下文。具体而言,时间步(t)的基础视觉锚点包含初始工作区配置(o_0)和一个大小为(K)的短期历史滑动窗口:
[
\mathcal{A}t = o_0 \cup {o{t-K}, \dots, o{t-1}} \tag{2}
]
这里,初始帧(o_0)作为永久的空间锚点,使VLA模型在发生任何位移前保留原始场景布局的不变记忆。与此同时,短期历史窗口(o{t-i})为模型提供关键的运动和任务进展线索,支持平滑且连续的动作生成。然而,由于这些刚性锚点无法捕获复杂交互过程中出现的不可预测的、瞬时的证据,它们将会被由关键帧证据记忆模块(Keyframe Evidence Memory, KEM)生成的(\mathcal{E}_t)动态扩充(详见第3.2节),整体框架如图2所示。

关键帧证据记忆(KEM)模块
为主动捕捉基础视觉锚点天然缺失的、由交互驱动的瞬时事件(例如被遮挡物体的短暂暴露),我们引入了关键帧证据记忆(KEM)模块。为高效实现该机制,KEM被设计为一个轻量级并行预测头,直接与主动作头协同运行。关键帧预测头并非使用孤立特征,而是直接摄取从VLA自回归Transformer最终层提取的精确隐状态ht∈RH×d(对应动作区间H)。由于ht天然编码了视觉观测与动作条件查询令牌的联合嵌入,该关键帧头便继承了模型对未来执行计划的主动感知能力。具体而言,关键帧头将这些共享隐状态ht投影至覆盖未来区间H的关键帧概率向量pˆt:
pˆt = σ(KEMmlp(ht)) = [pˆ1 t, pˆ2 t, …, pˆH t]T ∈ [0, 1]H (3)
其中σ(·)表示逐元素Sigmoid函数,每个标量pˆi t∈[0,1]明确表示第i个未来执行步骤为任务关键帧的预测概率。采用这种分块预测的原理很直接:纯粹逐步骤的分类器会完全遗漏在执行窗口中途瞬间出现又消失的任务关键事件(例如步骤t+i,其中0<i<H)。这一局限性促使KEM采用具有前瞻性的分块范式pˆt,使VLA策略得以主动规划跨整个未来执行区间的“记忆计划”。
在此预测向量pˆt的驱动下,当某个预测概率超过阈值(pˆi t≥τcommit)时,EventVLA将触发稀疏记忆写入事件,动态将t+i时刻的原始图像提交至事件缓冲区Et。为满足实时性约束,Et由最大容量Nmax界定,并采用**先进先出(FIFO)**淘汰策略管理。在任何执行步骤t,这些动态累积的事件关键帧 Et-1 将基础视觉锚点At与当前观测值ot整合为一段单一的、按时间顺序排列的序列:Iinput = concat识别出At, Et−1, ot] (4) 将该统一序列直接输入视觉语言模型(VLM)的视觉编码器,使其自注意力层能够动态提取稀疏历史帧中复杂的时序相关性,从而原生赋予模型针对长程操作的鲁棒情境感知能力。
端到端训练与推理细节
为规避高昂的人工标注成本来训练KEM模块,我们采用一个离线Qwen3VL [15]自动流水线来提取任务关键事件的真值时间戳。为缓解物理交互中固有的时间模糊性,我们利用时序平均二值交叉熵(BCE)目标函数(Lkem)监督分段关键帧预测,并生成经过时序平滑的软标签。该框架与标准动作生成损失(Laction)进行端到端联合优化:
L = Laction + λLkem (5)
为弥合训练与测试之间的分布偏移,同时保持早期训练稳定性,我们引入一种规划性教师-学生课程,使记忆构建从依赖真值逐步过渡至自主预测。在在线推理阶段,连续的关键帧概率自然地围绕展开的语义事件聚类。为强制执行记忆稀疏性并防止冗余缓冲区溢出,我们通过一维非极大值抑制(NMS)与时间冷却处理流水线,将这些密集预测蒸馏为离散的写入事件。关于软标签、课程机制、NMS算法及自动化标注流水线的完整数学描述,详见附录A。此外,完整的网络结构与训练配置在附录B.3中详述。

RoboTwin-MeM与现有以记忆为核心的套件的核心区别在于:它显式分离并量化了中间记忆需求。现有基准常允许策略仅依赖初始静态锚点或短期历史信息即可成功,**而RoboTwin-MeM迫使模型主动记忆执行过程中生成的不可预测视觉证据。**为严格诊断此能力,我们以n显式参数化任务复杂度:n表示必须动态保留的中间事件关键帧数量。如图3所示,RoboTwin-MeM包含8个真正的非马尔可夫任务,具有极长的执行视野,每回合平均步数在430至1544之间。在整个基准中,所需中间关键帧数量n系统性地在1至5间变化,建立了非马尔可夫控制的分层难度体系。详细任务统计与语言指令可见表4。
关键在于,这种n参数化设计使RoboTwin-MeM能够评估超越简单历史拼接的多样化记忆能力。首先,像“拾取隐藏方块(n=3)”和“覆盖方块困难(n=4)”此类任务需要瞬时记忆:关键视觉证据仅在覆盖物提起时短暂暴露,一旦闭合则完全消失,迫使策略即时锚定这些转瞬即逝的信息。其次,基准通过“按键关键帧(n∈[2,5])”类任务评估序列跟踪与计数逻辑,其中每次按键代表一个执行关键事件,必须顺序记录以决定任务成败。最后,“复现路线(n=4)”任务测试模型的上下文学习能力,要求智能体观察示范、提取随机空间关键点并利用这些线索在上下文中复现路线。这种对瞬时识别、事件计数与上下文模仿的覆盖,使RoboTwin-MeM成为评估记忆增强型机器人策略的严苛基准。
4.Takeaways:
主要还是强调这个稀疏关键帧想法的必要性和重要性
局限性&未来工作:
尽管EventVLA能有效捕获瞬时视觉证据,但其有限的事件缓冲区限制了在事件密度极高的超长时程任务(如>10分钟)中的可扩展性。此类场景可能导致缓冲区饱和,迫使早期历史线索过早被移出。未来工作将探索分层记忆或压缩表示法以管理大规模事件序列。
EventVLA | arxiv 2026.6.18 | Paper Reading









