HELM | arxiv 2026.04.20 | Paper Reading
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
作者提出的模型主要用于解决VLA模型在长时域操控任务上系统性失败问题,作者总结了导致失败的三个原因并提出模型去解决这个问题。并且发布了一个LIBERO-Recovery的失败恢复的扰动注入评估协议。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | VLA | Memory & Recovery | 2026-04-20 |
1.What?
作者发现无论骨干网络规模如何,执行循环中始终存在三类缺陷:
-
记忆鸿沟(F_M)。固定上下文窗口会丢弃已完成子目标的证据。当步数t=47时,模型无法回忆起杯架在t=12时已被放入橱柜中,从而重新执行放置动作,干扰任务状态。
-
验证鸿沟(F_V)。动作反应式生成,缺乏执行前可行性检查。不可行抓取、错误物体接触及超出工作空间范围内的动作被静默执行,引发错误传播。
-
恢复鸿沟(F_R)。动作失败后,模型会在已损坏的状态下继续运行,导致后续子目标产生级联故障。
于是提出了三个模块:
情景记忆模块(EMM)维护一个CLIP索引的关键帧存储,并将检索到的上下文注入VLA的语言输入中。状态验证器(SV)——我们的核心学习贡献——是一个轻量级MLP,在回滚数据上训练,用于在动作执行前预测失败;关键在于,它接收记忆增强的上下文作为输入,使其有效性依赖于EMM。调控控制器(HC)协调循环:检索 → 提议 → 验证 → 执行或恢复。
HELM是一个与模型无关的框架,通过三个专用学习组件分别应对上述缺口:利用CLIP索引关键帧检索的情节记忆模块(EMM)、一个从(观测、动作、子目标)三元组中预测执行前动作失败的学习型状态验证器(SV),以及实现基于记忆的回滚与重规划的统驭控制器(HC)。SV是核心学习贡献:我们证明其持续优于基于规则的可行性检查与集成不确定性基线,且其有效性关键依赖于记忆增强的上下文。
2.Why?
具身智能体的记忆机制 FILM [Min等人,2022]利用语义地图进行导航;Voyager [Wang等人,2023]维护技能库以支持开放世界探索;生成式智能体 [Park等人,2023]使用重要性加权的记忆流。以上方法均未解决包含物理状态约束的多阶段操作问题。我们的EMM在三个方面存在差异:基于关键帧边界的写入触发机制、基于CLIP的视觉检索(而非纯文本检索),以及与学习型失败预测器的紧密耦合。
作者提出的SV是学习得到的,无需人工工程干预。
目前的失败恢复机制缺少恢复循环,最接近的前期工作是内心独白,它在失败时重新规划,但使用手工设计的检测器且缺乏事前验证
HELM的SV是首个依赖于情景记忆的学习型事前失败预测器,能够检测仅在先前任务历史上下文中才显现的失败。
3.How?
故障分类。
• FM(记忆):动作 at 与在时间 t−H 之前完成的子目标 gj 不一致。
• FV(验证):at 在给定 st 的情况下物理上不可行或语义错误,且未经验证即执行。
• FR(恢复):在时间 t 发生故障后,执行在已损坏的 st+1 上继续,导致级联故障。

我们在 200 个 LIBERO-LONG 回合中运行 OpenVLA,并标注了所有 83 个故障回合。
HELM 为任意冻结的 VLA 策略 πθ 包裹了三个组件(图 1b)。在每个时间步 t 中:(1) EMM 检索记忆上下文 mt;(2) πθ 基于 (ot, τ, gt, mt) 提出动作 aprop_t;(3) SV 预测 pfail;(4) HC 要么执行 aprop_t,要么触发恢复。
episodic Memory Module(情节记忆模块,EMM)
EMM 是一个键值存储 M={ (ki, vi) },其中 ki=φ(oi) 是 CLIP ViT-B/32 嵌入,vi=(oi, gi, statusi, ti, δi) 存储关键帧、活跃子目标、完成状态、时间步以及紧凑状态增量(夹爪位姿 + 来自深度的物体位置)。
写入策略:在以下情况写入:(a) 子目标完成(成功),(b) 检测到失败(失败),© 每 ∆c=20 步(检查点)。
检索:基于余弦相似度的 Top-k 选择:
Mt = top-k_n [ φ(ot)ᵀki / (‖φ(ot)‖‖ki‖) ]_{i=1}^{|M|}, k=3。 (1)
检索到的值被序列化为结构化文本,附加到 VLA 的语言输入中。
压缩:当 |M|>Nmax=50 时,仅保留每个子目标的最新检查点。
State Verifier(状态验证器,SV):核心学习贡献
动机:执行前失败预测需要对视觉状态、提议动作、子目标上下文和任务历史的联合分布进行推理。这无法简化为基于规则的可行性检查(会遗漏语义错误且需特定环境工程)或不确定性启发式(与动作无关,无法区分自信但错误的动作与真正可行的动作)。形式上,我们寻求 P(fail_t | ot, at, gt, Mt);记忆上下文 Mt 必不可少,因为动作是否有效通常取决于已完成内容(例如,放置已放置的物体无论当前视觉可行性如何都是失败)。新问题形式——记忆条件下的执行前失败预测——是核心贡献;MLP 架构为低延迟推理(12 毫秒/步)的刻意选择,且消融实验表明,**记忆增强输入 oˆt 是关键因素,**而非模型容量(§5.4)。我们实证表明,学习型 SV 始终优于基于规则的替代方案和集成方案(§5)。
模型:SV 为 fψ : (oˆt, at, gt) → [0, 1],是一个 3 层 MLP [1024→512→256→1],使用 ReLU 和 dropout 0.1。输入:
oˆt = [φ(ot); ktop-1] ∈ ℝ¹⁰²⁴, (2)
与投影动作 Wa·at ∈ ℝ²⁵⁶ 及子目标嵌入 φ_text(gt) ∈ ℝ²⁵⁶ 拼接。记忆增强观测 oˆt 至关重要:移除 ktop-1 会使 AUROC 从 0.847 降至 0.791(§5.4)。
训练:从训练任务上的 VLA 轨迹中收集 50K 个 (ot, at, gt, yt) 三元组;若 5 步内发生失败则 yt=1。使用加权二分类交叉熵损失(正样本权重 4.0)。Adam 优化器,lr=10⁻⁴,批大小 256,训练约 2 小时(单张 A100)。
阈值:若 pfail ≤ θv=0.65 则执行,否则触发 HC 恢复。灵敏度分析见附录 A.3。
敏捷控制器(HC)
HC维护一个子目标栈S(通过提示πθ分解任务τ初始化)和一个完成检测器(与SV架构相同,基于完成标签训练)。当出现失败信号时(pfail>θv或完成检测器结果为负):从EMM中检索最近的检查点/成功记录,发出基于目标的恢复序列(提示:“返回所示状态”),重新压入失败子目标,并将失败记录附加到上下文。最多允许Rmax=3次恢复尝试,超过后标记任务失败。
前向恢复变体(HELM-Fwd)。针对回滚不可行的环境,HC改为从当前受损状态生成前向恢复计划。我们对两种变体均进行了评估(§5)。
4.Takeaways:
更长的上下文并不足够。 H=32仅提升了+5.4个百分点(63.8%),证实了记忆鸿沟是结构性的。Oracle记忆带来+14.0个百分点的提升(72.4%),表明EMM的贡献是真实的,但并非唯一因素。
同预算下的骨干网络适配不足。 OpenVLA + LoRA(50K)达到69.3%的TSR——高于H=32,但低于HELM 12.2个百分点。这证实相同的部署预算更有效地用于训练SV而非微调骨干网络。
学得的SV优于替代方案。 规则验证器:+6.8个百分点。集成方法(×5):在5倍推理成本下提升+9.5个百分点。HELM的SV:在1倍成本下提升+8.4个百分点(来自消融实验,表3)。SV比集成不确定性更准确且更高效。
回滚对比前向恢复。 HELM-Fwd达到76.3%的TSR和38.7%的RSR,证实前向恢复有效,但回滚额外提供了+5.2个百分点的TSR和+15.5个百分点的RSR。在实际机器人部署中,HELM-Fwd是实用变体。
模型无关性。 HELM (Octo)相比Octo提升了21.6个百分点,与HELM (OpenVLA)的相对提升幅度相近,证实该框架泛化至不同骨干网络。

有效性分析:HELM的每个组件。EMM是最大的单一贡献者(无EMM时下降11.2个百分点)。SV贡献−8.4个百分点;值得注意的是,无记忆上下文的SV(“SV w/o mt”)仅贡献−2.3个百分点,证实了EMM与SV的耦合关系。回滚对TSR贡献−6.3个百分点,对RSR贡献−31.1个百分点。
局限性&未来工作:
局限性:
SV数据依赖。每个环境训练需约5万次 rollout 步骤(约2小时)。一次性成本,但限制了零样本部署。
真实机器人回滚。回滚假设动作可逆。HELM-Fwd 解决了此问题但导致RSR降低(38.7%对比54.2%),真实机器人验证仍有待未来研究。
仿真到真实迁移。所有实验均在仿真环境(LIBERO、CALVIN)中进行。真实机器人部署会引入额外挑战:(a)SV需泛化到 rollout 训练数据中不存在的视觉域偏移;(b)CLIP 嵌入在真实传感器噪声下判别力可能下降;(c)LIBERO-Recovery中的扰动幅度(±5厘米)可能无法覆盖真实世界干扰的全部范围。我们将HELM视为一种框架,其组件(EMM、SV、HC)可适配到真实场景,但已训练的SV直接进行仿真到真实迁移并不保证有效,需进一步研究。
子目标分解。VLA生成的分解在4.3%的回合中失败;预言机分解提升2.7个百分点,表明存在虽小但实际存在的瓶颈。
开销。在单张A100上约12毫秒/步(比仅骨干模型多15%)。
作者未来希望有更多关于执行时增强的研究,作为骨干网络规模扩展的补充。
HELM | arxiv 2026.04.20 | Paper Reading









