RoboMemArena | arxiv 2026.5.11 | Paper Reading

RoboMemArena | arxiv 2026.5.11 | Paper Reading

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

作者提出了一个全新的专为记忆VLA的benchmark,并且通过我的进一步了解发现它确实更加综合和多样,对于我目前的实验很有帮助.

工作类型(首次/改进) 技术路线 创新点 日期
改进 benchmark memory 2026-05-11

1.What?

本文提出一种结合仿真与现实世界的综合benchmark,专门用于对VLA+memory的评估,整个benchmark的任务与记忆高度相关且丰富,并且包含了真机的任务。作者自己也提出了一个名为PrediMem双系统VLA在他们的benchmark上达到了sota的水平。

具体而言RoboMemArena包含26项任务的大规模基准,平均每条轨迹长度超过1000步,且68.9%的子任务依赖于记忆。其生成流程利用视觉语言模型(VLM)来设计和组合子任务,通过原子函数生成完整轨迹,并提供与记忆相关的标注(包括子任务指令和原生关键帧标注),同时配套的真实世界记忆任务支持物理评估。

2.Why?

作者认为现有的机器人记忆基准仍缺乏用于记忆形成的多模态标注,任务覆盖范围有限且结构复杂度不足,并且仅局限于仿真环境,缺乏真实世界的评估。作者将现有的机器人记忆基准存在若干局限性概括为三个方面:
(1)它们的数据集缺乏记忆形成所必需的多模态注释。近期研究(Torne等人,2026;Intelligence等人,2026)强调了机器人记忆内在的多模态特性。与人类记忆类似,全面的记忆表征可能包括多种模态,例如视觉信息(如关键帧图像)和语言信息(如子任务指令)。但现有基准并未提供此类注释。

(2)它们的任务覆盖范围仍然有限:主要关注短期记忆,结构复杂度较低,任务多样性有限,并且在许多情况下包含了并不真正需要记忆的任务。

(3)这些基准仅限于仿真环境,缺乏相应的真实世界机器人评估。

3.How?

仿真环境:26个任务涵盖了反应式策略的四种代表性失败模式:
(1)多物体转移。智能体需要在视觉上相同的容器间移动多个物体,并必须记住源-目标映射关系以及哪些转移已完成。(2)多物体遮挡。智能体将物体放入抽屉或柜子中,这些容器之后会在视觉上关闭,因此它必须记住放置了什么、放置在哪里以及每个容器的先前状态。这一类别在我们的基准中数量最多(11个任务),反映出遮挡频繁导致反应式策略在家庭场景中失败的现象。(3)多物体计数。智能体必须执行指定次数的动作(例如,恰好倒两次),即使连续重复前场景几乎完全一致。(4)多物体序列。正确的后续动作依赖于先前子任务的结果,例如将一个新物体放入上一步中使用的同一个容器。挑战不仅在于隐藏状态,还在于解析跨越多个操作的指令指代。我们在图2中从四个类别中各提供一个代表性任务。逐任务的详细描述总结在附录表S2中。

除了仿真环境,RoboMemArena在双臂平台上配套了五个真实世界记忆任务:倒瓶×2、换洗刷盘、物体转移、弹球戏法、模仿人类做早餐(IHMB)。它们共同涵盖了计数、遮挡、顺序执行、隐藏目标追踪以及基于人类示范的记忆。所有任务均在AgileX Cobot Mobile Aloha平台上采集与评估。我们将这些任务用作基准设计的物理验证集。详细任务描述和代表性截图见附录表S4和图S2。

RoboMemArena通过三个阶段(图1)解决了可扩展自动采集与细粒度时间标注之间的常见权衡。

第一阶段:基于VLM的任务分解。给定高层指令和当前RGB观测,VLM生成有序的可执行子任务序列,作为仿真中的可扩展初始标注。随后,我们手动纠正其中不合适或不一致的子任务分解,再进入下游执行。提示语的设计旨在暴露出记忆需求,如遮挡、计数和顺序依赖执行。

第二阶段:基于AnyGrasp的自主生成。每个子任务通过AnyGrasp(Fang等人,2023)自主执行——一个基于点云输入的6自由度抓取姿态估计器。估计出的姿态被发送到预定义基元以生成动作轨迹。此外,我们添加了后置条件检查器,在出现抓取失败时使用更新后的抓取姿态重试子任务。这种闭环执行保证了采集过程的自动化,同时维持了高成功率。

阶段 3:多条件关键帧提取。 固定频率采样要么会错过状态转换,要么会存储冗余的静态帧。将连续轨迹记为 τ = {(st, at)}Tt=1,其中 st 是状态,at 是时间步 t 处的动作。我们通过取满足以下两个物理条件之一的帧的并集来提取关键帧集合 K:K = Kphys ∪ Kkin。(1)

  1. 物理交互锚点。夹爪状态转换标志着抓取闭合与释放。令 gt ∈ {0, 1} 表示夹爪状态(1 表示闭合,0 表示张开)。锚点集合为:Kphys = {t ∈ [1, T] | gt ≠ gt−1}。(2)
  2. 运动学拐点。末端执行器速度极小值与 abrupt 方向变化标志着运动阶段之间的转换。令 vt ∈ R³ 为末端执行器线速度。若速度大小降至阈值 ε 以下,或连续速度向量之间的余弦相似度低于 cos(θ),则判定时间步 t 处存在一个运动学拐点:Kkin = t ∈ [1, T] ∥vt∥ < ε ∨ vt·vt−1 / (∥vt∥ ∥vt−1∥) < cos(θ)。(3)
    这些条件共同选取了信息瓶颈帧,这些帧在避免密集视频存储的同时重构了任务进展。注释结果为 VLM 提供了时间监督,同时保持了紧凑且以事件为中心的存储表达。
    Comparison with Popular Benchmarks used in the Robot Learning Literature
    在表1中提供了RoboMemArena与14个已建立基准在8个特征维度上的全面比较。RoboMemArena是唯一满足所有八项标准的条目。综合来看,这些比较凸显了RoboMemArena的三大基准层级优势:通过原生关键帧实现更丰富的多模态记忆监督,通过自动轨迹生成实现更广泛的规模与多样性,以及用于物理验证的配对现实世界评估。
    Summary statistics of RoboMemArena
    对于26个任务中的每一个,我们收集了100个成功的演示,共生成2,600条长时域视觉轨迹。这些轨迹产生了15,100个关键帧对齐的短片段,用于分层监督。在平均轨迹长度方面,我们的RoboMemArena比现有机机器人记忆基准测试更长,每个任务达到1,076个步骤,如图3(a)所示。图3(b)展示了RoboMemArena的任务组成,其中包括4个转移任务、11个遮挡任务、7个计数任务和4个序列任务。

The PrediMem pipeline
PrediMem是一种具有预测编码的层次式记忆框架,用于具身记忆。它包含一个高层规划器(系统2,记为S2)、一个底层执行策略(系统1,记为S1)、一个基于关键帧的记忆库,以及一个辅助预测编码头。如图4所示,记忆库Mt结合了长期关键帧缓冲区Mkey_t与一个固定视野Mtrec长度的近期滑动窗口,即 Mt = Mkey t ∪ Mtrec。S2 结合当前观测与记忆库来预测当前子任务,并决定当前帧是否应作为关键帧存储。被接受的关键帧将写回关键帧缓冲池,使系统能够保留超出最近观测窗口外的决策关键事件。同时,S1 预测最新的子任务条件化动作块。

预测编码。关键问题在于何时将帧写入记忆:过度存储会浪费容量,而遗漏状态转换则会导致下游误差。为增强模型对关键帧的敏感性及捕捉未来动态的能力,我们引入预测编码。其目标是从当前帧的视觉特征 ot 中预测下一帧的表征,从而使模型能更好地捕捉关键帧处的突变状态转换。为此,我们增加一个额外的预测编码头 fPre,其预测下一帧的视觉特征 Zˆt+1 = fPre(ht),监督信号 Zt+1 由 VLM 的视觉编码器(即冻结的 ViT)提供。遵循 Cambrian-S(Yang 等人,2025),预测损失 LPre 定义为潜变量均方误差项与余弦距离项之和,针对停止梯度的教师模型下一帧潜变量特征:

LPre = MSE(Zˆt+1, sg(Zt+1)) + 1 − cos(Zˆt+1, sg(Zt+1))。 (6)

总训练损失。S2 的最终目标结合了下一个token预测与预测编码损失:LS2 = Ltext + 0.1LPre。其中 sg(·) 表示停止梯度算子,Ltext 表示子任务生成与关键帧决策的下一个token预测损失。S1 的损失函数遵循(Black 等人,2025)中介绍的官方流匹配目标。

推理。推理时,预测编码头被移除,因此我们的 PrediMem 保留了标准双系统框架的架构与开销,同时继承了改进后的动态理解与关键帧选择能力。该双系统执行异步推理,详见附录C节与表S1。

4.Takeaways:

主要就是提出了一个benchmark可以用于后续模型的评测,以及他们的其预测编码目标使得隐藏状态对物理状态转变更加敏感,且不增加推理时的计算成本。这个想法已经是和我的idea高度相似了,唯一区别是没有提到记。

局限性&未来工作:

论文中未说

RoboMemArena | arxiv 2026.5.11 | Paper Reading

https://fanchenlex.github.io/reandings/RoboMemArena/

Author

Wenzhuo Li

Posted on

2026-06-12

Updated on

2026-06-13

Licensed under

WeChatQQGoogle ScholarWeeklyLogRSS