SkillMemo | arxiv 2026.8.6 | Paper Reading

SkillMemo | arxiv 2026.8.6 | Paper Reading

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

这是一篇关于记忆VLA的文章,特色的地方是文章显示将原子技能和记忆相结合。

工作类型(首次/改进) 技术路线 创新点 日期
首次 VLA skill+memory 2026-08-06

1.What?

SkillMemo是一个基于技能的记忆框架,该框架将长时程演示隐式分解为潜在原子技能,并将技能级特征整合到动态情景记忆库中,以求解组合性任务。具体而言,我们首先引入一个基于专家混合(MoE)架构构建的专家引导轨迹分割模块,该模块通过学习的门控系数将轨迹隐式划分为不同的技能原语。我们进一步设计了一种技能级情景记忆架构,将紧凑的技能表示存储为可检索的键值对。在推理阶段,记忆库检索最相关的技能原语,并将其与模型当前的门控分布相融合,为优化动作预测提供强大的上下文先验。

2.Why?

现有方法缺乏显式机制来记忆行为上显著的技能级特征。因此,它们往往表现出对先前经验的低效复用,以及在未见任务中组合泛化能力的减弱。

扩散策略(Diffusion Policy, DP)[1]和视觉-语言-动作(Vision-Language-Action, VLA)模型[20, 8, 21]推动。尽管DP将控制表述为迭代去噪,并通过3D表示[22, 23]和层次结构[24, 2]进行了扩展,而VLA模型则利用大规模机器人数据集[25, 9, 11, 7, 26]将大规模视觉-语言预训练与动作生成相结合。尽管它们具有令人印象深刻的零样本能力,但在可用示范有限的情况下,这两种范式都难以实现组合泛化,这促使我们开展技能级记忆增强方面的工作。

memoryvla等方法存储非结构化或整体性的视觉-语义表征,缺乏捕获和复用细粒度技能级行为模式的能力。相比之下,SkillMemo以结构化方式存储分解后的技能原语,并基于行为相关性进行检索,为组合泛化提供了稳健的上下文先验。

3.How?

Overview of the SkillMemo framework
传统的 VLA 模型通常使用单个整体网络来学习完整的行为轨迹,这导致其组合性有限,并且对异构、高维动作序列的泛化能力较差。为解决这一局限,我们引入了一个**专家引导的轨迹分割模块,该模块将完整轨迹结构化地分解为一系列潜在原子技能。**这种分解使得网络能力能够进行细粒度的专门化,并促进结构化的技能复用。形式化地,给定一条完整轨迹 τ = {(xt, at)}tT=1,其中 xt 和 at 分别表示时刻 t 的观测和动作,显式分割过程将 τ 划分为一组不重叠的技能片段:

τ → {sk}K k=1, sk = {(xt, at) | t ∈ [tstart, tstart+L]}, (1)

其中每个片段 sk 对应一个语义连贯的技能,块大小为 L。然而,显式分割方案往往难以捕捉所有潜在的技能边界,从而导致技能划分不准确。相反,我们引入了一种隐式技能划分方案,其中分解是从模型的特征表示中动态学习得到的。具体而言,我们使用混合专家(MoE)架构来实现这种技能分解,该架构由 N 个专家网络 {E1, . . . , EN } 和一个门控网络 G 组成。给定时刻 t 的中间特征表示 ht,MoE 层计算:

yt = N X i=1 gi(ht) · Ei(ht), (2)

其中 Ei(·) 表示第 i 个专家,gi(ht) 表示其对应的门控权重。直观上,**每个专家捕捉一种重复出现的局部运动基元,而门控网络 g 通过随时间调制专家激活,隐式地定义了时间分割边界。**这种隐式划分机制能够实现自适应且数据驱动的技能发现,确保所识别的技能与涌现的任务级结构保持一致。

为进一步鼓励专家之间形成独特的技能专门化,并促进涌现的技能组合,我们使用基于局部信息分解(PID)理论推导出的协同信息损失对模型进行正则化。对于任意一对专家 (A, B),我们相对任务目标 G 定义其协同信息为:

LPID = − I({A, B}; G) − I(A; G) − I(B; G) , (3)

其中 I(·; ·) 表示互信息。最小化 LPID 鼓励专家的联合表示包含比个体专家表示之和更多的任务相关信息。这驱动每个专家专门化于互补的技能,同时实现更高阶的协调,从而促进学习到不同的、不重叠的技能基元。作为补充,我们采用专家负载均衡损失和 top-k 路由策略来防止专家坍缩。

3.2 技能级记忆架构

尽管第 3.1 节中基于 MoE 的轨迹分割发现了一组可复用的原子技能,但仍存在一个关键挑战:**如何有效利用这些技能来解决组合式新任务,即训练中未出现的、以新方式重新组合的已见对象。**传统 VLA 策略是纯反应式的,仅依赖当前观测和其静态网络权重,从而丢弃了过往成功执行中蕴含的丰富历史上下文。为赋予我们的智能体一种经验推理能力,我们引入了一种技能级情景记忆架构,该架构在推理过程中存储、检索并组合先前学习到的技能基元。

记忆存储。我们首先建立记忆模块的基本原理:显式保留先前习得的技能,以通过推理过程中的自适应技能组合来促进任务完成。为此,我们将记忆库 M 组织为键值对集合,包含两个核心组件:

(1)记忆键。对于**分割模块发现的每个原子技能片段 sk = {(xt, at)}tstart+L t=tstart,我们构建一个紧凑的记忆条目。为实现高效检索,我们利用潜在轨迹特征 ht 来确定推理观测与已存储技能之间的相似性。然而,直接存储所有时间步的逐帧特征会导致记忆库不可扩展。**为解决这一问题,我们采用时间聚合为每个技能片段提取一个紧凑的质心特征:

km = 1 L X t∈τm ht, (4)

其中 τm 表示第 m 个技能片段,ht 表示时刻 t 的潜在特征。通过存储这一紧凑质心,我们保留了技能轨迹最具代表性的特征,从而确保检索过程的效率。

(2)记忆值。值组件存储复现该技能所需的功能性知识。由于门控权重 g(ht) 控制专家激活并隐式定义技能类别,我们将门控分布指定为核心知识内容。为确保保留详细的时间动态和信息有效性,我们存储片段内所有时间步的完整门控权重序列。最终的记忆库 M 因此组织为:

M = {(km, vm) | vm = {g(ht)}t∈τm }M m=1 , (5)

其中 M 是存储的技能基元总数,vm 表示第 m 个存储的门控权重。这种记忆结构使模型能够高效检索最相关的技能,并通过专家引导显著增强推理过程。

记忆检索。在训练期间构建记忆库之后,我们利用存储的程序性知识来增强推理过程中的策略执行。标准 VLA 模型在分布外(OOD)场景下,由于缺乏多样化的训练样本,模型往往难以实现泛化。我们的基于技能的记忆通过提供一个可复用行为的结构化库来解决这一问题。首先,我们通过将当前状态表示与存储的记忆键进行比较,来识别最相关的历史技能。设 qt 表示推理时当前观测的潜在特征。我们计算 qt 与记忆库 M 中每个键 km 之间的余弦相似度:

s(qt, km) = (qt · km) / (∥qt∥∥km∥), (6)

其中 s(·, ·) 表示相似度分数。基于这些分数,我们检索与当前状态具有最高亲和度的前 N 个记忆条目 Mtop = {(kn, vn)}nN=1。为确保鲁棒性,我们在整合检索信息之前引入记忆可靠性检查。我们计算检索集的平均相似度分数,并将其与预定义的置信度阈值 δ 进行比较。如果检索被判定为可靠,我们通过将检索到的专家激活特征与模型当前预测的门控分布进行融合,来增强当前策略。具体来说,我们通过将门控权重 g(ht) 与检索到的门控特征进行平均来细化门控权重:

g′(qt) = λg(qt) + (1 − λ) · (1/N) · Σ_{n=1}^{N} vn[t′], (7)

其中 λ 是控制记忆干预强度的超参数,vn[t′] 对应于检索到的技能序列中对齐的时间步。通过显式地整合这些检索到的先验信息,模型可以通过已知基元的组合来合成新颖行为,从而显著提高在未见过的任务配置上的组合泛化能力。

记忆更新。为了适应智能体不断遇到新任务的终身学习场景,我们为有限容量记忆库设计了一种动态记忆更新机制。由于记忆库的容量有限,即 Mmax,剪除过时信息以容纳新经验至关重要。我们实现了一种使用追踪方法,用于监控每个记忆条目的检索历史和验证状态。当记忆库达到其容量上限时,我们采用优先级剪枝策略来丢弃低效用信息。具体来说,我们基于三个标准来确定要移除的记忆条目:(1)时间戳最过时的记忆,模拟人类对遥远且未强化细节的遗忘认知过程;(2)一直未被使用、即未被成功检索的记忆;(3)在检索阶段始终无法满足可靠性阈值 δ 的记忆,表明这些条目质量较低或无关紧要。这种动态剪枝策略在记忆多样性与记忆质量之间取得了平衡,确保记忆库保持紧凑、相关,并有利于有效的技能组合。

4.Takeaways:

主要强调skill+记忆的重要性

局限性&未来工作:

未提到

SkillMemo | arxiv 2026.8.6 | Paper Reading

https://fanchenlex.github.io/reandings/skillmemo/

Author

Wenzhuo Li

Posted on

2026-08-24

Updated on

2026-08-24

Licensed under

WeChatQQGoogle ScholarWeeklyLogRSS