DAM-VLA | ICRA 2026 | Paper Reading
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
这是一篇发表在ICRA 2026的文章,讨论了最近我看到VLA领域比较火的记忆和动态中的一个话题,不过这篇文章主要聚焦的是动态动作的生成。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | VLA | dynamic action | 2026-03-01 |
1.What?
DAM-VLA,一种基于动态动作模型的VLA框架。DAMVLA将VLM推理与专用于手臂和夹爪控制的扩散动作模型相结合。
具体而言,它引入了:
(i) 动作路由机制,利用任务特定的视觉与语言线索选择适当的动作模型(如手臂移动或夹爪操作);
(ii) 动态动作模型,融合高层VLM认知与低层视觉特征以预测动作;
(iii) 双尺度动作加权机制,实现手臂移动模型与夹爪操作模型之间的动态协调。
在广泛评估中,DAM-VLA在仿真环境(SIMPLER、FurnitureBench)和真实场景下均实现了比先进VLA方法更高的成功率,展现出从标准抓取放置到要求苛刻的长时程及高接触任务中的鲁棒泛化能力

为了更好地利用VLM的固有能力,以面向在动态环境中结合任务特定操作和通用操作的VLA模型,我们首先识别机械臂运动与夹爪操作之间的几个关键区别。在许多机器人任务中,机械臂运动的空间范围大于夹爪操作。因此,在观测图像中,机械臂轨迹往往占据主导地位,而夹爪操作则局限于较小的局部区域。图2以将胡萝卜放在盘子上的任务为例说明了这种差异,其中视觉注意的非灰色区域突出了该差异。具体来说,机械臂运动需要全局注意,而夹爪操作则要求局部聚焦。这些根本区别可总结如下:(1)路径约束。机械臂运动相对不受约束,因为机器人可以采取多条轨迹到达胡萝卜。相比之下,夹爪操作受到高度约束,需要精确的抓取姿势才能成功。(2)视觉注意。机械臂运动依赖于全局场景理解,而夹爪操作则需细粒度的局部视觉注意。(3)数据集表示。数据集通常包含的机械臂运动片段远多于夹爪操作片段。尽管如此,夹爪操作尽管数量较少,但对任务成功至关重要,且通常更为复杂。
2.Why?
传统的机器人学习方法通常针对特定机器人和任务整理的数据集来训练策略。由此产生的策略充当专家角色,例如广受欢迎的ACT [1]和Diffusion Policy [2]。尽管这些方法在目标场景中实现了高精度,但它们在多变的环境和任务中泛化能力较差。
现有的一些VLA方法,如RT-H [5]、RT-Affordance [6]和ECOT [7],引入了思维链(CoT)推理来分析夹爪与物体之间的空间关系,并预测相应的动作。尽管CoT增强了VLM的推理能力并改善了泛化性,但它引入了大量额外的推理令牌,并显著增加了推理时间。另一方面,基于扩散的VLA方法,包括π0 [8]、TinyVLA [9]、RDT-1B [10]、RoboDual [11]、CogACT [12]和HybridVLA [13],在VLM之后附加了一个独立的扩散头。这些方法要么以VLM提取的特征为条件,要么在扩散过程中将去噪时间步和噪声动作联合嵌入到令牌序列中。尽管这些方法实现了更精确的操作,但仅依赖VLM提取的特征限制了对更丰富多模态线索的整合。
3.How?

目标是开发一个基于动态动作模型的VLA框架,使不同的机器人能够在动态环境中接收RGB图像观察和以语言指令形式给出的任务描述,从而物理地执行多样化任务。形式上,给定语言指令l和t时刻的视觉观察o_t,模型π预测一个时间动作序列[a_t, a_{t+1}, …, a_{t+N}] = π(l, o_t)。动作空间a_t = [δx, δθ, s_grip]对应于具有7自由度(DoF)的夹持器,其中δx表示末端执行器的相对平移偏移,δθ表示旋转变化,s_grip ∈ {0, 1}表示夹持器的打开或关闭状态。在图3中,DAM-VLA的架构由三个关键组件组成:1) 视觉-语言模型,将来自观察o_t的信息编码为视觉令牌f_vis、类别令牌f_cls和寄存器令牌f_reg,并将视觉令牌f_vis与来自语言指令l的一组语言令牌f_lan整合,产生认知潜在特征f_cog和推理潜在特征f_rea;2) 动作路由模块,生成权重w并将其输入动态动作模型;3) 动态动作模型,通过将来自视觉模型的低级类别令牌f_cls或寄存器令牌f_reg与来自VLM的高级认知潜在特征f_cog相结合,动态执行不同的动作模型以预测动作序列[a_t, a_{t+1}, …, a_{t+N}]。
B. 视觉-语言模型
视觉模型将RGB图像输入处理为一组令牌,其中不仅包括视觉令牌f_vis,还包括来自DINOv2 [39]的类别令牌f_cls和寄存器令牌f_reg。该视觉模型由强大的视觉Transformer DINOv2和SigLIP [40]组成,这些Transformer在互联网规模的图像数据上进行了预训练,以捕获低层丰富的视觉特征和高层语义理解。在每个时间步t,图像观察o_t被同时输入到手臂移动模型和夹持器操作模型中,每个模型生成一个下采样的特征图。这些特征图随后沿通道维度拼接,通过线性投影层,并被序列化为一组令牌,包括视觉令牌f_vis = [v_1, v_2, …, v_NV]、类别令牌f_cls和寄存器令牌f_reg。大型语言模型负责整合视觉信息和语言指令,并估计推理令牌。我们使用LLaMA-2模型[18]作为骨干网络。语言指令l被分词为一组语言令牌,f_lan = [l_1, l_2, …, l_NL]。这些令牌f_lan随后与视觉令牌f_vis以及一个额外的可学习推理令牌拼接,并由大型语言模型使用因果注意力机制进行处理。生成的输出分别包括认知潜在特征和推理潜在特征,即f_cog和f_rea。f_rea和f_cog分别来自LLM的第二层和最后一层Transformer层的隐藏特征。f_rea作为后续动作路由模块的输入,以选择合适的动作模型,而f_cog作为动作模型预测动作的输入。
C. 动作路由机制与动态动作模型
为了确定动作状态是处于手臂移动还是夹持器操作,我们设计了一种动作路由机制。它利用VLM的推理能力来学习权重w,并由我们设计的用于动态执行手臂移动模型或夹持器操作模型的标记权重wˆ ∈ {0, 1}进行监督。标记权重wˆ基于机器人夹持器的状态获得。当机器人夹持器的状态从打开变为关闭或反之亦然时,我们将其定义为机器人动作从手臂移动(wˆ = 0)到夹持器操作(wˆ = 1)的转换。wˆ的详细计算过程将在双尺度动作加权一节中说明。为了利用VLM的推理能力,来自VLM的推理潜在特征f_rea被输入到动作路由模块中,该模块通过一个全连接层和一个归一化层对其处理。输出为预测权重w,由以下交叉熵损失监督:
L_class = || − (wˆ log(w) + (1 − wˆ) log(1 − w))||_1. (1)
为了充分利用不同扩散动作模型的特定操作能力和VLM固有的推理能力,我们提出了动态动作模型。在训练阶段,动态动作模型使用标记权重wˆ_move和wˆ_mani来实现对手臂移动模型和夹持器操作模型的针对性学习。这些权重由轨迹权重和动作块权重计算得出。关于wˆ_move和wˆ_mani设计的更详细说明将在双尺度动作加权一节中给出。除了作为条件的高层VLM提取的认知潜在特征f_cog外,两个动作模型还分别以较低层的视觉令牌f_cls或f_reg作为条件。由于两个模型在图像中的注意力焦点不同,我们输入不同的视觉令牌。手臂移动模型需要更多全局注意力,因此我们输入类别令牌f_cls作为条件。相比之下,夹持器操作模型更关注局部注意力,因此我们输入寄存器令牌f_reg。关于动作模型的扩散Transformer(DiT)[27]模块,我们参考[12]。手臂移动和夹持器操作模型的损失函数分别监督如下:
L_move = ||n_move_i − nˆ_move||_P^2 wˆ_move, (2)
L_mani = ||n_mani_i − nˆ_mani||_P^2 wˆ_mani, (3)
其中|| · ||_P表示马氏距离,它根据标记权重wˆ_move和wˆ_mani对误差项进行加权。n_move_i和n_mani_i分别表示在第i个去噪步骤中,手臂移动模型和夹持器操作模型针对带噪声动作序列预测的噪声值。nˆ_move和nˆ_mani分别对应于移动和操作扩散动作模型的真实噪声值,并且是随机生成的。两个动作模型的输入包括带噪声的动作a_move和a_mani。a_move使用真实噪声nˆ_move和真实动作â计算,而a_mani使用真实噪声nˆ_mani和真实动作â计算。总损失是移动损失、操作损失和分类损失的加权和。相应的超参数w1、w2和w3分别设置为1.0、1.0和0.0001。
L = w1 ∗ L_move + w2 ∗ L_mani + w3 ∗ L_class. (4)
在测试阶段,动态动作模型根据预测权重w选择并执行适当的动作模型。如果w < 0.5,模型运行手臂移动模型,使用高层VLM提取的认知潜在特征f_c和全局类别令牌f_cls作为条件来预测多步动作序列。否则,如果w ≥ 0.5,模型运行夹持器操作模型,使用认知潜在特征f_c和局部寄存器令牌f_reg。此外,两个模型都接收随机噪声n_rand作为输入以促进扩散过程。

D. 双尺度动作加权
为了增强区分手臂移动和夹持器操作的鲁棒性,我们提出了一种用于模型训练的双尺度动作加权机制,如图4所示。
双尺度动作加权机制的核心目标是通过从全局(轨迹级别)和局部(动作块级别)两个角度调节不同动作类型的重要性,自适应地监督学习过程。
轨迹级权重(wt):这一全局视角将整个任务轨迹基于机器人夹爪的二元状态变化划分为不同的阶段,对手臂运动与夹爪操作进行建模。对于每个夹爪操作过程 k,我们采用非对称高斯分布 {N(u, σ_l^2), N(u, σ_r^2)} 来定义权重 w_t^k。两个分布共享相同的均值 u,表示夹爪状态发生转换(例如,从打开到闭合)的时间中点。为了体现动作模型在状态变化发生前需要更高精度和监督关注这一先验,我们为前缘分配较大的方差(σ_l = 6),为后缘分配较小的方差(σ_r = 2)。聚合的轨迹权重定义为 w_t = Norm(∑_k w_t^k),表示所有与操作相关权重的归一化总和。
动作块级权重(w_a):从局部视角来看,我们考虑了动作序列中固有的时间不确定性。由于预测置信度通常随着与当前状态时间距离的增加而衰减,我们采用指数衰减函数:w_a^j = γ^j,其中 j 表示动作块内的索引,γ = 0.8 为衰减因子。
多尺度集成:最终权重公式为 w_move = (1 − w_t) ⊙ w_a,w_mani = w_t ⊙ w_a。通过将这些权重应用于 L_move 和 L_mani,我们提出的双尺度动作加权机制通过逐点调制动态协调手臂运动模型与夹爪操作模型。
此外,标注权重 ŵ 由轨迹权重导出:若 ŵ_t > 0.5,则 ŵ = 1;否则 ŵ = 0。该权重 ŵ 作为预测权重 w 的真值标签,并通过交叉熵损失 L_class 进行监督。
4.Takeaways:
我们的方法不仅显著优于现有的VLA方法,而且在动态环境中的任务特定与通用操作场景中均能提供稳定结果。通过基于VLM引导的线索在专门动作模型之间进行动态路由,DAM-VLA为将语义理解融入具身决策开辟了新路径
局限性&未来工作:
首先,虽然我们的实验评估已涉及接触密集型和长时程任务,但目前集中于拾取-放置和家具组装;扩展到更多样化的任务家族将提供更广泛的验证。其次,尽管DAM-VLA大幅提升了大多数任务的成功率,但在“将绿色方块叠放在黄色方块上”场景中的增益相对有限,表明在细粒度协调与稳定性方面仍有改进空间。最后,DAM-VLA当前仅在两个动作模型之间进行路由;将该机制泛化以处理具有更丰富路由信号的多种动作类型,将进一步提升其在复杂现实场景中的适用性
DAM-VLA | ICRA 2026 | Paper Reading








