Latent Bridge | arxiv 2026.05.04 | Paper Reading
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
作者了提出Latent Bridge,一种轻量级模型,用于预测不同时间步之间VLM输出的增量变化,使得动作头可以对预测的输出进行操作,而耗时的VLM骨干网络仅需周期性调用。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | VLA | efficiency | 2026-05-04 |
1.What?
作者在两个架构不同的VLA模型上实例化Latent Bridge:GR00T-N1.6(特征空间桥接)与π0.5(键值缓存桥接),证明该方法可泛化至不同VLA设计。我们的任务无关DAgger训练管道无需修改即可跨基准迁移。在四个LIBERO任务套件、24项RoboCasa厨房任务及ALOHA模拟环境下Transfer-cube任务中,Latent Bridge在减少50–75%的VLM调用次数的同时,保留了95–100%的性能,实现了每轮1.65-1.73倍的净加速比。
完整流程包含三个阶段(采用任务自适应方式):第一阶段是桥模型学习阶段(同步收集 + R0 监督训练 + DAgger R1 精炼),这也是简单基准测试所需的唯一阶段;第二阶段(LoRA 动作头自适应)和第三阶段(相位感知 VLM 调度)则针对长时域任务添加,在这些任务中自回归桥接漂移会在长期展开中积累。
2.Why?
现有的高效VLM/VLA推理方法均未测量净回合累计时长,并且仍然执行完整的主干网络——因此它们与我们的方法互补而非竞争:我们的方法不是优化VLM前向传播,而是在桥梁步骤完全跳过它,而该桥梁可以与此类方法中执行VLM步骤时所采用的任意技术组合使用。
作者借鉴了世界模型的思路,桥梁的运行原理最为接近。我们的桥梁同样预测未来的潜在状态,但是在VLM的隐藏表示空间中而非学习到的抽象状态中,并且其目的是加速推理而非实现规划或表示学习。
3.How?
作者和几个基线设计进行了对比:
最简单的基线是特征缓存,即设置B = Id(即zˆt+1 = zt,等价地∆t = 0),非VLM步上复用陈旧的VLM特征。这对应零函数桥接器,充当性能下界;我们的习得桥接器必须胜过这一平凡预测器。
周期f控制加速与动作质量之间的权衡:更大的f减少VLM调用但会在连续桥接步上累积预测误差。我们的目标是找到能在保持>95%任务性能的同时最大化加速的工作点。
潜在桥接器架构特征空间桥接器(GR00T)。对于在主干网络与动作头之间具有单一特征向量接口的VLA,桥接器通过残差预测单步特征增量:zˆt+1 = zˆt + ∆t, ∆t = B(zˆt, st, qt, at−1) (3),其中zˆt ∈ RNimg×D是动作头最近消费的特征(VLM步时来自VLM的新鲜特征,或桥接步时自回归链式运行结果;边界zˆt := zt同式2),st为提供场景上下文的稳定层特征,qt为本体感知状态,at−1为先前动作。桥接器B是一个带有交叉注意力(DiT块)的Transformer,包含:
• 对输入特征zt与可学习位置嵌入的自注意力
• 对稳定上下文st的交叉注意力,无需视觉编码器即可提供视觉基础
• 对(qt, at−1)的AdaLN条件化,在每一块中注入状态和动作信息
• **零初始化输出投影,**使得未训练桥接器从特征缓存基线(∆t = 0)开始。

仅图像处理。文本令牌隐藏状态在连续步之间近乎不变(余弦相似度>0.9999),因为指令在回合内固定,因此预测接近零的文本增量。会稀释图像token delta上的梯度。因此,桥接器仅对图像令牌 (Nimg ≪ N) 进行操作,并从最后一个VLM缓存中复制文本令牌;从桥接器输入中丢弃文本是安全的,因为ẑt已由文本条件化的VLM生成并隐式编码了指令。实验表明,这不会造成SR损失,同时使桥接器具有序列长度无关性。
稳定层与动态层。我们将VLM的中间隐层表示分解为稳定层(早期/中间层,连续步骤间余弦相似度>0.999)和动态层(最终层,余弦相似度约0.95)。桥接器预测动作头输入zt,并将稳定层特征st作为交叉注意力上下文使用,为当前观测提供局部视觉上下文(空间布局、物体身份)。在桥接步骤中,st复用自上次VLM调用,而zt则重新预测。

训练流程
我们的训练流程包含三个阶段,均与任务无关:
阶段1:同步数据收集。在模拟器中以同步模式(每一步都运行VLM)部署预训练的VLA,记录其闭环观测轨迹上的元组 (z_t, z_{t+1}, s_t, q_t, a_{t-1});此后桥接器的训练完全基于该固定数据集进行离线训练。
阶段2:R0桥接器训练。我们将仅在同步数据上训练的初始桥接器称为“第0轮”桥接器(R0)。桥接器通过联合MSE和余弦损失在同步对上进行训练,且仅作用于图像令牌:
L = ∥ẑ_{t+1} − z_{t+1}∥² + α (1 − (ẑ_{t+1}·z_{t+1})/(∥ẑ_{t+1}∥·∥z_{t+1}∥)) (4)
其中所有项仅作用于图像令牌(α=1.0)。文本令牌delta被从损失中屏蔽,因为它们接近零且会稀释梯度信号。
阶段3:DAgger精炼(R1)。R0训练后,我们应用一轮DAgger精炼以生成“第1轮”桥接器(R1)。R0桥接器以VLM调用周期f在仿真中部署,同时VLM oracle并行运行以在每个控制步骤提供真实特征(机器人仍遵循桥接器策略的动作)。这产生DAgger对 (ẑ_{t+t′−1}, z_{t+t′}),其中每个桥接步骤的偏移 t′ ∈ {1, …, f−1} 以步骤t的VLM调用为基准:输入与公式2馈入桥接器的内容完全一致——通过边界约定ẑ_t := z_t,在t′=1时简化为新的VLM特征z_t,在t′≥2时为桥接器自身(可能带噪声)的预测——并与oracle的真实特征z_{t+t′}作为目标配对。桥接器在混合的同步+DAgger数据上重新训练,从R0权重以降低的学习率恢复。DAgger至关重要,因为在t′≥2时桥接器的输入是其自身预测而非干净的VLM特征;如果没有DAgger,误差会在较高f值下迅速累积。
可选增强
阶段感知的VLM调度。对于具有多样化运动阶段的复杂任务,我们根据前一次动作的平移幅度 ∥a_t^{trans}∥ 动态调整f:高运动 (∥a_t^{trans}∥ > τ_nav) → f=2,中等 (τ_manip < ∥a_t^{trans}∥ ≤ τ_nav) → f=3,低运动 (∥a_t^{trans}∥ ≤ τ_manip) → f=4。这在高动态阶段(桥接器预测可靠性较低)分配更多VLM计算资源。
LoRA动作头适配。当桥接器特征比干净的VLM特征噪声显著更大时,我们对动作头的DiT应用低秩适配(LoRA)Hu et al. [2022],在50/50混合的桥接器与同步特征加上高斯噪声增强的数据上进行训练。这提高了动作头对桥接器预测噪声的容忍度。
适配至π0.5:KV缓存桥接器
与GR00T的单一特征向量接口不同,π0.5 Physical Intelligence et al. [2025] 采用交错设计,其中Gemma-2B骨干网络和Gemma-300M动作专家共享Transformer层:在L=18层的每一层中,动作(后缀)令牌对骨干网络的(前缀)每层KV缓存进行交叉注意力。我们适配桥接器以同时预测所有L层的RoPE前键和值delta:
{∆K_l, ∆V_l}^L_{l=1} = B_{KV}(∆e_t, e_t, KcV_{t-1}, q_t, a_{t-1}), (5)
其中 e_t = SigLIP(o_t) 为视觉嵌入,∆e_t = e_t − e_{t-1} 编码步骤间的视觉变化,KcV_{t-1} 为最近的每层KV缓存(在VLM步骤中直接从VLM新鲜获取,或在桥接器步骤中自动回归地从桥接器前一次预测链接;遵循与公式2相同的边界约定)。B_{KV} 使用共享的DiT骨干网络搭配18个轻量级每层输出头。SigLIP(约5ms)提供新鲜视觉上下文的成本远低于完整的Gemma前缀(约46ms);在bf16 + torch.compile下,桥接器步骤总成本约为6ms。架构细节及RoPE处理见附录A。
推理
在VLM调用周期为f的部署中:
• VLM步骤(t mod f = 0):运行完整的骨干网络V。缓存z_t、s_t以及供桥接器使用的KV对。
• 桥接器步骤(t mod f ≠ 0):B根据最近表示预测∆——在第一个桥接步骤中使用最新的VLM特征z_t,在后续步骤中使用其自身前一次输出ẑ_{t′−1}(自回归链接)。动作头运行在预测得到的ẑ_t上。相较于被替换的VLM骨干网络的46–63ms,成本为2–6ms。
4.Takeaways:
消融研究模块作者发现视觉与稳定上下文均至关重要,其退化程度随任务复杂度增加而增大。移除视觉导致Goal任务降低11.16个百分点,LIBERO-10降低28.34个百分点;移除稳定上下文则使Goal任务降低5.16个百分点,LIBERO-10降低11.00个百分点,因为桥接模块失去了对缓慢变化场景结构的锚定表征。19M参数的桥接模块表现持平或略优于148M参数版本,证实容量并非瓶颈。
案例研究:为何缓存会失败
在一个具有代表性的LIBERO-Spatial场景中(频率 f=3),缓存KV与真值的余弦相似度随着机器人移动呈锯齿状下降至约0.91,而桥接模型保持约0.99(图5a);由此产生的分布外特征将动作输出偏离轨迹,导致任务失败(图5b)。缓存KV仅编码了旧的场景,而桥接模型则通过廉价信号——SigLIP差分(约5毫秒)、状态和先前动作——主动预测更新,以最小代价弥补差距。
另外这篇文章和我目前做的工作有很高的相似性,就很有借鉴意义,对我目前的实验也很有帮助
总结了12点列在下面:
-
预测不同时间步之间VLM输出的增量变化
-
耗时的VLM骨干网络仅需周期性调用
-
该方法可泛化至不同VLA设计→GR00T-N1.6(特征空间桥接)与π0.5(键值缓存桥接)
-
减少50–75%的VLM调用次数的同时,保留了95–100%的性能,实现了每轮1.65-1.73倍的净加速比
-
ẑ_{t+1} = ẑ_t + B(ẑ_t, s_t, q_t, a_{t-1}) (1) 更新公式和我的记忆更新公式形式上很类似
-
完整训练流程包含三个阶段(采用任务自适应方式):第一阶段是桥模型学习阶段(同步收集 + R0 监督训练 + DAgger R1 精炼),这也是简单基准测试所需的唯一阶段;第二阶段(LoRA 动作头自适应)和第三阶段(相位感知 VLM 调度)则针对长时域任务添加,在这些任务中自回归桥接漂移会在长期展开中积累。
-
作者在相关工作中提到了:世界模型与潜在动力学,并且讲到了他们的这种预测方式其实也算一种世界模型的逻辑。其实和我的想法一样了,只不过他们的是视觉观测,我们是记忆(但其实也是视觉观测的一种抽象表示)
-
作者还是将重心放在efficiency上,直观体现就是在libero上的结果他们的性能是差于baseline的,因为没有其他创新的结构去提升精度。所以重心就是放在他们的精度和baseline接近针对
基线 96.96 vs 96.92但是提升了:平均每步延迟(在一个调用周期f内对VLM步骤和非VLM步骤取平均)
净墙上时钟加速比
-
训练超参数类似:这篇文章中默认f=4(因为4是效果最好的,他们实验出来精度在libero上是最高的),而我自己在训练过程中也是设置每4帧固定激活一次。然后另一个合理的地方在于作者对于libero就是采用f=4的,而我现在尝试的就是libero所以很合理用的数据集也一样。也就是作者做了相关的实验,证明f取4的时候性能和速度可以达到一个平衡,因此我自己之前设置的这个每四步激活一次就感觉比较合理
-
另外作者在case study中讲到了缓存会失败 ,也就是如果直接复用旧的kv cache就会导致精度下降,所以更说明我之前完全复用旧的kv cache的思路是不太对的,应该输入前向预测的一些信息。
不过还有一个地方是我觉得奇怪的,就是我就算复用的旧的kv cache也不应该精度直接掉很低,这个感觉和我阈值学习也有关系 -
训练方法上我发现这篇文章和我目前的想法也类似:“从 R0 权重恢复” 作者在附录中就说了他们几个阶段的模型都是再上一个阶段的基础上继续训练得到的。
-
另一个类似的地方在于,他们用的那个DAgger的学习率是降低了10倍,而我对于所有的memoruy相关的参数都是10x于基础模型的学习率
局限性&未来工作:
DAgger需要在线仿真,且桥接器与特定VLA检查点绑定。对于π0.5这类交错架构,动作专家仍需遍历全部18层,导致约30毫秒的去噪下限;通过Song等人[2023]的一致性蒸馏实现后缀级桥接,可将加速比推至2倍以上。
Latent Bridge | arxiv 2026.05.04 | Paper Reading









