RoboTTT | arxiv 2026.7.16 | Paper Reading

RoboTTT | arxiv 2026.7.16 | Paper Reading

RoboTTT: Context Scaling for Robot Policies

这是一篇由LiFeiFei团队最新发表的文章,第一次将robot的上下文扩展到8k用到的方法思想其中部分我之前和AI讨论时也涉及过值得去反思一下。

工作类型(首次/改进) 技术路线 创新点 日期
首次 VLA context length 2026-07-16

1.What?

RoboTTT是一个机器人模型和训练配方,将视觉运动上下文扩展到8K时间步长,比最先进的策略高出三个数量级,且推理延迟不增加

RoboTTT的核心是将测试时间训练整合到机器人基础模型中,如视觉-语言-动作策略,生成一个序列模型,其重复状态包括快速权重、通过梯度下降在训练和推断过程中更新参数、将历史压缩到权重空间以及获取上下文信息以进行长期上下文条件分析。

通过在部署期间学习,RoboTTT实现了新形式的上下文内适应和策略改进。例如,它可以将演示新任务配置的人类视频作为条件,从而实现一次性模仿。通过DAgger蒸馏(DAgger Distillation),一种将DAgger式(57)失败到纠正映射蒸馏到快速权重中的训练过程,它学会了即时改进。为了扩展训练上下文长度,我们的方案将序列动作强制与截断时间反向传播(TBPTT)相结合,使上下文可以在不增加GPU内存的情况下增长。

2.Why?

长上下文视觉运动策略的三个挑战:以足够容量编码长历史、利用条件化上下文(12),以及使推理成本不随上下文长度增加。首先,由快速权重参数化的快速模型(如MLP)比循环神经网络的向量值状态具有更大的容量。其次,在部署期间训练快速模型可以保留机器人观测和动作的密集、重复流中的显著特征,并丢弃冗余特征。第三,随时间传播快速权重可以保持推理成本恒定,而Transformer的推理即使使用KV缓存,也会随历史增长而增加

3.How?

RoboTTT model architecture, training, and inference
RoboTTT 由视觉-语言模型(VLM)骨干网络和带有 TTT 层的扩散 Transformer(DiT)(52) 动作头组成。在时间步 t,它预测一个 H 步动作块 At = [at, . . . , at+H−1]。我们在自注意力和交叉注意力层之后添加 TTT 层,使得注意力处理单步信息,而 TTT 层跨时间维度处理信息。具体来说,RoboTTT 的 DiT 输入是一条跨越 T 个时间步的机器人轨迹 [R1, Φ1, q1, A ̃1, . . . , RT , ΦT , qT , A ̃T ],其中 Φt 是 VLM 输出的视觉-语言(VL)token,qt 是编码后的本体感觉 token,A ̃t 是加噪的动作 token,Rt 是 N 个可学习的寄存器 token(14; 30),在每个时间步前置,并关注所有其他 token。注意力层对单步 token Rt、qt 和 A ̃t 进行操作,并交叉关注该时间步的 VL token Φt。然后将每个时间步的注意力输出沿时间维度拼接,得到 X = [R1, q1, A ̃1, . . . , RT , qT , A ̃T ],并传递至 TTT 层以进行快速权重更新(公式 1)和输出(公式 2)。出于计算效率考虑,我们避免直接将 VL token Φ 传递至 TTT 层,而是依靠数量较少(N = 16)的寄存器 token R 来跨时间携带 VL 信息。

用于保持预训练能力的门控机制
Computation flow with tanh gating
为了保留预训练VLA模型的知识,RoboTTT从基础模型权重初始化,并采用一种经过学习的tanh门控机制(1),在训练开始时使TTT的贡献保持较小。具体而言,对于每个DiT层,我们学习α ∈ R^d,初始化为接近零(0.001),并通过

O = tanh(α) ⊙ O_TTT + O_attn (3)

对TTT贡献进行门控,其中O_TTT是来自等式(2)的TTT层输出,O_attn是注意力层输出。通过这种方式,RoboTTT学会调整TTT层的贡献,而不会压垮预训练模型的计算。

RoboTTT 序列训练

我们在机器人轨迹序列上训练 RoboTTT,以便在每个训练序列内更新快速权重,同时学习合适的快速权重初始化及其更新动态。TTT 投影矩阵 θQ、θK、θV 和快速权重初始化 W0 作为模型参数的一部分进行学习。具体来说,给定一个训练序列,我们在内部循环中使用快速权重损失 LFW(第 2 节)对其运行 TTT,在每个时间步计算外部任务损失,并在平均损失上优化完整模型。这样,投影矩阵直接从外部任务梯度中学习,而 W0 通过梯度的梯度进行元学习(21; 65),从而使快速权重更新适应机器人轨迹。

具体来说,我们的数据集 D = {ξ(i)}N i=1 包含 N 条轨迹,每条轨迹是语言、图像、本体感觉和动作块元组的序列 ξ = {(l, ot, qt, At)}tT=1,重新引入语言指令 l,该指令在整条轨迹中共享。每个训练序列是一条完整轨迹或不超过最大上下文长度的连续子轨迹。将每步流匹配目标记为 lt,在给定快速权重初始化 W0 的情况下,轨迹 ξ 上的序列损失为

Lfm (ξ; W0) = 1/T ΣT t=1 lt ((l, ot, qt, At) ; Wt−1) , (4)

其中 Wt−1 是进入时间步 t 的快速权重状态,在 TTT 层内更新为 Wt(公式 1)。然后,每个优化步骤相对于 Lfm 执行梯度步骤,同时更新常规模型权重和快速权重初始化。

序列动作强制
TBPTT. Gradients are truncated at segment boundaries; fast weights carry over, so TTT continues over the entire sequence
RoboTTT 使用动作的流匹配目标进行训练:DiT 动作头学习去噪 Ãt = Atτ = τ At + (1 − τ )ε,其中 τ ∈ [0, 1] 是流匹配时间步,ε ∼ N (0, I) 是采样噪声。在序列训练中,我们发现有必要为序列中的每个动作块独立采样噪声水平,我们将这种技术称为序列动作强制。如果没有它,训练会不稳定,可能的原因是跨序列共享一个噪声水平(全序列扩散)会使整个序列要么统一容易学习(低噪声),要么统一难以学习(高噪声),这与 Chen 等人(10)的发现一致。

总而言之,将 DiT 动作头记为 vθ,将时间步 t 的元组记为 ξt = (l, ot, qt, At),我们通过最小化

Lfm (ξ; W0) = 1/T ΣT t=1 lt (ξt; Wt−1) = 1/T ΣT t=1 Eτt,ε [ ‖vθ (Φt, Aτt t , qt; Wt−1) − (At − ε)‖2 ] , (5)

来训练带序列动作强制的 RoboTTT,其中每个 τt 独立采样为 τt = s(1 − u),u ∼ Beta(1.5, 1),s = 0.999。

在长序列上使用完整时间反向传播(BPTT)进行训练时,会存储每个时间步的激活值,因此 GPU 内存随序列长度增长。我们转而采用截断时间反向传播(TBPTT):将输入序列划分为多个片段,梯度仅在每个片段内流动(图 4)。关键在于,快速权重会跨片段边界传递,因此 TTT 能在整个序列上持续进行,而它们的梯度在边界处被分离。因此,GPU 内存由片段长度而非总序列长度决定,从而在固定内存预算下允许任意长的训练上下文。请注意,快速权重初始化 W0 仍会通过第一个片段接收梯度,其更新直接源自 W0。推理 如图 2 所示,RoboTTT 从学习到的初始化 W0 开始每次 rollout,基于当前观测更新快速权重,并将其传播到下一个时间步。在每个时间步,通过 k 步去噪生成动作块。

从上下文进行有效学习

RoboTTT 将快速权重更新与慢速权重更新解耦:通过对选定时间步上的流匹配损失进行掩蔽,这些时间步仅作为纯上下文,在不提供模仿目标的情况下更新快速权重。这种灵活性使 RoboTTT 能够从异构上下文中学习,例如人类视频演示或机器人自身的次优轨迹展开

从上下文视频演示中进行模仿

我们将同一任务的人类视频演示序列 ξvideo 与机器人轨迹 ξrobot 配对:视频序列仅更新快速权重(其流匹配损失被掩蔽),而动作损失则在更新的快速权重条件下基于机器人轨迹计算。通过在这样的配对上进行训练,模型学会从上下文视频中提取任务信息;在测试时,以单个未见任务配置的人类视频为条件,即可实现一次模仿。

DAgger蒸馏
DAgger Distillation
考虑一次机器人轨迹(rollout),其中包含按DAgger(57)方式收集的人类纠正:每当机器人犯错时,人类操作员便会介入并提供纠正动作,从而产生一条轨迹ξDAgger = {(l, ot, qt, At)}tT=1,其中每个执行的动作块At要么是机器人动作AtR,要么是人类纠正AtH。这种交错式轨迹反映了在线策略改进的自然模式。标准DAgger在人类纠正上进行微调,并丢弃次优的机器人动作;然而,正是这些动作揭示了每次纠正所应对的失败。RoboTTT则对两者都加以利用,但角色不对称:在序列训练期间,快速权重在完整的交互历史上更新,不仅包括已执行的纠正,还包括次优的机器人动作本身,而流匹配损失仅掩蔽到人类纠正。我们将这一过程称为DAgger蒸馏(图6)。这种不对称性——将失败作为上下文、将纠正作为目标——正是人类的“失败到纠正”映射被蒸馏进快速权重的方式:模型学会响应失败而生成纠正,而不是孤立地模仿纠正,从而更充分地利用所收集的同一批数据。我们将其视为算法蒸馏(39)在机器人学中的一个实例:
由人类干预引发的改进过程被蒸馏到策略的快速权重适应中。在测试时,模型在线执行此类修正,无需人类干预;其自身的修正随后进入历史记录,并被吸收到快速权重中,与训练期间人类修正的方式完全相同。正如我们在第4节中所示,DAgger蒸馏比标准DAgger训练能带来更强的故障恢复能力和更高的任务性能。

实现细节:我们在预训练的 GR00T N1.7 (51) 上实例化 RoboTTT,在其 16 个 DiT 层中的每一层添加一个 TTT 层每个快速模型是一个两层 MLP。我们在桌面双臂机器人数据和第一人称人类数据 (81) 的混合上进行预训练,逐渐将预训练上下文长度增加到目标值(例如,RoboTTT-8K 的 8K 时间步),在 16 块 NVIDIA GB200 GPU 上训练 30K 步。然后,我们在每个下游任务上以 1K 上下文长度进行后训练,训练 20K 步。更多细节见附录 A。

4.Takeaways:

首次证明,扩展预训练上下文长度可以持续提升闭环性能:RoboTTT-8K的任务完成得分比使用1K时间步上下文预训练的同一模型高63%,并且比最佳短上下文基线高出57%,这表明上下文长度是机器人基础模型的一个新的扩展轴。

局限性&未来工作:

首先,扩展训练上下文长度会增加训练成本;未来的工作可以采用更新的 TTT 训练技术,例如 TNT(42)。其次,虽然我们开发了一种将 TTT 集成到机器人基础模型中的原则性方法,但未来的工作可能会为 TTT 层探索面向机器人的目标(正如在视觉领域中所探索的(24))。最后,尽管 RoboTTT 显著提升了任务性能,但它并不能处理部署中遇到的所有失败模式;将其与强化学习结合以直接优化任务成功率是一个自然的下一步。

RoboTTT | arxiv 2026.7.16 | Paper Reading

https://fanchenlex.github.io/reandings/RoboTTT/

Author

Wenzhuo Li

Posted on

2026-08-11

Updated on

2026-08-12

Licensed under

WeChatQQGoogle ScholarWeeklyLogRSS