$\pi_{0.7}$ | arxiv 2026.04.16 | Paper Reading
作者提出一种名为
的新型机器人基础模型,该模型能够在广泛场景中实现强大的开箱即用性能。
能够在未见过的环境中遵循多样化语言指令,包括使用各类厨房电器完成多阶段任务;实现零样本跨具身泛化,例如使机器人在未见过任务的情况下完成叠衣服;并能执行如操作意式咖啡机等高难度任务,其开箱性能可媲美经过专门强化学习微调的模型。
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | VLA | data diversity | 2026-04-16 |
1.What?
2.Why?
在机器人领域,仅用更详细的文本描述数据是不够的——决定任务成功与熟练度的细节可能更为微妙(例如关于任务片段整体质量的信息),或难以仅用语言表达(例如衬衫整齐折叠后的特定外观)。因此,作者除了使用更详细的文本,模型还在提示中添加了一系列额外元数据,包括任务片段质量信息(策略元数据)、机器人使用的控制模态以及子目标图像。这些信息在测试时可选择性地提供或省略,但在训练中包含它们能使模型更有效地组合所学概念,并展现出多种涌现能力。
机器人 foundation model 的核心难点,是要在大规模、异构、混合质量的数据上学到可泛化的控制策略。现实机器人数据往往混着不同操作者策略、不同轨迹质量、失败片段、以及 autonomous rollout。如果直接把这些数据统一训练,模型很容易把本来不同的行为 mode 平均掉,最后学成一个“折中但不够好”的策略,既不够稳,也不够强。
3.How?

A. 子任务指令
在提示中还加入了捕捉下一个语义子任务的中间、高层级文本。我们将此中间文本记为lˆt(例如“打开冰箱门”)
B. 子目标图像
子目标图像由一个轻量级世界模型生成,该模型接收与主模型相同的子任务指令lˆt,但受益于在视频和图像编辑任务上的网络规模预训练,因此能够泛化到多样化的任务和场景。
C. 回合元数据
每一条元数据包括:
- 整体速度:回合的时间步长度。我们将数值在500步的区间内离散化,例如,1750到2250之间的值被归入“2000步”。通常更快的速度也对应更高的质量,例如,回合中的错误更少。
- 整体质量:任务执行质量,表示为1到5之间的分数,5为最高质量。
- 错误:指示机器人在给定动作片段内是否出错的标签(例如,未能抓取物体或执行了错误的子任务)。这些标签由人工对我们的数据进行粗略标注提供。
D. 控制模式
同时包含关节层面和末端执行器层面的动作
E. 完整提示与训练细节
<多视角观测><多视角子目标> 任务:给蔬菜削皮。子任务:拿起削皮器。速度:8000。质量:5。错误:否。控制模式:关节。<本体感知>
训练数据集
π0.7的训练数据集包含:多种机器人平台(静态与移动式、单臂与双臂)在多样环境(实验室式模拟环境、家居环境及真实家庭环境)中执行广泛任务的示教数据;大量策略评估产生的自主数据;策略部署过程中的人工干预数据;开源机器人数据集;人类第一视角视频数据;以及来自网络的辅助非机器人数据源,包括物体定位与属性预测、视觉问答和纯文本数据预测。我们还涵盖了视频-语言任务,包括内部机器人数据及网络视频的字幕生成。与传统视觉语言动作(VLA)训练流程显著不同的是,我们在训练中大量使用了次优机器人数据。这既包含质量较低的演示数据(失败片段或存在大量错误动作的成功片段),也包含早期模型版本在模型评估实验¹中收集的数据。例如,我们使用
模型架构
π0.7模型相较于前代π0.5和π0.6模型的主要架构改进包括:采用MEM[37]的历史视觉编码器,并在上下文中引入视觉子目标图像。**模型接收最多四个相机图像(前视、两个腕部视角及可选的后视视角),每个视角最多包含六帧历史图像,以及最多三帧子目标图像(不含后视视角)。**历史帧通过视觉编码器处理并压缩至与单帧相同的令牌数;子目标图像经由同一编码器处理。相机观测与子目标图像首先被缩放至448×448像素。历史帧采样采用1秒步长,全部历史帧整体以0.3概率被丢弃,后视图像(若存在)同样以0.3概率被丢弃。
我们采用块因果掩码方案:**观测令牌与子目标图像令牌内部使用双向注意力,且目标图像令牌可额外关注观测令牌。**后续文本令牌采用因果注意力机制(注意力掩码可视化见附录)。我们还将机器人的本体感知状态qt(含历史状态)输入模型主干。不同于π0.6使用离散化文本令牌表示qt,π0.7遵循MEM方法,通过线性投影将状态维度映射至主干维度进行嵌入。每个历史状态作为独立令牌处理;若历史帧被丢弃,对应状态令牌亦被掩蔽。
更轻量化的“动作专家”是一个拥有8.6亿参数的Transformer,通过流匹配目标训练以预测连续动作。我们采用自适应RMSNorm注入时间步信息以支持流匹配。动作专家处理的动作令牌固定为50个,代表50步的动作块。这50个令牌相互双向关注,并可关注VLM主干激活值。π0.7还采用训练时版本的实时动作分块(RTC)[107,108]技术,在存在推理延迟的情况下生成平滑动作轨迹。训练时我们模拟0到12个时间步的延迟,对应50Hz机器人最高240毫秒的推理延迟。

子目标图像训练
在训练π0.7处理子目标图像时,需要使模型适应不同延迟和图像质量的子目标,包括由世界模型生成的图像。这要求训练时精心选择哪些子目标作为上下文提供给模型。我们采用真实图像与生成图像混合训练:从训练轨迹的未来时间步采样真实图像时,采用以下有效采样方案——以0.25概率采样片段结束图像(与世界模型预测目标一致),以0.75概率从当前时间步之后0-4秒内均匀采样未来图像。除真实图像外,为缓解真实图像与生成图像间的训练-测试偏差,我们还从世界模型中采样大量子目标图像,构建额外训练样本——将这些生成图像(而非真实未来图像)加入π0.7的上下文进行训练。
4.Takeaways:
π0.7的核心是一种受提示扩展启发的多样化提示策略,该策略在训练过程中(并可选择在测试阶段)向模型提供任务片段的附加信息。这些附加信息包括更精细的语言描述、片段元数据及子目标图像。实验表明,通过采用多样化提示策略并结合规模更大、多样性更强的数据集,π0.7能够表征多种不同质量的行为策略,并将专家级性能蒸馏回单一预训练模型中。
把 heterogeneous data 的歧义显式写进 context。也就是说,除了 task instruction 之外,再给模型“怎么做”条件,包括 subtask instruction、描述近未来目标状态的 subgoal image、表示轨迹速度/质量/是否犯错的 episode metadata,以及 control mode。这样,高质量轨迹、低质量轨迹、失败片段和不同策略,就不再是互相冲突的监督信号,而是被 condition 过的不同 mode。
局限性&未来工作:
虽然π0.7具有广泛泛化能力,但零样本泛化的成功率(不出所料)低于分布内任务:已见任务成功率常超过90%,而未见任务或未见任务-机器人组合的成功率在60-80%区间。
使用如此庞大而多样的数据集进行训练时,很难明确判定哪些任务是真正“已见”或“未见”的:虽然部分泛化实验(如第九节D部分)使用了我们未专门收集数据的任务,但数据集包含的丰富场景与行为可能导致相关技能实际上以不同标签或执行其他任务时的附带形式存在于数据中。
未来研究的一个激动人心的方向是利用π0.7的高可操控性,在测试任务中高效从数据中学习,例如通过更精细的语言指导甚至自主强化学习。
$\pi_{0.7}$ | arxiv 2026.04.16 | Paper Reading









