VISTA | arxiv 2026.02.12 | Paper Reading

VISTA | arxiv 2026.02.12 | Paper Reading

Scaling World Model for Hierarchical Manipulation Policies

VISTA的作者声称他们是和 π0.7 的思路一样并且比他们早2个月提出 的工作,同样用了一个世界模型去基于新颖场景生成多视角且物理一致性的子任务序列,并在每一步提供文本子任务描述与视觉目标图像

工作类型(首次/改进) 技术路线 创新点 日期
改进 VLA data diversity 2026-02-12

1.What?

提出了一种分层式视觉-语言-动作框架VISTA,该框架利用大规模预训练世界模型的泛化能力,实现鲁棒且可泛化的视觉子目标任务分解(VISTA)。我们的分层框架VISTA由作为高层规划器的世界模型和作为低层执行器的VLA构成。高层世界模型首先将操作任务分解为带目标图像的子任务序列,低层策略则遵循文本与视觉指引生成动作序列。相较于原始文本目标描述,这些合成的目标图像为低层策略提供了视觉与物理层面的细节依据,使其能够泛化至未见物体及新场景。

2.Why?

预训练视觉-语言模型(VLM)与VLA模型在数据结构上的根本性不匹配。VLM基于成对的图像-文本数据进行训练,以建模离散化的语言分布;而VLA则是在单一指令下,由数百个图像-动作对构成的长序列机器人轨迹上进行训练,学习目标是连续的动作回归。因此,VLA缺乏VLM的零样本泛化能力,需要大量真实世界数据才能实现鲁棒性能。

语言子目标在语义上泛化良好但缺乏具体的空间与物理约束,而密集视频预测能提供更丰富的细节,却在长时程上受困于时间漂移和物理不一致性。如何利用基础模型的泛化能力,将操作任务抽象为一种既能提升鲁棒性又能提高数据效率的中间表征?这个问题就是作者要解决的问题

3.How?

Architecture overview of VISTA
VISTA框架概览。该框架包含两个核心模块:左侧:VISTA作为高层规划器,通过将视觉目标与文本子任务视为统一的多模态序列,在全局指令和初始观察的条件下,自回归地生成交错的文本子任务与视觉目标。右侧:GoalVLA作为底层控制器,以实时观察和生成的子目标为输入,预测可执行的动作组块。执行过程采用分层管理,其中子任务切换器在当前阶段完成后即过渡至下一阶段

针对每项操作任务,我们将其划分为多个阶段,每个阶段包含一个原子技能及对应的目标物体或位置。世界模型会生成文本与图像交织的序列,作为各子任务阶段的指令与目标图像;随后,目标条件视觉语言动作模型将判断当前阶段,并以当前观测、当前阶段的子任务指令及目标图像为输入,预测当前动作片段。 最后,讲一下用于训练这两个模块的数据集。

世界模型构建:我们采用统一的离散表示方法,将视觉与语言映射至共享词表V。图像使用IBQTokenizer[38]进行分词,文本使用Qwen3分词器[1],两者共同构成分词函数φ。多视角图像按固定顺序展平后,与文本一同转换为离散词元序列S

推理阶段通过迭代采样自回归生成里程碑序列。从初始上下文(φ(I0), φ(L))出发,模型使用束搜索依次预测后续子任务与目标图像的词元。具体而言,我们维护B个候选序列集合(B为束宽)。在每一步j,给定当前词元历史S<j = (u1, …, uj-1),计算输出逻辑值并将每个候选序列扩展为概率最高的B个下一词元

采样过程持续至所有候选序列均生成终止词元。随后选择整体概率最高的序列,并利用逆分词器φ−1在像素级重建目标图像gi。该方法能基于初始输入生成全局连贯的里程碑序列,有效规避贪婪解码可能导致的次优词元级决策。我们在开源EMU3.5检查点基础上进行持续训练,该检查点已在包含导航与操作的文本-图像交织数据上经过2000步训练。

目标条件视觉语言动作模型构建:在阶段i的每个时间步t,策略以当前观测It、子任务指令li及对应目标图像gi为输入,预测驱动机器人朝向里程碑的动作片段a ∈ Ak。为有效融合视觉信息,我们在将数据输入模型主干前,将当前观测词元与目标图像词元进行拼接。遵循π0[6]的架构,我们采用流匹配目标训练策略以生成连续动作轨迹。定义噪声样本z ∼ N(0, I)与真实动作片段a之间的线性插值为xτ = (1 − τ)z + τa,其中τ ∈ [0, 1]表示流时间。策略预测以(li, It, gi)为条件的对应速度场vτ = a − z。目标是最小化期望均方误差

子任务感知动作填充:动作片段可能跨越子任务边界(即包含属于阶段i+1的步骤)。为防止策略在未获得更新目标时若提前执行下一阶段,我们将对当前里程碑完成后出现的每个真实数据块部分进行零填充,明确教导策略在目标gi满足后立即停止。

随机目标图像偏移:世界模型预测的目标图像可能相对于真实子任务终止时刻存在数帧的提前或滞后,这可能导致阶段边界附近的执行不稳定。为使GoalVLA对此类错位具有鲁棒性,我们在子任务i与i+1的边界处定义了时间重叠窗口。对于该窗口内的训练样本,我们随机选用gi或gi+1作为目标条件;当选用gi+1时,我们同时将样本重新标注为阶段i+1以避免零填充。对于阶段i其余部分的样本,我们从终止重叠窗口中随机采样gi,而非使用固定目标帧。这种简单的数据增强使策略能够接触边界噪声,并促进平滑的阶段过渡。

数据集构建

a) 数据来源:我们使用来自OpenX-Embodiment [36]、AgiBot World Beta [9] 及我们的Mobile Aloha数据集 [21] 的大规模具身操作数据训练世界模型。尽管语料库超过100万条轨迹,但其标注仅包含全局指令和图像-动作对,缺乏中间里程碑(li, gi)。因此我们引入了自动化轨迹分解流程。

b) 自动里程碑标注:该流程包含三个步骤**。首先,通过Qwen3 [46] 对指令动词进行聚类,构建包含50种原子技能(如抓取、推动)的技能库。其次,利用Ramer–Douglas–Peucker算法 [17] 分析运动轨迹与夹爪状态变化,通过物理状态变化检测候选里程碑边界。最后,Qwen2.5-VL 72B [2] 合并具有相同技能的相邻片段,并生成自然语言子任务描述li。**该流程将120万条轨迹转换为交错排列的子任务与目标图像序列,覆盖14种具身形态并支持多视角,总计产生152亿令牌(图3)。对于AgiBot数据,我们进一步将抽象任务类型细化为精细化指令。

c) 任意到图像预训练数据:我们使用一个由SEED-Data-Edit [22]、WeatherStream [53]、ShareGPT-4o-Image [11]等构建的15B词元任意到图像数据集与世界模型进行协同训练。

4.Takeaways:

对稳定的视觉子目标进行推理,而非仅仅依赖脆弱的文本子任务或密集且易出错的轨迹预测,可以实现鲁棒的泛化

仅预测关键帧使得在大规模视频数据集上进行可扩展训练成为可能,通过状态不变性减轻幻觉问题,并提供仅靠语言无法传达的显式空间约束

局限性&未来工作:

目前的真实世界评估仍局限于抓放任务。将验证扩展到更多样化、更长视程的操作场景是未来工作的重要方向。

生成的视觉子目标可能相对真实子任务终点存在轻微空间偏差;尽管不常见,但较大偏差可能导致GoalVLA执行失败。

最后,虽然视觉目标能跨 embodiment 传递有用的交互先验,成功执行仍依赖于真实机器人训练数据中是否存在对应的交互模式。因此,在GoalVLA微调阶段增加技能与任务的多样性对于进一步提升鲁棒性与泛化能力至关重要。

VISTA | arxiv 2026.02.12 | Paper Reading

https://fanchenlex.github.io/reandings/VISTA/

Author

Wenzhuo Li

Posted on

2026-04-22

Updated on

2026-04-29

Licensed under

WeChatQQGoogle ScholarWeeklyLogRSS