RoboDojo | arxiv 2026.7.5 | Paper Reading
RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
作者提出了一个面向通用型机器人操控策略综合评估的仿真与真实世界统一基准
| 工作类型(首次/改进) | 技术路线 | 创新点 | 日期 |
|---|---|---|---|
| 改进 | benchmark | memory | 2026-05-11 |
1.What?
• 本文构建本文提出开发了一套用于机器人操作策略的统一仿真与真实世界评估系统,采用共享策略接口和仿真与实物测试间一致的评估流程。该系统通过异构并行仿真支持高效反馈,并通过 RoboDojo-RealEval 支持标准化、可复现且远程的实物评估。
• 作者构建了 RoboDojo 基准,包含 42 个仿真任务与 18 个真实世界任务。仿真任务覆盖五个能力维度:泛化、记忆、长时段、精度及开放;真实世界任务涵盖三种机器人本体,并在具有挑战性的物理部署条件下评估策略。
• 作者构建了 XPolicyLab,一个用于策略开发与部署的标准化基础设施。XPolicyLab 将 30 个机器人操作模型集成至共享框架,使策略仅需最小化的策略侧适配便可在 RoboDojo 基准上进行开发、部署与评估。
• 作者在 RoboDojo 上对现有机器人操作策略进行了广泛评估。基于这些结果,我们建立了公开排行榜,并提供了当前策略在仿真与真实世界设置中局限性的系统性分析,指明了未来通用型操作策略的关键方向。
2.Why?
作者认为许多基准依赖于相对简单或短时范围的任务,且任务变体主要通过改变物体、布局或语言表达引入。虽然此类变体有助于衡量分布鲁棒性,但往往保留相似的基础操作模式,限制了针对泛化、记忆、精度、开放语义理解、序列执行、双臂协调及工具使用等不同挑战的诊断覆盖范围。另一关键局限在于仿真与真实世界评估的分离。基于仿真的基准高效且可扩展,适用于快速反馈与模型迭代;然而,它们无法充分捕捉部署过程中出现的富含接触的动力学、执行误差、感知噪声及其他物理因素。真实世界评估能在物理条件下更直接地评估策略行为,但成本高昂、耗时,且因缺乏标准化的硬件设置、场景重置流程、评估协议及部署接口而难以复现。
3.How?
作者首先构建了RoboDojo基准测试,用于评估跨仿真和现实世界的通用机器人操作策略。RoboDojo包含42个仿真任务和18个现实世界任务。仿真基准测试支持高效的模型迭代和面向能力的诊断,涵盖五个维度:泛化、记忆、精度、长时程和开放性。这些维度捕捉了除物体、布局或语言指令变化之外不同的操作需求。现实世界基准测试通过在具有挑战性的物理部署条件下,使用标准化和可重复的协议评估策略,对仿真进行了补充。RoboDojo共同提供了一个广泛的评估套件,用于系统地诊断当前具身操作策略的局限性。
泛化。鲁棒的部署要求策略能够在不同环境中完成同一任务,而非依赖固定场景或熟悉的视觉背景。泛化维度包括12个任务,评估对背景、光照、杂乱度和目标物体的未见变化的鲁棒性。与RoboTwin 2.0 (Chen et al., 2025a)相比,RoboDojo引入了更强的场景随机化和更密集的桌面杂乱度。RoboTwin 2.0最多包含10个杂乱物体,而RoboDojo随机化多达25个杂乱物体,显著增加了视觉干扰和场景复杂度。为进一步减少对默认木桌场景的过拟合,我们提供了100条额外的DLC轨迹进行数据级增强。这些轨迹收集自随机背景、光照和杂乱布局下的简单抓取放置行为。由于它们独立于评估任务,它们在不直接泄露特定任务解决方案的情况下提高了视觉暴露度。
记忆。许多操作任务具有部分可观测性,正确的行动依赖于更早观察到的信息,而非仅当前帧。受RMBench (Chen et al., 2026b)启发,记忆维度包括6个任务,评估长上下文观测建模、关键帧记忆和非马尔可夫决策。这些任务涵盖了短历史设置(几条关键观测足以完成任务)以及需要基于多帧时间序列进行推理的更长交互设置。例如,在match_and_pick_from_conveyor中,策略必须记住在传送带上消失的物体类别,并在后续候选物体中拾取匹配物体。在imitate_sorting_sequence中,策略观察另一机械臂以特定顺序将物体放入篮子中,必须记住并复现演示的顺序。这些设置对仅依赖当前观测或固定长度短历史的策略提出了挑战。
长时程。实际操作通常需要在达到最终目标前执行一系列依赖步骤。长时程维度包括8个任务,评估策略是否能推断任务结构、保持进度并在不提前终止或累积错误的情况下完成所有必需的子步骤。例如,classify_objects需要机器人将多个物体分类放置至对应目标位置。由于工作空间相对较大,任务可能要求双臂间进行交接动作,导致执行时长增加与时间维度复杂度上升。
精度。精细操作需要准确视觉定位、平滑运动预测及稳定局部控制,因为微小空间误差可能导致任务失败。该维度包含8项对空间与运动精度要求严格的任务,聚焦于精细化目标定位、轨迹平滑度及高接触控制稳定性。例如在insert_tubes任务中,策略需持续将导管插入窄孔。任何定位或轨迹误差均可能阻碍成功插入,使得该维度对动作精度与运动稳定性尤为敏感。
开放。通用型机器人策略应理解多样化的任务规范,并将已习得的技能迁移至新目标。开放维度包含8项任务,用于评估未见过的任务规范,其所需技能在训练数据中曾于不同情境下出现。这些任务测试开放语义基础、技能重组以及语言条件迁移。例如,general_pickup任务需要物体抓取,该技能在训练中频繁出现,但具体的抓取目标并未直接包含在训练任务中。该维度检验策略能否重组已习得的操作技能,并理解新的语言指令以解决之前未见过的任务。


为评估策略在实际物理部署条件下的性能,我们构建了RoboDojo真实世界基准。该基准包含18项真机任务,涉及三种常用协作双臂机器人平台:ARX X5、Piper和Piper X。这种多具身设计旨在评估策略是否能在不同机器人运动学、工作空间、摄像头布局及数据分布下保持可靠性能,而非仅适用于单一平台。
与支持快速反馈和面向能力诊断的仿真任务不同,真实世界基准将策略暴露于仿真难以完全复现的部署挑战中,包括接触丰富的交互、感知噪声、执行误差、工作空间约束及时间变化。如第4.2节所述,我们开源了RoboDojo-RealEval的硬件设置与评估规范,以支持可复现的部署。RoboDojo-RealEval标准化了硬件配置、工作空间布局、光照条件、场景重置流程、评估协议及部署接口,使策略能在一致的物理条件下接受测试。我们还提供基于云的远程评估服务,允许用户提交策略并在共享物理测试配置下进行评估。详细任务信息见附录J及项目文档
4.Takeaways:
通过实验作者有了很多关键发现:
仿真:
发现1:RoboDojo揭示了通向均衡通用机器人操作的重大差距。表1总结了当前通用机器人操作策略在RoboDojo仿真基准上的性能。在评估的策略中,Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA、Xiaomi-Robotics-0、X-WAM、GigaWorld-Policy和StarVLA-α构成了当前平均性能的领先梯队。然而,它们的结果仍聚集在低分区域。即使是最优策略,在相同评估协议下,平均成功率仅为8.80%,平均得分为13.07,远低于人类专家76.03%的成功率和80.42的得分。这一差距表明,尽管这些任务对人类操作员而言是可行的,但当前的策略在多样化操作场景中仍远未实现可靠的任务完成。 除了整体差距,RoboDojo进一步揭示当前策略在各维度的能力发展上缺乏平衡。不同方法在不同领域表现出相对优势:Spatial Forcing在泛化性方面表现突出,X-VLA在精确性上领先,π0.5在开放性任务中具有竞争力,而Hy-Embodied-0.5-VLA在长时域、记忆和综合性能上取得最佳结果。然而,这些优势仍局限于特定维度,且无法在整个基准测试中持续迁移。当前策略在泛化性和长时域任务上表现相对较好,表明在视觉定位、目标定位和多步骤执行方面取得了部分进展。但这一优势仅为相对而言:即便在这些较强维度上,最高成功率仍低于15%。精确性、记忆和开放性任务持续暴露更严重的瓶颈:细粒度控制、稳定场景理解以及开放式任务执行。这些结果显示,RoboDojo能够提供超越单一聚合成功率的诊断信号,揭示出各项能力发展的碎片化进展,以及通往均衡通用机器人操作所存在的显著鸿沟。

发现2:场景级随机化导致性能整体崩溃,而视觉-空间定位仅能部分提升鲁棒性。RoboDojo中的泛化维度评估了策略在视觉和场景级分布偏移下的鲁棒性,包括物体实例、布局、杂乱程度、光照和视觉背景的变化。如表1所示,Spatial Forcing在该维度上取得了最强的整体性能,成功率为9.33%,得分为14.12。

表3中的Standard–Random对比进一步表明,困难并非来自少数孤立的难例;相反,场景随机化导致几乎所有策略的性能全面崩溃。一个关键观察是,在Standard设定下的强性能并不一定能迁移到随机化场景中。在表现较好的方法中,Hy-Embodied-0.5-VLA获得了最高的Standard得分21.98,但在Random设定下下降至1.57,对应92.9%的相对降幅。相比之下,Spatial Forcing在其π0.5基模型基础上,在绝对Random得分(6.98对比5.82)和相对得分保留率上均有所提升,将降幅从72.2%降低至67.2%。这表明,显式的3D空间定位和空间表征对齐可以增强对场景级变化的鲁棒性,尤其是在物体姿态、空间布局和视觉背景发生变化时。然而,这种改进在绝对数值上仍然有限。即使最强的Random得分也仅为6.98,且大多数有竞争力的策略在随机化后丧失了其在Standard设定下的绝大部分性能。这表明当前的通配操作策略仍然对视觉和空间分布偏移高度敏感。重要的是,这种失败并不仅仅是高层识别问题:即使策略能够识别与任务相关的物体或目标,分布偏移仍可能退化度量定位、动作定位、轨迹生成以及从非标称状态恢复的能力。因此,视觉-空间定位有助于场景级泛化,但在随机化场景下实现可靠的操作还需稳定的低层控制、鲁棒的闭环校正以及面向恢复的策略行为。
发现 3:当前策略在结构化长程任务上取得了部分进展,但可靠的技能组合仍然困难。长程 (Long-Horizon) 是 RoboDojo 中领先策略相对较强的维度之一。Hy-Embodied0.5-VLA 取得了最佳性能,成功率为 14.92%,得分为 25.74,紧随其后的是 π0.5(成功率 14.67%,得分 23.54)和 Spatial Forcing(成功率 14.58%,得分 23.26)。与精确性 (Precision)、记忆 (Memory) 和开放式 (Open) 任务相比,这些结果表明当前策略在具有清晰中间目标和视觉基础子步骤的结构化多步工作流上能取得更多进展。然而,即使是最佳策略,其在长程任务情节中的成功率也低于 15%,这表明长程操控仍然远未达到可靠。得分与成功率之间的差距表明,许多策略能够完成部分阶段,但未能持续达成最终目标。这反映了长程操控中的一个核心挑战:单个技能无法自动组合成稳健的多步行为。策略必须维持任务进度、选择合适的子任务、在正确时机切换阶段,并从中间错误中恢复。微小的执行错误会在长序列中累积,导致即使早期步骤部分成功,后续阶段也可能失败。领先结果进一步表明,更强的动作先验、具身预训练和空间基础 (Spatial Grounding) 有助于长程执行。Hy-Embodied-0.5-VLA 可能受益于大规模具身预训练和时间结构化的动作预测,而 Spatial Forcing 和 π0.5 则表明了空间基础 (Spatial Grounding) 和强基策略训练的价值。然而,这些优势仍然有限。总体而言,当前策略在结构化长程执行方面取得了部分进展,但仍缺乏可靠的技能组合、阶段级决策和错误恢复能力。
发现 4:由于缺乏接触感知控制与弱的离轨修正能力,精确性仍是主要瓶颈。精确性维度暴露了一种不同于泛化 (Generalization) 和长程 (Long-Horizon) 任务的特殊失败模式。策略不仅要识别任务相关物体和目标位姿,还需在严格容差下生成空间精确、时间平滑且对接触敏感的动作。如表 1 所示,X-VLA 取得了最佳精确性性能,成功率为 12.00%,得分为 18.32,其次是 Spatial Forcing(成功率 10.58%,得分 17.33)和 Hy-Embodied-0.5-VLA(成功率 8.00%,得分 13.81)。然而,即使是最强的模型,距离可靠的精确操控仍然相去甚远。精确性排名与总体排行榜存在差异:Hy-Embodied-0.5-VLA 获得了最佳平均性能,但在精确性任务上被 X-VLA 和 Spatial Forcing 超越。这表明更强的全局任务执行能力并不会自动带来精确的局部控制。精确性任务要求度量空间推理、细粒度运动生成和稳定的接触过渡。尽管更强的空间基础 (Spatial Grounding) 或动作对齐可能提供相对优势,但当前策略仍缺乏足够稳健的 3D 定位、平滑动作预测和闭环接触控制。我们的测试展开进一步表明,许多精确性失败源于弱的状态条件修正,而非任务误解。例如,在 insert_key 任务中,在未能传递或对齐钥匙后,许多策略仍继续执行后续的插入动作,表明它们常常遵循开环动作序列,而未验证当前状态是否满足下一阶段的先决条件。我们还在多个策略的末端执行器和关节空间控制接口中观察到动作抖动,表明这种不稳定性并非特定于某种动作表示,更可能与动作预测的时间平滑度不足有关。这些结果表明,可靠的精确操控需要更平滑的低层动作先验、接触感知反馈以及用于从离轨状态恢复的面向修正的训练信号。
发现 5:记忆机制有所帮助,但记忆条件执行仍是瓶颈。记忆维度表明,基于历史或记忆条件化 (Memory-Conditioned) 的设计可以提升性能,但仍然远不可靠。Hy-Embodied-0.5-VLA 取得了最佳结果,成功率为 12.11%,得分为 13.37,而 EventVLA 也受益于其基于 KEM 的记忆设计,达到了 4.78% 的成功率和 4.92 的得分。然而,这些模型之间的差距表明,单独显式的记忆结构是不够的。EventVLA 更显式地存储稀疏的长程证据,但我们的测试展开表明,许多失败源于下游操控错误或不正确的子任务执行,而非记忆线索的完全缺失。相比之下,Hy-Embodied-0.5-VLA 可能受益于更强的具身预训练和动作先验,这有助于将历史上下文转化为可执行行为。这些结果表明,关键挑战不仅在于记住过去的观测,还在于利用记忆来指导基于状态的决策和稳健的动作执行。世界模型风格预测提供了另一种形式的隐式时间记忆。X-WAM 在记忆任务上实现了 4.67% 的成功率和 6.32 的得分,成功率略低于 EventVLA 但得分更高。这表明预测性预训练有助于编码时间连续性、物体持久性和任务进度,从而带来更强的部分完成能力。然而,预测模型并不一定能在稀疏证据从当前观测中消失后保存或检索它。它们有限的最终成功率表明,仅凭时间预测不足以完成需要可靠稀疏证据回忆和记忆条件控制的任务。总体而言,RoboDojo 建议未来策略应结合预测性时间建模、显式记忆监督以及直接将执行条件化于被记住证据上的动作学习。
发现 6:开放语义操控仍未得到根本解决。开放 (Open) 维度是 RoboDojo 中最具挑战性的部分。当前策略在此维度上性能接近于零,即使最佳模型 π0.5 也仅达到 1.67% 的成功率和 1.98 的得分。这一结果揭示了当前通用操控策略的一个关键局限性:它们对于需要超出闭集演示进行语义解释的语言指令的任务,准备不足。而在真实世界场景中,用户可能指定新颖的目标、根据功能或意图引用物体,或者期望机器人以不熟悉的方式重新组合已学技能。与闭集模仿任务不同,开放式任务不能通过简单地将熟悉指令与记忆动作模式进行匹配来解决。这些结果表明,当前策略仍然缺乏从语义到动作 (Semantic-to-Action) 的稳健基础。虽然强大的视觉-语言骨干网络能提升高层次的感知和语言理解,但它们往往难以将开放式指令、视觉可供性 (Affordances) 和可执行的操控动作对齐。特别是,策略必须推断任务意图、识别相关物体或功能关系、选择合适的技能并在物理约束下执行它们。近乎为零的开放式性能得分凸显了这一点。这突显了在指令理解、语义推理和灵活动作合成方面进行更深入研究的紧迫需求,使具身智能体能够真正泛化到部署过程中遇到的多样化开放式语言目标。
真实世界:
发现1:现实世界部署仍不可靠,局部进展很少转化为任务完成。 表2显示,对于当前的通才操控策略,RoboDojo-RealEval仍具有极高挑战性。表现最佳的策略π0.5在18项现实任务中仅达成12.8%的整体成功率和22.9的分数,而人类遥操作在全部任务和具身上实现了100.0%的成功率和100.0的分数。这一差距表明,在标准化协议下任务具有可行性,但当前策略远未达到可靠的物理部署水平。

与成功率相比,更高的分数也表明当前策略通常能取得局部进展,但无法完成完整任务。例如,π0.5、InternVLA-A1和GalaxeaVLA分别获得了22.9、12.0和9.0的分数,但它们的成功率仅分别为12.8%、7.2%和4.4%。这表明现实世界的失败不仅由任务理解错误驱动,还取决于执行瓶颈,例如精准对齐、接触处理、子步骤过渡以及从中期错误中恢复。因此,可靠的现实世界操控需要闭环执行,以在物理不确定性下将局部进展转化为最终任务成功。
发现2:仿真性能与现实世界可部署性仅部分一致。 由于RoboDojo-RealEval目前评估仿真排行榜的一个子集,我们重点关注在两种设置中均被评估的策略。在这些重叠策略中,两个排行榜显示出部分但不完全的一致性。π0.5仍是RoboDojo-RealEval中最强的策略,同时也是仿真中的领先方法之一,这表明仿真性能捕捉了通才操控能力的重要方面。然而,几种策略的相对排序发生了变化:InternVLAA1和GalaxeaVLA在现实世界中的排名优于其在仿真中的排序,而一些在仿真中具有竞争力性能的策略在物理部署后并未保持同等优势。
这种错位需要谨慎解读。RoboDojo并非设计为具有一对一的仿真与现实任务匹配的成对sim-to-real迁移基准。相反,两种设置强调了通才操控策略的互补方面。仿真提供了跨泛化性、精度、长程执行、记忆和开放语义基础的规模化能力诊断,而RoboDojo-RealEval则衡量策略在物理部署约束下是否仍可执行且可靠。
现实世界评估引入了难以在仿真中完全捕捉的因素,包括感知噪声、相机和机器人标定误差、执行延迟、控制器特有的动力学、接触不稳定性和累积执行漂移。这些因素可能导致仿真性能强劲的策略因动作抖动、标定不佳、接触感知不足或无法从小偏差中恢复而失败。因此,部分一致性支持了RoboDojo的“仿真与现实结合”设计:仿真实现了高效的规模化能力分析,而现实世界评估则暴露了无法从仿真中推断的部署特有瓶颈。
发现3:现实世界评估揭示了超越总体成功指标的执行不稳定性和安全关键行为。 现实世界评估揭示了总体成功率或仿真分数无法完全捕捉的部署特有故障模式。在多个策略中,我们观察到动作抖动、振荡运动、重复无效动作、接触不稳定以及偶发的安全关键行为。这些故障表明物理部署不仅取决于高层任务理解,还依赖于低层动作执行的时间稳定性和安全性。
例如,DM0在部署中频繁产生不稳定的控制信号,导致需要密切监控或安全干预的失控运动。这一区分很重要:在仿真中,不稳定动作可能仅降低任务分数,而在物理机器人上,它们可能引发硬件风险、非安全接触或与环境的不期望交互。因此,仅凭最终任务成功不足以表征现实世界部署质量。
这些观察表明,未来的通才操控策略应优化超越任务完成的面向部署的属性,包括动作平滑度、接触感知反馈、有界控制行为以及从脱离轨迹状态恢复。因此,RoboDojo-RealEval通过揭示策略是否不仅在原则上具有能力,而且在物理执行中足够稳定和安全,提供了互补的诊断价值。
局限性&未来工作:
RoboDojo 被设计为一个可扩展的基准测试平台,而非固定的任务集合。在未来的版本中,我们将持续扩展 RoboDojo,覆盖更广泛的场景、具身形态与评估设置。如图 8 所示,我们计划引入更大规模的基准测试,涵盖灵巧手操作、人形机器人全身操作、触觉操作以及移动操作。针对每一个方向,RoboDojo 将支持多种机器人具身形态,以提升可及性并实现不同硬件平台间的公平比较。通过逐步扩展任务集、具身形态覆盖范围及感知模态,RoboDojo 旨在发展成为一个面向具身操作的通用评估平台。

RoboDojo | arxiv 2026.7.5 | Paper Reading









