25年9月来自Galaxea 的技术报告论文“Galaxea Open-World Dataset and G0 Dual-System VLA Model”。

Galaxea 开放-世界数据集,是一个在真实的人类生活和工作环境中记录的大规模、多样化的机器人行为集合。所有演示均使用一致的机器人具身而收集,并搭配精确的子任务级语言注释,以方便训练和评估。在此数据集的基础上,推出 G0,这是一个双-系统框架,将用于多模态规划的视觉-语言模型 (VLM) 与用于细粒度执行的视觉-语言-动作 (VLA) 模型相结合。G0 采用三阶段课程进行训练:跨具身预训练、单具身预训练和特定任务的后训练。全面的基准测试——涵盖桌面操作、小样本学习和长视野移动操作——证明方法的有效性。特别地,单具身预训练阶段与 Galaxea 开放-世界数据集相结合,在实现高性能方面发挥着关键作用。


视觉-语言-动作 (VLA) 模型已成为一种关键范式,旨在使机器人能够自主感知、推理并执行物理世界中的复杂任务。尽管取得了显著进展,但由于缺乏大规模、高质量的开放-世界机器人数据,仍然存在巨大的瓶颈。以 Open-X embodiment [1] 为例的现有数据集主要受限于其任务真实性有限和环境丰富度不足。这些限制削弱了训练模型在面对多样化现实世界情境时的泛化能力。

为了应对这一挑战,Galaxea 开放-世界数据集,是一个广泛且策划的开放-现实世界数据集,用于移动操作。Galaxea 开放世界数据集包含 500 小时的高保真数据,这些数据是在人类生活和工作的真实场景中系统地收集的,涵盖 50 个不同场景中的 150 多个不同任务。独特的是,Galaxea 开放世界数据集始终使用单一机器人具身进行采集,从而确保了一致性和可靠性。全面的数据过滤和精准的语言标注进一步丰富了数据集,有助于对移动操控方法进行基准测试。

作为数据集的补充,提出双-系统框架 G0。G0 利用系统 2(G0-VLM)进行广义多模态规划,并指导系统 1(G0-VLA)执行精确的动作执行。这两个模型以不同的频率异步运行,从而实现高效的训练和实际部署。重要的是,为 G0-VLA 提出一个三阶段训练课程:(1) 在大规模未标记数据集上进行跨具身预训练,以获取通用的世界知识先验;(2) 在 Galaxea 开放-世界数据集上进行单具身预训练,专注于目标平台上的感知-动作对;(3) 在高质量任务演示上进行后训练,以掌握特定的复杂技能。

最后,构建一个严格的基准测试,涵盖桌面操作、设备操作以及在常规和少样本学习环境下的长距离铺床等任务。实验表明,高质量的数据集和预训练策略能够有效提升双系统的性能。值得注意的是,当预训练平台与目标机器人之间存在较大的具身差距时,跨具身预训练的优势会削弱甚至降低 VLA 模型的性能,这凸显单具身预训练阶段的重要性。

Galaxea 开放-世界数据集是一个大规模、高质量且注释齐全的数据集,源自 Galaxea 的专有数据收集工作。它包含 10 万条演示轨迹,涵盖 150 个任务类别,在 50 个不同的真实场景中执行。这些演示涵盖 1600 多个独特物体和 58 种操作技能,涵盖从精细的拾取和放置到协调的全身操作。所有数据均采用一致的具身收集,确保感知、动作和语言注释在整个数据集中完全一致。

数据收集平台。所有演示均使用 Galaxea R1 Lite 平台(如图 a 所示)记录,这是一款专为在以人为中心的环境中操作而设计的移动式双手机器人。该机器人具有 23 自由度的具身,包括两个 6 自由度手臂、一个可进行垂直和俯仰运动以扩展工作空间的 3 自由度躯干,以及一个速度高达 1.5 米/秒的 6 自由度矢量驱动全向基座。球形手腕和平行夹持器可对日常物体进行稳健操控,有效载荷高达 5 公斤,作用范围达 60 厘米。立体 RGB 头部摄像头提供场景级感知,双英特尔 RealSense D405 RGB-D 腕部摄像头则可在操控过程中实现近距离精度。机器人紧凑的尺寸(高 1280 毫米,底盘宽 600 毫米,总宽 670 毫米)使其能够在狭窄空间内导航,同时保持操控能力。

请添加图片描述

为了确保运动自然可行,采用同构遥操作方案,将人类操作员的运动直接映射到机器人的运动学上。与 VR 遥操作相比,这种方法使手臂保持在可触及的姿势范围内,避免逆运动学故障,并且无需在人和机器人形态之间重新定位。

收集指南。数据收集遵循三个指导原则:(1) 可观察性——视觉流包含所有与任务相关的线索,操控过程中关键目标始终处于视野范围内; (2) 数据数量和质量——对于简单任务,大约 100 个执行良好的演示就足够了;对于更复杂的序列,数据收集在质量优先的试点阶段进行,然后再进行扩展;(3) 语言基础——每个演示都在子任务级别使用结构化语言描述进行注释,从而实现 VLA 模型训练的多模态对齐。

环境和目标多样性。数据集在 11 个物理站点收集,涵盖住宅、餐饮、零售和办公空间。每个站点提供多个操作区域,总共产生 50 个独特场景,如上图 b 所示。目标集来自现实世界的零售供应商,以确保逼真的视觉和物理属性。对于不安全或不便于重复操作的物品(例如食物),使用高保真复制品来保持视觉真实感,同时保持卫生和效率。

注释过程。每个数据片段被细分为原子子任务。注释遵循固定的模式,允许注释者选择标准化描述,而不是提供自由格式的文本,从而提高标记速度和一致性。每个片段都会在 episode 和片段级别经过严格的质量检查;不合格的数据(例如包含操作员错误或异常的 ROS 主题频率的数据)将被排除在训练集之外。

如图所示数据时域子任务标注的例子:

请添加图片描述

与现有数据集的比较。将 Galaxea Open-World 数据集与之前的大型机器人数据集(例如 BridgeData [28]、RT-1 [25]、Open-X-Embodiment [1] 和 AgiBot World [24])进行了比较。其数据集提供以下特性:(i) 在广泛的技能和环境中保持单具身一致性;(ii) 细粒度的子任务级注释,用于精确的多模态对齐;以及 (iii) 在现实世界中显著更高的场景多样性。这些特性使其成为研究可在非结构化人类环境中可靠运行的可泛化 VLA 模型的强大基准。

如图所示数据集统计特性:

请添加图片描述

如图所示数据集的任务统计特性:

请添加图片描述

如图所示具身行为的统计特性:

请添加图片描述

双-系统概述

如图所示,G0 双系统由快速响应系统 1 和深思熟虑系统 2 组成。系统 1 是一个 VLA 模型,负责感知环境、解释子任务指令并执行动作。它是一个端到端的视觉-语言-动作 (VLA) 模型,旨在控制具有移动躯干和底盘的双手机器人。在每个时间步 t,它会生成一个动作块 A_t = a_t:t+k,其中视界 k 取决于输入语言指令 l、来自三个摄像头的视觉观察结果 o_t 以及机器人的本体感受状态 s_t。G0-VLA 首先将机器人的视觉观察结果和语言指令嵌入到预先训练好的 VLM 中,然后使用流匹配动作专家根据 VLM 的 KV 缓存生成连续动作。同时,系统 2 作为 VLM 运行,处理高级自然语言任务指令,理解场景,并随后为系统 1 规划子任务指令。

请添加图片描述

针对这两个模型采用不同的训练方案。G0-VLM 使用来自 Galaxea 开放世界数据集的图像和子任务注释对进行训练。对于 G0-VLA 模型,引入一种三阶段训练策略,利用多样化的数据集逐步提升其性能和适应性。具体而言,预训练阶段 1,旨在从广泛多样的机器人数据中获取通用的先验模型,并将 Galaxea 专有的大规模未标记数据集与其他公开的机器人数据集相结合。随后,预训练阶段 2,会对该模型进行专门化,使其能够通过高质量数据中记录的各种物理交互来捕捉单个具身的配置、动力学和运动学。最后,后训练阶段3,使用少量高质量的演示数据对模型进行微调,使其能够掌握一组目标任务。

G0-VLA 预训练阶段 1

在阶段 1 的预训练中,仅训练 VLM 组件。为了使 VLM 的语言模型主干能够预测机器人动作,采用 FAST token 化器作为动作 token 化器,它将原始的连续动作块转换为离散索引序列。通过这种方式,可以使用标准交叉熵损失训练 VLM,使其以自回归方式预测下一个动作 token。具体而言,给定时间 t 的图像观测值 o_t、语言指令 l_t 和本体感受状态 s_t,训练策略以对动作 token 的条件分布进行建模。

VLM 由 PaLiGemma [29] 初始化,由一个 SigLIP 视觉编码器、一个单层 MLP 投影器和一个标准 Transformer 组成。视觉编码器和投影仪共同将三幅输入图像转换为一维的嵌入序列,然后通过 Transformer 中的注意机制,关注 token 化的语言指令、本体感受状态和先前预测的动作 token。

对于阶段 1 预训练中使用的数据,用多种机器人具身记录来训练 VLM。这包括约 1,000 小时的 OXE 轨迹记录、500 小时的 GalaXea 开放世界数据集(仅使用高级任务描述,不包括低级语言注释)以及 200 小时的内部数据(仅包含高级任务描述)。

此阶段仅训练 VLM 的动机可以从两个角度解释:(1) 训练数据来自不同的具身,注释的质量及其对应动作的准确性不一致。因此,动作专家无法从这些数据中学习到足够丰富的知识。 (2)如果在模型收敛生成稳定的表示之前应用扩散损失,可能会损害学习过程。

G0-VLA 预训练阶段 2

在此阶段,在已标注的 Galaxea 开放-世界数据集上训练 System-1 VLA。VLA 由预训练的 VLM 和新初始化的动作专家组成。动作专家根据本体感受状态和 VLM 生成的表征生成连续动作。具体而言,通过最大化流匹配损失函数的跟随目标来训练 VLA。预训练阶段 2 专注于提高动作精度和语言基础能力,这得益于 Galaxea 开放-世界数据集的两个关键特性:1) 单一具身:所有轨迹均收集在单个机器人平台上,确保动作空间的一致性,并消除动作专家在不同具身之间进行调整的需要。2) 语言-动作对齐:指令和轨迹在子任务级别进行分段,生成细粒度的语言-动作对。这有助于增强指令和机器人动作之间的对应性。

VLA 后训练:面向任务的训练

为了测试预训练模型的泛化能力,用与阶段 2 相同的训练目标,在下游任务上使用不同的预训练权重对 VLA 进行微调。对于每个任务,将微调数据限制为最多 100 条轨迹。

G0-VLM 训练

G0-VLM 是双-系统的高级规划器,它具有多种用途:解释人类的高级指令,用语言进行响应,执行任务规划,并将低级原子操作指令发送给 G0-VLA 执行。在实现中,用开源 Qwen2.5-VL [30] 作为起点,并使用从 Galaxea 开放-世界数据集中采样的数据进行指令调整。

为了以可扩展的方式训练 G0-VLM,将人工注释的子任务与合成的人类风格高级指令结合使用。首先,从 Galaxea 开放-世界数据集中采样事件。采样时,关键帧(定义为子任务接近终止或机械手状态变化的时刻)会被赋予更高的采样权重,以便于学习任务转换。然后,提取头部摄像头图像和子任务注释。为了使 VLM 能够处理长时间背景下的任务规划,还以 1 秒为间隔向模型输入 k 帧历史图像观测值和之前时间步长的机器人动作。生成的数据集 D_labeled 包含任务名称、机器人观测值 o_t−k,…,o_t 和子任务指令 l_t−k,…,l_t。

随后,在 D_labeled 上应用推理 LLM (DeepSeek-R1) 来生成类似于人类的高级指令以及机器人对人类的响应。向 LLM 输入每个事件的任务名称(例如,推拉椅子)、历史和当前子任务以及下一个子任务;然后,LLM 会对提示进行推理,分析整个动作序列,想象真实场景,最终生成类似人类的口头指令(例如,“我要坐下了,你能帮忙拉一下椅子吗?”)以及机器人对人类的口头回应(例如,“我正在做这件事!”)。在这里,不将图像观测数据输入 LLM,因为 LLM 的推理能力足以从高质量的原子动作标注中推断出任务场景。

Logo

「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!

更多推荐