🌐 深度学习 & 具身智能数据集指南

👩‍🎓 专为实验室师弟师妹整理 | 站在巨人的肩膀上前行

大家好呀~
作为刚入门机器人与AI研究的你,是不是经常听到“VLA”、“模仿学习”、“多模态数据”这些词,却不知道从哪里开始?别担心!

该文章整理了目前最热门、最实用、最值得学习的公开机器人数据集。它们来自 Google、Berkeley、鹏城实验室等顶尖机构,是训练智能机器人模型的“燃料”。掌握这些资源,能让你少走弯路,快速上手科研项目!

📚 数据集速查表(推荐收藏)

数据集 轨迹数量 主要特点 适合方向
Agibot World >1,000,000 百万级真实机器人轨迹,工业级质量 真实世界泛化、长程任务
Open X-Embodiment >1,000,000 谷歌主导,22种机器人统一格式 多形态机器人、标准化学习
DROID 76,000 分布式采集,性能提升显著 高质量操作策略训练
RT-2 / RT-1 130,000 VLA 模型奠基之作,带语言指令 视觉-语言-动作(VLA)
BridgeData V2 60,096 支持图像/语言条件学习 开放词汇任务
RoboSet 7,500 多视角厨房任务,轻量高效 小样本学习、零样本迁移
BC-Z 25,877 支持语言+视频调节 灵活任务描述学习
MIME 8,260 人类行为模仿数据 人机交互、行为克隆
ARIO 3,033,188 多模态大融合,支持仿真+真实 大模型预训练、跨平台
RoboMIND 60,000 含5k失败案例,支持RLHF 失败分析、强化学习
RH20T 数百万对 视觉+力觉+音频全都有 多模态感知、接触丰富任务

🔍 数据集详细介绍

🤖 Agibot World

一句话:全球最大规模的真实机器人操作数据集之一。

  • 简介:由智元机器人联合上海人工智能实验室等单位开源,覆盖抓取、搅拌、熨烫等日常生活全场景,是首个达到“工业级标准”的百万真机数据集。
  • 亮点
    • 来自 100+ 机器人,超 100万条轨迹
    • 长程任务规模是 Google OpenX 的 10倍
    • 场景更丰富,质量更高
  • 适合谁:想做真实机器人泛化、复杂家务任务的同学。
  • 链接GitHub

🌍 Open X-Embodiment

一句话:谷歌 DeepMind 推出的“机器人ImageNet”,标准化程度极高。

  • 简介:整合了全球 60 个数据集,统一为 RLDS 格式,支持 22 种不同机器人(单臂、双臂、四足等)。
  • 亮点
    • 100万条轨迹
    • 覆盖 311个场景、527项技能
    • 格式统一,方便复现论文
  • 适合谁:做跨平台对比、标准化评估的同学。
  • 链接官网

📦 DROID

一句话:分布式采集,高质量,策略性能平均提升20%。

  • 简介:通过多地点协作方式收集,确保数据多样性与鲁棒性。
  • 亮点
    • 76,000 条轨迹,涵盖 86 个任务
    • 数据质量高,适合训练强策略
  • 适合谁:关注模型稳定性和泛化能力的同学。
  • 链接官网

🔗 RT-2 / RT-1

一句话:视觉-语言-动作(VLA)模型的开山之作!

  • 简介
    • RT-1:13台机械臂在17个月内收集的真实机器人数据
    • RT-2:将网络知识融入机器人决策,实现“看懂网页就能执行”
  • 亮点
    • WebLI 数据:约 10亿图像-文本对
    • RT-1 数据:13万片段,每条都带人类语言指令
  • 适合谁:研究 VLA、具身语言模型的同学必看!
  • 链接官网

🌉 BridgeData V2

一句话:支持“用一张图或一句话告诉我怎么做”的数据集。

  • 简介:伯克利 RAIL 实验室出品,强调开放词汇学习。
  • 亮点
    • 60,096 条轨迹
    • 可用目标图像或语言指令作为条件
    • 泛化能力强
  • 适合谁:想让机器人理解新物体、新环境的同学。
  • 链接官网

🍳 RoboSet

一句话:小而精的厨房任务数据集,7500条就能学会38项任务!

  • 简介:专注于厨房中的日常活动,每帧提供4个摄像头视角。
  • 亮点
    • 数据紧凑,训练成本低
    • 支持零样本迁移
  • 适合谁:初学者练手、做多视角感知的好选择。
  • 链接官网

🧠 BC-Z

一句话:可以用“一段话”或“一段视频”来教机器人做事。

  • 简介:灵活的模仿学习系统,支持多种任务描述方式。
  • 亮点
    • 在未见过的24个任务中达到 44% 成功率
    • 支持语言嵌入 + 视频调节
  • 适合谁:研究如何让机器人“听懂人话”的同学。
  • 链接HyperAI

✋ MIME

一句话:记录人类怎么操作,让机器人去模仿。

  • 简介:提供大规模人类行为演示,填补复杂交互任务的数据空白。
  • 亮点
    • 8,260 个人类演示
    • 包含推、拉、堆叠等动作
  • 注意:原始链接可能非官方,请查阅论文获取数据。
  • 链接GitHub 参考

🌀 ARIO (All Robots In One)

一句话:中国团队牵头的“具身智能版ImageNet”,野心巨大!

  • 简介:鹏城实验室联合多家高校企业推出,制定统一数据标准。
  • 亮点
    • 300万条轨迹
    • 支持真实 + 仿真 + 数据转换
    • 多模态:图像、点云、声音、触觉
  • 适合谁:做大模型预训练、跨模态融合的同学。
  • 链接官网

🧩 RoboMIND

一句话:不仅教成功,还教你“为什么会失败”。

  • 简介:包含 5,000 条失败轨迹,可用于强化学习中的人类反馈建模(RLHF)。
  • 亮点
    • 60,000 条轨迹,覆盖 279 项任务
    • 支持“从失败中学习”
  • 适合谁:研究错误恢复、策略优化的同学。
  • 链接官网

🎧 RH20T

一句话:连“拧瓶盖的声音”和“手指的触感”都记录了!

  • 简介:上海交大团队出品,专注于“接触丰富”的操作任务。
  • 亮点
    • 每条序列包含:视觉 + 力觉 + 音频 + 动作
    • 总数据量超 40TB
    • 支持多视角同步
  • 适合谁:研究精细操作、多模态感知的同学。
  • 链接官网

💡 给师弟师妹的学习建议

你想研究的方向 推荐数据集
刚入门,想练手 RoboSet、BridgeData V2
做 VLA / 视觉语言动作 RT-2/RT-1、BC-Z
关注真实机器人表现 Agibot World、DROID
想用多模态信号(力/声/触觉) RH20T、ARIO
做失败分析或 RLHF RoboMIND
做仿真迁移或统一格式训练 Open X-Embodiment、ARIO

📌 小建议

  • 初学者可以从 RoboSet 或 BridgeData 开始,数据量小,容易跑通流程。
  • 读论文时,先看数据集介绍部分,理解“模型是在什么数据上训练的”,这比模型结构更重要!

📢 欢迎补充与贡献!

📌 持续更新中,欢迎 Star ⭐ 获取最新动态!

Logo

「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!

更多推荐