深度学习 & 具身智能数据集汇总
·
🌐 深度学习 & 具身智能数据集指南
👩🎓 专为实验室师弟师妹整理 | 站在巨人的肩膀上前行
大家好呀~
作为刚入门机器人与AI研究的你,是不是经常听到“VLA”、“模仿学习”、“多模态数据”这些词,却不知道从哪里开始?别担心!
该文章整理了目前最热门、最实用、最值得学习的公开机器人数据集。它们来自 Google、Berkeley、鹏城实验室等顶尖机构,是训练智能机器人模型的“燃料”。掌握这些资源,能让你少走弯路,快速上手科研项目!
📚 数据集速查表(推荐收藏)
| 数据集 | 轨迹数量 | 主要特点 | 适合方向 |
|---|---|---|---|
| Agibot World | >1,000,000 | 百万级真实机器人轨迹,工业级质量 | 真实世界泛化、长程任务 |
| Open X-Embodiment | >1,000,000 | 谷歌主导,22种机器人统一格式 | 多形态机器人、标准化学习 |
| DROID | 76,000 | 分布式采集,性能提升显著 | 高质量操作策略训练 |
| RT-2 / RT-1 | 130,000 | VLA 模型奠基之作,带语言指令 | 视觉-语言-动作(VLA) |
| BridgeData V2 | 60,096 | 支持图像/语言条件学习 | 开放词汇任务 |
| RoboSet | 7,500 | 多视角厨房任务,轻量高效 | 小样本学习、零样本迁移 |
| BC-Z | 25,877 | 支持语言+视频调节 | 灵活任务描述学习 |
| MIME | 8,260 | 人类行为模仿数据 | 人机交互、行为克隆 |
| ARIO | 3,033,188 | 多模态大融合,支持仿真+真实 | 大模型预训练、跨平台 |
| RoboMIND | 60,000 | 含5k失败案例,支持RLHF | 失败分析、强化学习 |
| RH20T | 数百万对 | 视觉+力觉+音频全都有 | 多模态感知、接触丰富任务 |
🔍 数据集详细介绍
🤖 Agibot World
一句话:全球最大规模的真实机器人操作数据集之一。
- 简介:由智元机器人联合上海人工智能实验室等单位开源,覆盖抓取、搅拌、熨烫等日常生活全场景,是首个达到“工业级标准”的百万真机数据集。
- 亮点:
- 来自 100+ 机器人,超 100万条轨迹
- 长程任务规模是 Google OpenX 的 10倍
- 场景更丰富,质量更高
- 适合谁:想做真实机器人泛化、复杂家务任务的同学。
- 链接:GitHub
🌍 Open X-Embodiment
一句话:谷歌 DeepMind 推出的“机器人ImageNet”,标准化程度极高。
- 简介:整合了全球 60 个数据集,统一为 RLDS 格式,支持 22 种不同机器人(单臂、双臂、四足等)。
- 亮点:
- 超 100万条轨迹
- 覆盖 311个场景、527项技能
- 格式统一,方便复现论文
- 适合谁:做跨平台对比、标准化评估的同学。
- 链接:官网
📦 DROID
一句话:分布式采集,高质量,策略性能平均提升20%。
- 简介:通过多地点协作方式收集,确保数据多样性与鲁棒性。
- 亮点:
- 76,000 条轨迹,涵盖 86 个任务
- 数据质量高,适合训练强策略
- 适合谁:关注模型稳定性和泛化能力的同学。
- 链接:官网
🔗 RT-2 / RT-1
一句话:视觉-语言-动作(VLA)模型的开山之作!
- 简介:
- RT-1:13台机械臂在17个月内收集的真实机器人数据
- RT-2:将网络知识融入机器人决策,实现“看懂网页就能执行”
- 亮点:
- WebLI 数据:约 10亿图像-文本对
- RT-1 数据:13万片段,每条都带人类语言指令
- 适合谁:研究 VLA、具身语言模型的同学必看!
- 链接:官网
🌉 BridgeData V2
一句话:支持“用一张图或一句话告诉我怎么做”的数据集。
- 简介:伯克利 RAIL 实验室出品,强调开放词汇学习。
- 亮点:
- 60,096 条轨迹
- 可用目标图像或语言指令作为条件
- 泛化能力强
- 适合谁:想让机器人理解新物体、新环境的同学。
- 链接:官网
🍳 RoboSet
一句话:小而精的厨房任务数据集,7500条就能学会38项任务!
- 简介:专注于厨房中的日常活动,每帧提供4个摄像头视角。
- 亮点:
- 数据紧凑,训练成本低
- 支持零样本迁移
- 适合谁:初学者练手、做多视角感知的好选择。
- 链接:官网
🧠 BC-Z
一句话:可以用“一段话”或“一段视频”来教机器人做事。
- 简介:灵活的模仿学习系统,支持多种任务描述方式。
- 亮点:
- 在未见过的24个任务中达到 44% 成功率
- 支持语言嵌入 + 视频调节
- 适合谁:研究如何让机器人“听懂人话”的同学。
- 链接:HyperAI
✋ MIME
一句话:记录人类怎么操作,让机器人去模仿。
- 简介:提供大规模人类行为演示,填补复杂交互任务的数据空白。
- 亮点:
- 8,260 个人类演示
- 包含推、拉、堆叠等动作
- 注意:原始链接可能非官方,请查阅论文获取数据。
- 链接:GitHub 参考
🌀 ARIO (All Robots In One)
一句话:中国团队牵头的“具身智能版ImageNet”,野心巨大!
- 简介:鹏城实验室联合多家高校企业推出,制定统一数据标准。
- 亮点:
- 超 300万条轨迹
- 支持真实 + 仿真 + 数据转换
- 多模态:图像、点云、声音、触觉
- 适合谁:做大模型预训练、跨模态融合的同学。
- 链接:官网
🧩 RoboMIND
一句话:不仅教成功,还教你“为什么会失败”。
- 简介:包含 5,000 条失败轨迹,可用于强化学习中的人类反馈建模(RLHF)。
- 亮点:
- 60,000 条轨迹,覆盖 279 项任务
- 支持“从失败中学习”
- 适合谁:研究错误恢复、策略优化的同学。
- 链接:官网
🎧 RH20T
一句话:连“拧瓶盖的声音”和“手指的触感”都记录了!
- 简介:上海交大团队出品,专注于“接触丰富”的操作任务。
- 亮点:
- 每条序列包含:视觉 + 力觉 + 音频 + 动作
- 总数据量超 40TB
- 支持多视角同步
- 适合谁:研究精细操作、多模态感知的同学。
- 链接:官网
💡 给师弟师妹的学习建议
| 你想研究的方向 | 推荐数据集 |
|---|---|
| 刚入门,想练手 | RoboSet、BridgeData V2 |
| 做 VLA / 视觉语言动作 | RT-2/RT-1、BC-Z |
| 关注真实机器人表现 | Agibot World、DROID |
| 想用多模态信号(力/声/触觉) | RH20T、ARIO |
| 做失败分析或 RLHF | RoboMIND |
| 做仿真迁移或统一格式训练 | Open X-Embodiment、ARIO |
📌 小建议:
- 初学者可以从 RoboSet 或 BridgeData 开始,数据量小,容易跑通流程。
- 读论文时,先看数据集介绍部分,理解“模型是在什么数据上训练的”,这比模型结构更重要!
📢 欢迎补充与贡献!
📌 持续更新中,欢迎 Star ⭐ 获取最新动态!
「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!
更多推荐



所有评论(0)