机器人 / 具身智能开源数据集调研报告
2026.04 · 89 Datasets Analyzed · Full Report
第一章:调研概览
本次调研系统梳理了 89 个具有代表性的机器人/具身智能开源数据集,涵盖桌面操作、移动操作、灵巧抓取、人形机器人、室内导航等多个子领域,时间跨度从 2018 年至 2026 年。
核心维度总览
下表汇总了全部数据集的关键信息(展示前 30 个主要数据集)。
第二章:现状分析
2.1 数据规模与时长分布
当前数据集在规模上呈现显著的两极分化。VIMA (1.4TB, 660K episodes) 和 DROID (1.67TB, 92K episodes) 在规模上遥遥领先,但大量 OXE 子数据集规模在 10GB 以下。适合跨任务预训练的 "百 GB 级 + 万级 episodes + 多任务" 数据集仍然稀缺。
发现:Top 5 数据集占据总存储量的 60% 以上,而 60% 的数据集不足 50GB。数据资源高度集中在 Google DeepMind 和 UC Berkeley 等少数机构。
2.2 Domain 与场景分布
89 个数据集中,桌面操作类占据绝对主导(约 90%),这是因为 OXE 体系内数据集以单臂桌面操作为主。人形机器人、灵巧手、室内导航等新兴领域的专用数据集仍然稀缺。
发现:操作类数据集严重过剩,而人形机器人全身操作数据集仅有 3-4 个(humanoid-everyday、PHUMA、HumanPlus),灵巧手数据集仅 1 个(DexGraspNet 2.0)。
2.3 数据来源与质量
真实世界采集(约 85%)是绝对主流,主要通过 Human VR 遥操作完成。仿真生成数据集数量较少但单个规模通常更大。
各数据来源的优劣势对比:
- Human VR 遥操作(~50%):数据质量高,但采集成本大、速度慢、难以规模化
- Scripted/Expert Policy(~20%):可规模化但行为多样性受限
- 仿真生成(~12%):成本低、可无限生成,但存在 domain gap
- Human Puppeteering(~5%):ALOHA 系列推广的低成本方案
2.4 标注体系现状
与视频世界模型数据集不同,机器人数据集的标注重点在于 Action(动作) 而非 Caption。但当前的 Action 标注绝大多数是底层 EEF 位姿/关节角度,缺乏语义化的高层动作描述。
关键差异:视频世界模型领域 Action 标注覆盖率仅 26.1%(23 个数据集中 6 个),而机器人领域几乎所有数据集都有底层 Action(关节/EEF),但语义化 Action 标注(如 "pick up the red cup")的覆盖率不足 30%。Language instruction 标注覆盖约 40%。
2.5 机器人硬件生态
Franka Emika Panda 占据绝对主导地位,约 35% 的数据集使用 Franka,其次是 WidowX、xArm、Google Robot。这种高度集中的硬件生态导致了严重的跨具身泛化问题。
发现:OXE 原始数据中 Top 4 机器人占 85% 轨迹(OXE-AugE 论文数据)。这意味着在 OXE 上训练的策略会严重过拟合到少数几种机器人平台,跨具身迁移能力有限。
2.6 动作空间与控制频率
主流动作空间为 7-DoF End-Effector Pose + Gripper(约 60%),其次是 Joint Position Control(约 25%)。Force/Torque Control 仅在 Kinetix 等少数基准中使用。控制频率以 5-30Hz 为主。
第三章:痛点深度剖析
3.1 跨具身数据严重失衡
这是当前最突出的结构性问题。Franka 数据约占总量的 35%,加上 Google Robot 和 WidowX,前三种机器人占据 60% 以上。OXE-AugE 的实验表明,增加机器人多样性可带来 24-45% 的零样本迁移提升,但目前大多数数据集仍局限于单一平台。
痛点:跨具身泛化是通用机器人策略的核心需求,但数据层面的平台多样性严重不足。新增一种机器人的数据采集成本高昂,目前仅 OXE-AugE 通过仿真增强提供了系统性解决方案。
3.2 Action 标注粒度不足
几乎所有数据集都记录了底层 Action(EEF 位姿或关节角度),但这些是低层控制信号而非语义化动作。例如,"向右移动 5cm" 和 "拿起红色杯子" 在当前数据中几乎无法区分。仅约 40% 的数据集附带了自然语言任务描述,且大多为粗粒度模板指令。
痛点:VLA 模型需要 "视觉 → 语言理解 → 动作执行" 的完整链路,但当前数据集在 "语言 → 动作" 的语义映射上严重不足。这直接制约了 VLA 模型的语言接地能力。
3.3 真机评测基础设施匮乏
89 个数据集中,支持标准化真机评测的极少。直到 2025-2026 年才出现 RoboChallenge(7×24 远程 API)、ManipulationNet(全球分布式)、ManipArena(绿幕可控环境)等真机评测基础设施。大多数研究仍依赖仿真评测或各自的真机实验。
3.4 仿真-真机 Gap 仍未系统性解决
SimplerEnv 在特定设置下实现了 0.85-0.97 的 sim-real 相关性,但这依赖于精心设计的系统辨识和视觉对齐。COLOSSEUM 的实验表明,即使在仿真内部,14 类环境扰动就能导致 30-75% 的性能下降,真实世界的扰动更为复杂。
痛点:Sim-to-Real Gap 不是单一问题,而是视觉差异、控制差异、物理差异的复合体。目前缺乏系统性的方法论来量化和弥合这些差距。
第四章:发展趋势
4.1 从 OXE 到 LeRobot v3.0:数据标准化演进
2023 年 OXE 首次提出 RLDS 统一格式,整合 60+ 数据集。2024 年 HuggingFace LeRobot 项目将其转换为更友好的 Parquet + MP4 格式。2025 年 LeRobot v3.0 进一步解决了百万级 episode 的文件系统瓶颈,支持流式加载。
趋势:RLDS (TFRecord) → LeRobot v2 (Parquet+MP4, 单文件/episode) → LeRobot v3 (多episode合并, streaming) → 未来可能统一到 WebDataset/Zarr 等更高效格式
4.2 从单臂到人形:硬件形态扩展
2018-2023 年以单臂桌面操作为主。2024 年 ALOHA/Mobile ALOHA 推动双臂+移动操作。2025 年 humanoid-everyday、HumanPlus、RoboMIND 2.0 标志着人形机器人全身操作数据开始规模化。
4.3 从模仿学习到 VLA:数据需求的质变
早期数据集服务于单任务模仿学习(几百条演示即可)。VLA 时代要求跨任务、跨场景、跨机器人的大规模数据,且需要语言标注。这推动了 OXE (1M+)、AgiBot World (1M+)、DROID (76K+) 等百万级数据集的出现。
4.4 从仿真评测到云端真机:评测范式升级
评测经历了四个阶段:
- Phase 1 (2019-2022):各自仿真评测(RLBench / MetaWorld / CALVIN)
- Phase 2 (2023-2024):统一仿真评测(SimplerEnv / ManiSkill3)
- Phase 3 (2025):自动化 Real-to-Sim 评测(ROBOTARENA ∞)
- Phase 4 (2025-2026):云端真机评测(RoboChallenge / ManipulationNet / ManipArena)
第五章:核心结论与建议
核心发现
- 数据资源高度集中 — Top 5 数据集占总存储量 60%+,Top 3 机器人平台占轨迹量 60%+。少数机构(Google/Berkeley/Stanford)主导了数据供给。
- 桌面操作严重过剩,新兴领域严重不足 — 90% 数据集为桌面操作,人形机器人/灵巧手/移动操作数据集数量和规模都远远不够。
- 语义化 Action 标注是最大瓶颈 — 底层 EEF/关节动作记录充分,但缺乏 "pick up red cup" 级别的语义标注,直接制约 VLA 的语言接地能力。
- 跨具身泛化受限于数据失衡 — Franka 一家独大,OXE-AugE 证明增加多样性可提升 24-45%,但系统性解决方案仍然稀缺。
- 仿真-真机 Gap 是复合问题 — 不是单一视觉差异,而是视觉+控制+物理的复合体,SimplerEnv 式的精细对齐仅适用于特定设置。
- 真机评测正在规模化 — 2025-2026 年出现的 RoboChallenge/ManipulationNet/ManipArena 标志着评测从 "各自为政" 走向 "全球基础设施"。
- 数据标准正在快速演进 — RLDS → LeRobot v3.0 的演进大幅降低了数据使用门槛,但跨数据集联合训练仍需解决动作空间/频率/相机配置的异构性。
- 人形机器人数据是下一个爆发点 — humanoid-everyday/HumanPlus/RoboMIND 2.0 开启了人形数据规模化,预计 2026-2027 年将涌现更多大规模人形数据集。