盘点具身智能主流数据集,解析ALOHA、OXE等资源的工程价值。
原文标题:原创丨具身智能机器人工程化开发中的主流数据集
原文作者:数据派THU
冷月清谈:
怜星夜思:
2、如果国内团队要做机器人数据集,最该补的是数据规模、数据标准,还是真实场景覆盖?
3、仿真数据在具身智能里能走多远?以后会不会替代真实机器人采集?
4、VLA模型训练里,语言标注到底是锦上添花,还是决定机器人理解能力的关键?
原文内容
作者:陈之炎本文约3200字,建议阅读6分钟本本文介绍了主流具身智能数据集,梳理行业数据生态与工程应用价值。
在具身智能机器人的工程化开发流程中,数据集是模型训练与能力泛化的核心基础,基准测试资源是量化性能、迭代优化的关键支撑。随着具身智能从实验室走向真实场景,行业对“大规模、多模态、跨平台兼容”的数据集需求激增,同时对:标准化、自动化、可复现的基准测试体系提出了更高要求。本文聚焦具身交互数据集应用、自组织行为日志标准与可视化工具、开源基准测试套件与自动化评估脚本三大核心方向,结合业界前沿成果与工程实践,系统阐述相关资源的技术特性、应用场景与落地方法,为具身智能机器人的工程化开发提供数据与评估层面的实操指南。
当前业界主流数据集以低成本、易拓展、跨平台兼容、大规模高质量为核心发展趋势,其中ALOHA系列、Open X-Embodiment(OXE)最具代表性,同时国内AGIBOT WORLD、RH20T等数据集快速崛起,形成了“国际引领、国内补充”的数据集生态,为具身智能机器人的交互能力开发提供了全面支撑。
1. ALOHA系列:低成本双臂交互数据集体系
ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation)是由斯坦福大学与Google DeepMind联合推出的低成本开源双臂遥操作系统及配套数据集,核心定位是解决传统机器人交互数据采集成本高、门槛高、数据量不足的痛点,为双臂具身交互技能(如物体抓取、工具操作、精细装配)提供高质量训练数据,自2022年首发以来已迭代至ALOHA 2与Mobile ALOHA版本,形成了完整的数据集与硬件协同生态。
ALOHA的核心优势在于“低成本硬件+标准化数据+开源生态”的一体化设计。原始ALOHA系统采用低成本机械臂、VR遥动设备与多视角相机,整体硬件成本控制在5000美元以内,普通实验室即可搭建,大幅降低了双臂交互数据的采集门槛。配套数据集以静态桌面交互为核心,包含50+类日常任务(如电池安装、螺丝拧紧、毛巾折叠、拉链闭合),每类任务提供100+条高质量演示轨迹,每条轨迹同步记录RGB图像(多视角)、深度图像、机械臂关节角度、末端执行器姿态、夹爪状态等8类核心数据,数据格式统一为ROS Bag,兼容主流机器人学习框架。
2024年推出的ALOHA 2版本实现了全面升级,硬件层面优化了机械臂负载能力、操作精度与人体工学设计,支持更高强度的交互任务;数据集层面新增20+类精细操作任务(如电子元件焊接、微小零件装配),数据轨迹总量提升至10万+条,同时优化了数据标注精度,新增动作平滑度、任务完成度等细粒度标签,适配灵巧操作模型训练需求。同年发布的Mobile ALOHA进一步拓展了应用场景,在ALOHA双臂系统基础上集成全向移动底盘,支持“移动-双臂协同交互”任务(如厨房炒菜、橱柜储物、电梯呼叫与进入、锅具清洗),配套数据集包含50类移动操作任务,每条轨迹新增底盘里程计、激光雷达点云等移动相关数据,为移动具身智能机器人开发提供了关键数据支撑。
在工程应用层面,ALOHA数据集已成为双臂具身交互模型训练的标准基准数据,广泛应用于行为克隆(BC)、深度强化学习(DRL)、视觉-语言-动作(VLA)模型训练。例如,基于ALOHA数据训练的双臂行为克隆模型,在静态桌面任务中成功率可达90%以上;结合Mobile ALOHA数据协同训练的模型,在移动操作任务中成功率提升至80%,远超单一静态数据训练的模型。同时,ALOHA数据集完全开源,支持用户自定义拓展任务与数据量,兼容PyTorch、TensorFlow、JAX等主流框架,提供数据加载、预处理、可视化的完整代码工具链,大幅降低了工程化应用的门槛。
2. Open X-Embodiment(OXE):
跨平台大规模具身交互数据集 Open X-Embodiment(OXE)是2023年10月由Google DeepMind主导,联合全球21家机构、34个实验室共同推出的大规模跨平台开源机器人数据集,核心目标是解决具身智能模型“平台绑定、泛化性差”的行业痛点,推动“单一模型适配多机器人、多任务、多环境”的通用具身智能发展,目前已成为全球规模最大、覆盖面最广的真实机器人交互数据集。
OXE数据集的核心特点是“规模超大、平台多样、技能全面、格式统一”。数据来源整合了全球60个已有开源机器人数据集,涵盖22种不同机器人平台(包括单臂机械臂、双臂机械臂、四足机器人、移动机械臂、人形机器人等),覆盖311个真实应用场景、527项核心交互技能、160266项具体任务,累计包含100万+条真实机器人交互轨迹,所有轨迹均来自真实物理机器人的实操记录,避免了仿真数据与真实场景的“鸿沟”。技能覆盖范围从基础的物体抓取、放置、推动,到复杂的工具使用、装配、烹饪、清洁,再到移动导航、人机协作交互,全面覆盖工业、家庭、服务等主流应用场景。
为实现跨平台兼容,OXE采用RLDS(Reinforcement Learning Dataset Structure)统一数据格式,将不同机器人平台的异构数据(如不同维度的关节数据、不同分辨率的视觉数据、不同频率的传感器数据)标准化为统一结构,每条轨迹包含时间戳、观测数据(RGB、深度、点云)、动作数据(关节角度、末端姿态)、奖励信号、任务描述、元数据等核心字段,支持在TensorFlow、JAX、PyTorch等主流框架中高效并行加载。同时,OXE提供完整的数据预处理工具链,支持数据清洗、格式转换、数据增强、轨迹筛选等功能,用户可快速将自有数据融入OXE生态,或基于OXE数据定制专属训练数据集。
在工程价值层面,OXE数据集的推出是具身智能发展的里程碑事件,核心价值体现在三大方面:一是支撑通用具身模型训练,基于OXE数据训练的RT-1-X、RT-2-X模型,首次实现了跨机器人平台的技能迁移,在22种机器人平台上的平均任务成功率较专属模型提升50%,验证了“通用模型”的可行性;二是降低行业研发门槛,开源的大规模高质量数据,让中小企业与科研团队无需自行采集海量数据,即可开展通用具身模型的研发与迭代;三是建立行业数据标准,RLDS格式成为具身智能数据的主流标准,推动了行业数据的互通共享与协同创新。
目前,OXE已迭代至2.0版本,新增10+种机器人平台、20万+条轨迹,优化了数据标注质量,新增多语言任务描述标签,进一步强化了跨场景、跨语言的泛化能力。
3. 其他主流具身交互数据集
除ALOHA与OXE外,业界还有多款优质具身交互数据集,各有侧重,形成了互补生态,满足不同工程场景的需求。
(1) AGIBOT WORLD
由国内智元机器人于2026年推出的异构具身数据集,包含真实世界数据与1:1数字孪生仿真数据,真实数据覆盖商业、家庭、日常操作等场景,采用自由形式数据采集方法,操作员根据实时环境动态执行任务,数据多样性更强;仿真数据与真实数据一一对应,支持“仿真训练-真实部署”的闭环开发流程,核心聚焦人形机器人的具身交互能力开发。
(2) RH20T
由清华大学团队推出的大规模人形机器人交互数据集,包含20万+条人形机器人实操轨迹,覆盖100+类日常交互任务(如开门、倒水、搬运、人机握手),同步记录全身关节数据、多视角视觉数据、力觉数据,适配人形机器人全身运动控制与交互模型训练。
(3) RoboMIND:
由上海AI实验室推出的多模态具身交互数据集,核心聚焦视觉-语言-动作的融合交互,包含50万+条轨迹,每条轨迹配套自然语言任务描述、视觉场景标注、动作意图标签,支持VLA模型与具身大模型的训练,强化机器人的语义理解与交互决策能力。
4. 小结:
当前具身智能机器人工程化开发的数据生态已形成"真实采集+仿真生成+跨具身融合"的三层架构。在真实数据侧,Open X-Embodiment 作为谷歌DeepMind联合33家机构构建的标杆,整合超100万条轨迹、22种机器人类型与527项技能,验证了跨具身训练对策略泛化的关键作用;DROID(约7.6万条)与 BridgeData V2(约6万条)分别以标准化Franka和WidowX平台提供了高质量行为克隆基准。国内方面,智元机器人2026年开源的 AGIBOT WORLD 2026 成为首个覆盖具身全域的大规模数据集,依托外骨骼遥操与数字孪生仿真双 pipeline 持续扩展;OpenLoong"白虎"数据集 则通过信通院认证,涵盖青龙、傅利叶GR2等多本体及夹爪/灵巧手末端,填补了国内权威标准空白。
在仿真与多模态维度,RH20T 提供触觉、音频等富感知数据,支撑接触密集型操作;VTOUCH 等数据集则聚焦双臂协同与视觉触觉融合。工程实践中,企业正从单一数据集微调转向"海量开源预训练+场景化私有数据微调"的范式,通过遥操真机、仿真合成与在环数据飞轮三条路径,缓解物理交互数据稀缺瓶颈,加速VLA(Vision-Language-Action)模型的落地部署。
欢迎在评论区留言与本文作者互动交流!
数据派研究部介绍
数据派研究部成立于2017年初,以兴趣为核心划分多个组别,各组既遵循研究部整体的知识分享和实践项目规划,又各具特色:
算法模型组:积极组队参加kaggle等比赛,原创手把手教系列文章;
调研分析组:通过专访等方式调研大数据的应用,探索数据产品之美;
系统平台组:追踪大数据&人工智能系统平台技术前沿,对话专家;
自然语言处理组:重于实践,积极参加比赛及策划各类文本分析项目;
制造业大数据组:秉工业强国之梦,产学研政结合,挖掘数据价值;
数据可视化组:将信息与艺术融合,探索数据之美,学用可视化讲故事;
网络爬虫组:爬取网络信息,配合其他各组开发创意项目。
点击文末“阅读原文”,报名数据派研究部志愿者,总有一组适合你~
转载须知
如需转载,请在开篇显著位置注明作者和出处(转自:数据派THUID:DatapiTHU),并在文章结尾放置数据派醒目二维码。有原创标识文章,请发送【文章名称-待授权公众号名称及ID】至联系邮箱,申请白名单授权并按要求编辑。
未经许可的转载以及改编者,我们将依法追究其法律责任。

