具身智能机器人的主流数据集盘点:从ALOHA到Open X-Embodiment

盘点具身智能主流数据集,解析ALOHA、OXE等资源的工程价值。

原文标题:原创丨具身智能机器人工程化开发中的主流数据集

原文作者:数据派THU

冷月清谈:

文章围绕具身智能机器人工程化开发中的数据基础展开,梳理了当前主流数据集的技术特点与应用价值。ALOHA系列以低成本双臂遥操作系统为核心,适合双臂精细操作、桌面任务和移动操作数据采集,降低了实验室与企业构建交互数据的门槛。Open X-Embodiment则通过整合多机构、多平台、多任务的真实机器人轨迹,推动跨机器人平台的通用模型训练,并以RLDS格式促进数据标准化。文章还介绍了AGIBOT WORLD、RH20T、RoboMIND等国内外数据集,它们分别在人形机器人、全身控制、多模态VLA训练等方向形成补充。当前数据生态正从单一数据集微调,转向“开源大数据预训练+场景私有数据微调”的工程范式,真实采集、仿真生成和跨具身融合成为主要发展路径。

怜星夜思:

1、具身智能模型到底更需要“大而全”的数据集,还是“小而精”的场景数据?
2、如果国内团队要做机器人数据集,最该补的是数据规模、数据标准,还是真实场景覆盖?
3、仿真数据在具身智能里能走多远?以后会不会替代真实机器人采集?
4、VLA模型训练里,语言标注到底是锦上添花,还是决定机器人理解能力的关键?

原文内容

图片
作者:陈之炎
本文约3200字,建议阅读6分钟
本文介绍了主流具身智能数据集,梳理行业数据生态与工程应用价值。


具身智能机器人的工程化开发流程中,数据集是模型训练与能力泛化的核心基础,基准测试资源是量化性能、迭代优化的关键支撑。随着具身智能从实验室走向真实场景,行业对“大规模、多模态、跨平台兼容”的数据集需求激增,同时对:标准化、自动化、可复现的基准测试体系提出了更高要求。本文聚焦具身交互数据集应用、自组织行为日志标准与可视化工具、开源基准测试套件与自动化评估脚本三大核心方向,结合业界前沿成果与工程实践,系统阐述相关资源的技术特性、应用场景与落地方法,为具身智能机器人的工程化开发提供数据与评估层面的实操指南。


当前业界主流数据集以低成本、易拓展、跨平台兼容、大规模高质量为核心发展趋势,其中ALOHA系列、Open X-Embodiment(OXE)最具代表性,同时国内AGIBOT WORLD、RH20T等数据集快速崛起,形成了“国际引领、国内补充”的数据集生态,为具身智能机器人的交互能力开发提供了全面支撑。


1. ALOHA系列:低成本双臂交互数据集体系 


ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation)是由斯坦福大学与Google DeepMind联合推出的低成本开源双臂遥操作系统及配套数据集,核心定位是解决传统机器人交互数据采集成本高、门槛高、数据量不足的痛点,为双臂具身交互技能(如物体抓取、工具操作、精细装配)提供高质量训练数据,自2022年首发以来已迭代至ALOHA 2与Mobile ALOHA版本,形成了完整的数据集与硬件协同生态。


ALOHA的核心优势在于“低成本硬件+标准化数据+开源生态”的一体化设计。原始ALOHA系统采用低成本机械臂、VR遥动设备与多视角相机,整体硬件成本控制在5000美元以内,普通实验室即可搭建,大幅降低了双臂交互数据的采集门槛。配套数据集以静态桌面交互为核心,包含50+类日常任务(如电池安装、螺丝拧紧、毛巾折叠、拉链闭合),每类任务提供100+条高质量演示轨迹,每条轨迹同步记录RGB图像(多视角)、深度图像、机械臂关节角度、末端执行器姿态、夹爪状态等8类核心数据,数据格式统一为ROS Bag,兼容主流机器人学习框架。


2024年推出的ALOHA 2版本实现了全面升级,硬件层面优化了机械臂负载能力、操作精度与人体工学设计,支持更高强度的交互任务;数据集层面新增20+类精细操作任务(如电子元件焊接、微小零件装配),数据轨迹总量提升至10万+条,同时优化了数据标注精度,新增动作平滑度、任务完成度等细粒度标签,适配灵巧操作模型训练需求。同年发布的Mobile ALOHA进一步拓展了应用场景,在ALOHA双臂系统基础上集成全向移动底盘,支持“移动-双臂协同交互”任务(如厨房炒菜、橱柜储物、电梯呼叫与进入、锅具清洗),配套数据集包含50类移动操作任务,每条轨迹新增底盘里程计、激光雷达点云等移动相关数据,为移动具身智能机器人开发提供了关键数据支撑。


在工程应用层面,ALOHA数据集已成为双臂具身交互模型训练的标准基准数据,广泛应用于行为克隆(BC)、深度强化学习(DRL)、视觉-语言-动作(VLA)模型训练。例如,基于ALOHA数据训练的双臂行为克隆模型,在静态桌面任务中成功率可达90%以上;结合Mobile ALOHA数据协同训练的模型,在移动操作任务中成功率提升至80%,远超单一静态数据训练的模型。同时,ALOHA数据集完全开源,支持用户自定义拓展任务与数据量,兼容PyTorch、TensorFlow、JAX等主流框架,提供数据加载、预处理、可视化的完整代码工具链,大幅降低了工程化应用的门槛。


2. Open X-Embodiment(OXE):


跨平台大规模具身交互数据集 Open X-Embodiment(OXE)是2023年10月由Google DeepMind主导,联合全球21家机构、34个实验室共同推出的大规模跨平台开源机器人数据集,核心目标是解决具身智能模型“平台绑定、泛化性差”的行业痛点,推动“单一模型适配多机器人、多任务、多环境”的通用具身智能发展,目前已成为全球规模最大、覆盖面最广的真实机器人交互数据集。


OXE数据集的核心特点是“规模超大、平台多样、技能全面、格式统一”。数据来源整合了全球60个已有开源机器人数据集,涵盖22种不同机器人平台(包括单臂机械臂、双臂机械臂、四足机器人、移动机械臂、人形机器人等),覆盖311个真实应用场景、527项核心交互技能、160266项具体任务,累计包含100万+条真实机器人交互轨迹,所有轨迹均来自真实物理机器人的实操记录,避免了仿真数据与真实场景的“鸿沟”。技能覆盖范围从基础的物体抓取、放置、推动,到复杂的工具使用、装配、烹饪、清洁,再到移动导航、人机协作交互,全面覆盖工业、家庭、服务等主流应用场景。


为实现跨平台兼容,OXE采用RLDS(Reinforcement Learning Dataset Structure)统一数据格式,将不同机器人平台的异构数据(如不同维度的关节数据、不同分辨率的视觉数据、不同频率的传感器数据)标准化为统一结构,每条轨迹包含时间戳、观测数据(RGB、深度、点云)、动作数据(关节角度、末端姿态)、奖励信号、任务描述、元数据等核心字段,支持在TensorFlow、JAX、PyTorch等主流框架中高效并行加载。同时,OXE提供完整的数据预处理工具链,支持数据清洗、格式转换、数据增强、轨迹筛选等功能,用户可快速将自有数据融入OXE生态,或基于OXE数据定制专属训练数据集。


在工程价值层面,OXE数据集的推出是具身智能发展的里程碑事件,核心价值体现在三大方面:一是支撑通用具身模型训练,基于OXE数据训练的RT-1-X、RT-2-X模型,首次实现了跨机器人平台的技能迁移,在22种机器人平台上的平均任务成功率较专属模型提升50%,验证了“通用模型”的可行性;二是降低行业研发门槛,开源的大规模高质量数据,让中小企业与科研团队无需自行采集海量数据,即可开展通用具身模型的研发与迭代;三是建立行业数据标准,RLDS格式成为具身智能数据的主流标准,推动了行业数据的互通共享与协同创新。


目前,OXE已迭代至2.0版本,新增10+种机器人平台、20万+条轨迹,优化了数据标注质量,新增多语言任务描述标签,进一步强化了跨场景、跨语言的泛化能力。


3. 其他主流具身交互数据集 


除ALOHA与OXE外,业界还有多款优质具身交互数据集,各有侧重,形成了互补生态,满足不同工程场景的需求。 


(1) AGIBOT WORLD


由国内智元机器人于2026年推出的异构具身数据集,包含真实世界数据与1:1数字孪生仿真数据,真实数据覆盖商业、家庭、日常操作等场景,采用自由形式数据采集方法,操作员根据实时环境动态执行任务,数据多样性更强;仿真数据与真实数据一一对应,支持“仿真训练-真实部署”的闭环开发流程,核心聚焦人形机器人的具身交互能力开发。


(2)  RH20T


由清华大学团队推出的大规模人形机器人交互数据集,包含20万+条人形机器人实操轨迹,覆盖100+类日常交互任务(如开门、倒水、搬运、人机握手),同步记录全身关节数据、多视角视觉数据、力觉数据,适配人形机器人全身运动控制与交互模型训练。 


(3) RoboMIND:


由上海AI实验室推出的多模态具身交互数据集,核心聚焦视觉-语言-动作的融合交互,包含50万+条轨迹,每条轨迹配套自然语言任务描述、视觉场景标注、动作意图标签,支持VLA模型与具身大模型的训练,强化机器人的语义理解与交互决策能力。


4. 小结:


当前具身智能机器人工程化开发的数据生态已形成"真实采集+仿真生成+跨具身融合"的三层架构。在真实数据侧,Open X-Embodiment 作为谷歌DeepMind联合33家机构构建的标杆,整合超100万条轨迹、22种机器人类型与527项技能,验证了跨具身训练对策略泛化的关键作用;DROID(约7.6万条)与 BridgeData V2(约6万条)分别以标准化Franka和WidowX平台提供了高质量行为克隆基准。国内方面,智元机器人2026年开源的 AGIBOT WORLD 2026 成为首个覆盖具身全域的大规模数据集,依托外骨骼遥操与数字孪生仿真双 pipeline 持续扩展;OpenLoong"白虎"数据集 则通过信通院认证,涵盖青龙、傅利叶GR2等多本体及夹爪/灵巧手末端,填补了国内权威标准空白。


在仿真与多模态维度,RH20T 提供触觉、音频等富感知数据,支撑接触密集型操作;VTOUCH 等数据集则聚焦双臂协同与视觉触觉融合。工程实践中,企业正从单一数据集微调转向"海量开源预训练+场景化私有数据微调"的范式,通过遥操真机、仿真合成与在环数据飞轮三条路径,缓解物理交互数据稀缺瓶颈,加速VLA(Vision-Language-Action)模型的落地部署。


编辑:于腾凯
校对:林亦霖
图片


欢迎在评论区留言与本文作者互动交流!





作者简介





陈之炎,北京交通大学通信与控制工程专业毕业,获得工学硕士学位,历任长城计算机软件与系统公司工程师,大唐微电子公司工程师,现任北京吾译超群科技有限公司技术支持。目前从事智能化翻译教学系统的运营和维护,在人工智能深度学习和自然语言处理(NLP)方面积累有一定的经验。业余时间喜爱翻译创作,翻译作品主要有:IEC-ISO 7816、伊拉克石油工程项目、新财税主义宣言等等,其中中译英作品“新财税主义宣言”在GLOBAL TIMES正式发表。能够利用业余时间加入到THU 数据派平台的翻译志愿者小组,希望能和大家一起交流分享,共同进步。


数据派研究部介绍




数据派研究部成立于2017年初,以兴趣为核心划分多个组别,各组既遵循研究部整体的知识分享实践项目规划,又各具特色:


算法模型组:积极组队参加kaggle等比赛,原创手把手教系列文章;

调研分析组:通过专访等方式调研大数据的应用,探索数据产品之美;

系统平台组:追踪大数据&人工智能系统平台技术前沿,对话专家;

自然语言处理组:重于实践,积极参加比赛及策划各类文本分析项目;

制造业大数据组:秉工业强国之梦,产学研政结合,挖掘数据价值;

数据可视化组:将信息与艺术融合,探索数据之美,学用可视化讲故事;

网络爬虫组:爬取网络信息,配合其他各组开发创意项目。


点击文末“阅读原文”,报名数据派研究部志愿者,总有一组适合你~



转载须知


如需转载,请在开篇显著位置注明作者和出处(转自:数据派THUID:DatapiTHU),并在文章结尾放置数据派醒目二维码。有原创标识文章,请发送【文章名称-待授权公众号名称及ID】至联系邮箱,申请白名单授权并按要求编辑。

未经许可的转载以及改编者,我们将依法追究其法律责任。





关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU

点击“阅读原文”拥抱组织