RoboColiseum开放:用高保真仿真给具身智能模型做统一评测

RoboColiseum开放,用高保真仿真为具身智能模型提供统一、可复现评测。

冷月清谈:

RoboColiseum 是一个面向具身智能模型的常态化仿真评测平台,试图解决当前领域缺少统一、可复现评测标尺的问题。平台强调高保真仿真与真实机器人表现的对齐,公布的实测相关性为 89.5%,相同模型在仿真与真机中的评测差异小于 10%。

平台目前提供 4 类能力子榜和 78 个评测任务,覆盖指令跟随、空间理解、扰动适应和通用操作,不再只看单一成功率,而是记录任务子步骤、失败位置和不同场景下的泛化表现。

开发者可通过标准接口接入本地推理服务,无需上传模型代码和权重,最快 5 分钟完成提交、30 分钟获得评测结果。平台还提供 ACoT-VLA、π0、π0.5、GR00T 等主流具身模型基线成绩及部分复现资源,方便研究者在统一条件下做横向比较。内测以来已有 40 多支团队参与训练和评测。

怜星夜思:

1、仿真评测和真机表现接近 90% 对齐,大家觉得这已经够用了吗?还是说具身智能最终必须靠大量真机测试说话?
2、具身智能模型排行榜会不会像大语言模型榜单一样,被大家“刷榜”?平台该怎么防止模型只会针对测试集优化?
3、RoboColiseum 把指令跟随、空间理解、扰动适应、通用操作分成四个子榜,你觉得这四类能力足够评价一个具身模型吗?
4、如果以后具身智能都有统一评测平台,会不会改变机器人论文和产品 Demo 的可信度?

原文标题:具身智能仿真「竞技场」RoboColiseum来了:真机对齐度近90%,已有40+团队同场打擂

原文作者:机器之心

原文内容

图片
机器之心发布


当前,具身智能领域正经历着模型架构与算法的快速迭代。然而,在模型数量激增的同时,“评测标尺缺位”的痛点也日益凸显:行业缺乏统一、可复现且能真实反映模型能力的评测基准,开发者往往难以准确衡量模型的真实边界与具体短板。


针对这一行业共性难题,8 月 14 日,常态化具身智能仿真评测平台 RoboColiseum 发布。该平台旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。


RoboColiseum 自内测上线以来,已有海内外 40 多支队伍在平台开展模型训练与评测。


  • 仿真评测平台:http://robocoliseum.ai/ 



聚焦 Sim2Real 瓶颈

建立高保真仿真与实机对齐


模型在仿真环境中的优异表现,能否延续到真实物理世界?进入现实场景后,光照、材质、相机噪声、物体接触以及机器人初始位置和姿态的变化,都可能导致模型性能下降。因此,如何通过仿真评测准确衡量模型的真实能力,仍是一个关键难题。


RoboColiseum 基于高保真仿真环境构建,在环境渲染和物理交互方面高度还原真实世界。经实测验证,仿真评测与实机部署的相关性达到 89.5%,相同模型在仿真环境与真实世界中的评测差异小于 10%。仿真评测由此可以作为真机表现的可靠参考,帮助开发者在进入成本更高、周期更长的真机测试前,快速完成模型筛选与问题定位。


这一验证链路也是双向的:使用真机数据训练的模型可以直接提交仿真评测,仿真数据训练的模型也能够通过真实机器人验证迁移效果。虚拟环境与真实世界由此实现双向打通,让开发者能够以更低成本获得高置信度结论,显著缩短 “训练 — 评测 — 改进 — 部署” 的迭代周期。


图片

仿真环境高度还原真实世界



Sim2Real 实验对比


告别单一成功率指标

构建四维细粒度归因体系


传统评测往往用一套综合成功率概括模型表现,RoboColiseum 则围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。目前,平台已推出 4 类能力子榜、78 个高保真仿真评测任务。未来还会结合产学研需求,持续更新任务和评测维度


4 类能力子榜:


  • 指令跟随(Instruction Following),考察模型能否理解颜色、数量、形状、尺寸、类别、逻辑与常识等自然语言信息,找对目标并执行正确动作。

  • 空间理解(Spatial Reasoning),检验模型对绝对位置、相对关系、尺寸与序号排序、堆叠和空间对齐等信息的理解能力。

  • 扰动适应(Robustness),通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。

  • 通用操作(General Manipulation),覆盖开门、倾倒、舀取、上货、分拣、整理桌面和双臂协作等多步骤任务,衡量模型组合运用原子操作技能的能力。


为了让失败原因可追溯,每项任务都会被进一步拆解为多个子步骤。评测平台不仅判断最终任务是否成功,也会记录模型完成了哪些步骤、在哪一步失败以及在不同场景中的泛化能力。


在评测设计上,RoboColiseum 通过大规模、多样化样本降低单次测试的偶然性,并采用域随机化、训练集与测试集隔离、分布内与分布外测试等机制,减少模型依赖固定布局或数据规律 “走捷径” 的可能,提高评测结果的稳定性。


四维评测体系


AI agent 一键提交

30 分钟获得评测结果


对于开发者而言,高质量评测往往伴随着复杂的环境配置、资产适配和算力成本,搭建完整评测链路耗时耗力。


RoboColiseum 将这些环节封装为一套自动化服务。开发者从注册到提交最快仅需 5 分钟,一键部署模型,最快 30 分钟即可完成仿真评测。平台将自动返回分项成绩、任务步骤结果及模型推演视频,直观呈现机器人在每个任务中的执行过程。


借助 AI Agent,开发者还可通过自然语言对话完成数据下载、模型训练、本地验证和评测提交。模型代码和权重无需上传,只需在本地部署推理服务并接入标准接口,即可连接平台开展评测。


图片

5 分钟提交注册,30 分钟获得评测结果


引入主流模型基线

开发者可自行复现


RoboColiseum 已提供 ACoT-VLA、π0、π0.5、GR00T 等国际具身基座模型的基线成绩。开发者提交自己的模型后,即可在四个维度上与主流模型进行逐项比较,快速判断自身优势与不足。


同时,RoboColiseum 提供各基线模型在平台任务上的训练代码及对应权重,开发者可自行复现训练与评测过程、核验基线成绩,并在统一条件下开展模型对比与后续研究。


RoboColiseum 的名字从何而来?


Coliseum 原指古罗马圆形竞技场,一个公开、中立、谁都可以登台的竞技场。RoboColiseum,既是模型同场比较的 “竞技场”,也是开发者反复测试、定位短板和持续迭代的 “训练场”。


平台的长期目标,是将真实世界中的复杂任务转化为标准化、可复现、可持续更新的评测体系,让评测成为具身模型研发流程中的基础工具。


当模型能够在同一把尺子下比较和改进,具身智能的发展也将从精心挑选的成功演示,走向更加可靠、透明和可验证的真实进步。平台也期待更多开发者开放模型,共建具身智能生态。


RoboColiseum 现已正式开放,欢迎全球开发者入场!



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

我觉得少了一个很重要的:失败恢复能力。现实里机器人不可能每次都一次成功,东西滑了、门没拉开、杯子歪了,能不能自己补救很关键。现在很多评测只看“成不成功”,但不太看“失败后会不会慌”。

3 个赞

回答“仿真评测和真机表现接近 90% 对齐够不够用”这个问题:我觉得够不够用要看阶段。早期筛模型、找明显短板,90% 相关性已经很有价值了;但如果要上仓储、工厂、家庭这种真实场景,最后一公里还是必须真机验证。仿真更像体检报告,不是手术室。

3 个赞

回答“会不会改变 Demo 可信度”:会,但不会一夜之间改变。因为真实产品还是要看场景适配、硬件稳定性、成本和维护。评测平台能解决一部分“模型到底行不行”的问题,但不能直接证明“产品能不能卖”。

1 个赞

这个问题很现实。LLM 榜单已经证明了:榜单一火,模型就开始学榜单的口味。具身智能可能更麻烦,因为任务场景、物体摆放、语言指令都可能被“猜规律”。所以排行榜要有,但不能神化排行榜。

2 个赞

我觉得刷榜未必全是坏事。只要评测设计得够好,大家为了刷榜去提升鲁棒性、空间理解、指令跟随,本身也能推动模型进步。怕的是榜单太窄,最后大家练成了“竞技场特化机器人”,出了考场啥也不会。

1 个赞

这个问题我站仿真一票。不是因为仿真完美,而是真机太贵了。你让每个实验室都买机器人、搭场景、调相机,很多想法还没验证就被成本劝退了。先在 RoboColiseum 这种平台上打个预选赛,再上真机决赛,比较现实。

1 个赞

回答“四个子榜够不够”这个问题:作为第一版我觉得比较合理,基本覆盖了从听懂话、看懂空间、抗干扰到执行复杂动作的链路。但如果要评价真正能进家庭的机器人,还需要长期记忆、任务规划、安全约束和人机交互这些维度。

1 个赞