从 VLA 走向 WBI:人形机器人“大脑”转向全身协同

具身智能正从末端动作预测转向移动、平衡与操作一体化的全身协同。

冷月清谈:

文章梳理了具身智能从视觉-语言-动作模型(VLA)向全身智能(WBI)演进的趋势。传统 VLA 多在固定基座或桌面场景中训练,主要预测末端位姿,难以覆盖双足人形机器人的移动、重心转移、动态平衡和多触点操作。传统全身控制(WBC)通常位于执行底层,只能被动补偿上层指令,容易割裂行走与操作。WBI 则希望把语义理解、物理推理和全身控制紧密结合,让机器人协调躯干与四肢完成复杂任务。业界已认可全身协同的重要性,但对分层架构还是端到端策略、训练数据如何采集、动作生成引擎如何设计仍未形成统一路线。Google DeepMind 等团队正通过多模型协作,在长程推理与本地高频控制之间寻找平衡。

怜星夜思:

1、WBI 应该坚持分层架构,还是最终走向一个端到端的全身控制模型?
2、训练全身智能时,最稀缺的数据究竟是真机动作、人体运动,还是带接触力信息的仿真数据?
3、判断机器人是否真正具备 WBI,除了任务成功率,还应该看哪些指标?
4、WBI 发展成熟后,现有 VLA 和传统 WBC 会被替代,还是会继续作为系统组件存在?

原文标题:从 VLA 到 WBI,具身智能的大脑在如何改变?

原文作者:机器之心

原文内容

本文来自PRO会员通讯内容,文末关注「机器之心PRO会员」,查看更多专题解读。


在过去几年间,具身智能领域流行的 VLA 路线极大地推动了机器人对开放环境的认知与泛化操作能力。然而,大多基于桌面或双臂静态基座的数据进行训练的 VLA 在具身智能体进入双足人形机器人时,其动作空间无法完成数十个自由度、处于严重欠驱动状态且需要时刻维持动态平衡运动需求。以更高的协调性为目标,业界近期的注意力开始聚焦于全身智能(WBI)的目标,以求设计出能够真正掌握身体的具身大脑。



目录

01. 如何理解具身智能的「WBI」新目标?
WBI 与 WBC、VLA 有何关联?业界对 WBI 有哪些共识与非共识?
...

02. 技术路线的非共识下,近期工作如何实现 WBI?
分层架构如何实现更优的全身协调?WBI 需要什么数据?端到端模型是否更容易实现 WBI 的目标?...


如何理解具身智能的「WBI」新目标?

1、在人工智能向物理世界延伸的进程中,具身智能的研究热点正在「高层语义理解」转向「底层物理掌控」,其「大脑」在表征维度、控制接口、物理推理能力以及数据感知源头上经历着持续重构。

2、过去几年,以视觉-语言-动作(VLA)模型为代表的工作在固定基座或局限场景中取得了突破。然而,当具身智能体拓展至双足人形机器人等高自由度构型时,业界开始追求将导航移动、姿态平衡与灵巧操作在策略层面深度耦合的「Whole-Body Intelligence」(WBI)范式。[1-1] [1-2] [1-3] 

① 传统 VLA 模型的大脑试图将物理世界抽象为「视觉输入 $$\rightarrow$$ 末端位姿(轨迹)」的简单映射,但容易忽略基座移动、躯干扭转与重心转移。

② 在传统架构中,底盘移动或双足行走被作为独立模块切分出去。上层规划器通常只给出末端轨迹或离散的足迹指令,全身控制(WBC)只能被动地在底层进行力矩补偿,导致机器人无法实现真正的「全身协同」。

③ 近期兴起的全身智能(WBI)强调机器人能够原生理解物理世界的力学规律,并通过单一或紧密耦合的神经网络策略,将高级多模态语义指令直接转化为包含全身重心调整、四肢协同、多触点平衡以及精细力控的连贯运动输出的能力。

3、在 WBI 的目标下,业界尝试推动具身大脑从「局部位姿预测器」向「全身物理协调大脑」的跃迁,探索更具协调性的具身智能系统。

① 香港大学助理教授、源策未来创始人李弘扬在 7 月中旬的 RSS 2026 的演讲中阐述了从「全身控制(WBC)」向「全身智能(WBI)」演进的范式转移,指出机器人未来需要实现覆盖移动、平衡、接触和操作的全身智能。[1-4] 】

② 谷歌 DeepMind 在 7 月末发布的 Gemini Robotics 2 介绍文档中强调了由三款模型组合形成的「智能层」(Intelligence Layer)及其为机器人带来的全身智能。[1-1] 

Current Robotics、与 Symbiosis Robotics(共生知行)等初创团队同样在最新成果中展示了机器人系统在全身协调性的突破,并引起大量关注。[1-5] [1-6] 


技术路线的非共识下,近期工作如何实现 WBI?

1、尽管「走向全身智能」已成为具身智能学术界与工业界对下一阶段的共同追求,但由于不同团队在系统架构的选择、数据采集范式的定义以及动作生成引擎的底层设计上均存在既有的非共识,业界对于如何构建 WBI 系统同样存在路线差异。

2、Google DeepMind 在 7 月 Gemini Robotics 2 工作中采用了一种分工明确的三模型堆栈架构,通过兼顾大模型的长程推理能力与本地的高频响应需求。

① 该工作通过组合 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2(VLM)和轻量级 VLA 模型 Gemini Robotics On-Device 2 三款模型,以「ER 2」作为高级大脑进行决策,协调 VLA 执行动作完成任务...


 关注👇🏻「机器之心PRO会员」,前往「收件箱」查看完整解读 

更多往期专题解读内容,关注「机器之心PRO会员」服务号,点击菜单栏「收件箱」查看。

回答“哪种数据最稀缺”:我认为是高质量真机交互数据,尤其是同步记录视觉、本体状态、足底压力、关节力矩和接触变化的数据。人体运动只能提供姿态先验,仿真数据又存在动力学偏差,真正让机器人学会处理打滑和碰撞,还是得靠真机。

2 个赞

我觉得长期还是会靠近端到端,但未必是“一个模型包办一切”。更可能是共享表征加多个控制头,再保留安全控制器兜底。完全割裂的模块会损失信息,纯端到端又太难验证,最后大概率是折中方案。

回答“如何评价 WBI”:至少要同时考察动态稳定性、接触鲁棒性、能耗、动作平滑度、恢复能力和泛化范围。完成一次拿取不算难,移动中受到扰动还能保持平衡,并继续完成操作,才更接近全身智能。