PhiZero:用“物理语言”让世界模型理解运动与交互

PhiZero 用“物理语言”压缩并预测世界变化,让 AI 更懂运动、交互与物理因果。

冷月清谈:

中科院自动化所团队提出 PhiZero,一种围绕“物理语言”构建的世界模型。它不只追求视频画面逼真,而是尝试把真实世界中的运动、碰撞、流体、爆炸、机器人动作等状态变化压缩成可预测的离散符号。PhiZero 采用 Reason-then-Render 框架:先用 Physical Language Tokenizer 将视频中的动态变化转写为物理语言,再由 Physical Language Reasoner 根据当前图像和控制意图预测后续符号,最后通过扩散解码器渲染为视频。文章展示了 PhiZero 在物理视频生成、运动迁移、仿真到现实、可控世界探索、自动驾驶场景和机器人交互预测中的能力。实验显示,它在多个物理生成与理解基准上取得领先或有竞争力的表现,说明这种中间表示不仅能提高视频生成效率,也可能为具身智能、机器人技能迁移和多模态时空理解提供新路径。

怜星夜思:

1、如果 AI 真的学会了“物理语言”,它和现在的视频生成模型最大的区别会是什么?
2、“物理语言”这种离散符号会不会真的对应碰撞、重力、摩擦这些概念?还是只是人类强行起了个好听的名字?
3、PhiZero 展示了人到机器人、仿真到现实的运动迁移,这对机器人训练会有多大影响?
4、用视频数据自监督学物理,会不会学到很多错误常识?比如电影特效、剪辑、慢动作会不会污染模型?

原文标题:不再止步于自然语言!PhiZero让世界模型学会「物理语言」

原文作者:机器之心

原文内容


从物理视频生成到运动迁移,再到可控世界建模。


如果说自然语言帮助 AI 读取人类记录的知识,那么 PhiZero 所探索的 “物理语言”,则试图让 AI 读懂真实世界中的运动、交互与变化。




  • 论文名称:PhiZero: A World Model Built Around Physical Language 

  • 项目网站:https://Phi-Zero.github.io/

  • 研究团队:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang  

  • 所属机构:中国科学院自动化研究所(NLPR, CASIA)


语言让经验得以保存,也让知识能够跨越时间与个体持续传播。人类借助语言描述日常生活、总结科学规律、书写历史与程序;大语言模型则通过学习这些内容,逐步掌握概念表达、知识组织,以及面向数字信息的理解与推理。


当 AI 开始进入现实环境,仅靠自然语言是否足以支撑它认识世界?进一步说,除了描述事物的文字,机器能不能学习一套直接表征物理世界细粒度变化的符号系统?


PhiZero 从这个问题出发,希望为世界的状态演化建立一种可学习、可预测的新表示。


从结果开始:PhiZero 展示了哪些能力?


1. 生成具有连贯物理过程的视频


无论是海水冲击岩石、液体灌入容器,还是物体坠入热油、金属罐发生爆炸,PhiZero 都可以对后续过程进行建模。它追求的不仅是每一帧足够逼真,也要求动作产生的影响能够延续,整段事件在时间上保持完整。


图片


场景虽然跨越海浪、流体、燃烧与爆炸,模型面对的核心任务却相同:预测当前状态将如何继续发展。


2. Motion Transfer:让同一种变化发生在不同载体上


在物理语言中,重点是变化本身,而非执行变化的具体对象。基于这一特点,一段运动所对应的状态转移可以离开原始视频,被赋予新的外观、身体结构或视觉风格。


Human Body → G1 Humanoid


对于真人运动,PhiZero 可以先抽取其中的状态变化,再让 Unitree G1 人形机器人呈现相应过程。这项迁移不以成对的人类 — 机器人训练视频为前提。


图片

图中包含四组跨身体形态的迁移结果;各组由左侧真人输入与右侧 G1 输出组成。


Human Hand → Sharpa Dexterous Hand


相似的迁移也能发生在手部操作上:人手与物体接触、完成抓握及转动手腕的过程,可以在 Sharpa 灵巧手上重新呈现。


图片


Simulation → Reality


这种机制同样能够连接仿真域与真实域。模型保留仿真片段所包含的动作和交互,再以真实场景的初始外观为基础,生成对应的后续视频。


图片

每行展示同一个交互过程:仿真输入位于左侧,真实视觉域中的重建结果位于右侧。


3. 从单张图像出发,连续探索可交互世界


PhiZero 能够接收持续输入、随时更新的控制信号。每当移动方向或观察视角发生改变,模型都会据此向前生成世界,同时努力维持环境布局、关键地标及空间关系的一致。


图片

四段演示分别从异星地表、月下湖景、滨海村庄和落日原野展开。


4. 由驾驶动作决定未来画面


面对相同的道路起始帧,不同控制轨迹应当导向不同结果。PhiZero 会结合转向的方向与幅度生成相应未来;在下方四个案例中,多条备选控制信号及其生成视频被并列展示。


图片


5. 预测机器人动作带来的视觉后果

在机器人任务中,抓取、舀取和双臂配合等动作轨迹可以先被编码为物理语言,再被还原为细致的交互视频。


图片


视频看起来真实,为什么还不够?


近年来,视频世界模型的生成能力不断提升。输入一幅图像或一条文本指令,模型已经可以合成视觉效果出色的未来片段。但是,画面具有真实感,并不能保证其中发生的事情符合物理规律。


网球碰到玩具鸭之后,后者应当怎样移动?物体坠入滚烫的油中,会引发什么样的液体响应?金属容器爆炸时,火光、碎片和投影又该如何随时间共同改变?要回答这些问题,模型需要超越表面的像素质量,理解状态之间的转移、动作造成的影响,以及事件向后展开的因果关系


传统方法往往直接在维度极高的像素空间里生成未来,物理世界的状态转移也因此被包裹在巨大的视觉预测网络之中。这样的模型擅长合成下一段画面,却缺少一个专门用于表达 “世界接下来怎样变化” 的中间层。PhiZero 正是针对这一缺口提出。


“物理语言” 究竟是什么?


通过在大规模真实视频上进行自监督学习,PhiZero 获得了一组容量紧凑的离散表示,并将其称为物理语言(Physical Language)。这套表示不会重复记录颜色、纹理等静态视觉细节,也无意覆盖画面里的全部像素;它专门编码另一类信息:


对象怎样移动、彼此如何作用,以及整个场景从一个时刻过渡到下一个时刻的方式。


以倾倒液体为例,容器的形状与材质已经包含在首帧中;倾斜、流出、扩散等动态过程,则交由物理语言承载。如此一来,描述外观的信息与描述演化的信息被明确分工。


这种分工使状态变化具备复用的可能。即便更换场景、材质或对象形态,原有的运动和交互规律仍可被保存,并进一步参与组合与迁移。


图片

画面中的对象与环境已经改变,贯穿事件的状态转移仍然保持一致。


PhiZero 的方法:推演在前,渲染在后


以物理语言为中间层,PhiZero 构建了 Reason-then-Render(先推理、后渲染)的世界模型框架。



这套框架由两个主要阶段构成:


阶段一:将视频转写为物理语言。Physical Language Tokenizer 识别连续世界状态之间的差异,并把这些差异编码成离散符号序列。场景和对象的静态外观由第一帧提供,视觉细节则可以借助预训练扩散解码器恢复,因此,数量有限的符号能够集中记录真正发生的动态变化。


阶段二:在物理语言中预测后续事件。Physical Language Reasoner 接收当前图像与动作意图,按照自回归方式生成未来的符号序列;扩散解码器随后读取这些符号,将推理出的演化过程转换为视频。


因此,模型对未来的生成可以理解为一条三段式链路:

识别此刻的世界 → 推算后续的状态变化 → 绘制变化对应的视觉结果

物理语言对视频动态进行了高度压缩。一段 4 秒长、8 FPS、分辨率为 512×896 的视频,在首帧之后仅需 256 个离散符号表示其状态演化;相比之下,标准视频 VAE 会使用 44,800 个连续视觉 token。重建实验表明,即使符号数量大幅减少,模型依然获得领先质量。这说明被压缩表示优先保留了与世界演化相关的信息,而不是反复存储静态外观。


物理语言从哪里来?


与人类语言一样,物理语言也需要从大量经验中形成。



训练数据经历了逐层筛选。研究团队先对约 5 万小时真实世界视频进行去重、画质过滤和镜头级筛选,从中保留约 1 万小时未标注内容,用于训练 Physical Language Tokenizer。接下来,真实视频与仿真视频共同构成约 500 万个时长 4 秒的片段,帮助模型覆盖更多状态转移。最终,约 100 万个运动充分、物理事件明确的样本被进一步选出,用来提升 Physical Language Reasoner 对世界演化的预测能力。


整个学习过程不需要人为规定某个符号必须表示 “碰撞”“重力” 或 “流体”。通过不断压缩视频、还原画面并预测未来,模型自行发现哪些变化值得记录,又该如何将它们组织成连续事件;物理语言由此从数据中逐渐形成。


用实验检验:它是否真的更理解物理世界?


图片

这里给出四组 Physics-IQ 实例,橙色框对应 PhiZero 生成的视频。


研究团队分别从物理视频生成与物理事件理解两个方向对 PhiZero 进行了评估。

在生成侧,PhiZero 在Physics-IQ Verified、PhyGround、WorldModelBench 三项基准中取得领先成绩,相关指标覆盖结果是否一致、过程是否遵循物理规律,以及整体世界建模水平。相较于直接在像素空间生成视频的模型,它更准确地表现出碰撞引起的移动、重力造成的形变、连续触发的反应,以及随对象位置改变的阴影。


在理解侧,PhiZero 在 IntPhys2、LikePhys、YoCausal 三项测试中也达到领先或具有竞争力的表现。模型可以把两段视频映射到物理语言空间并比较其合理程度,进而找出不符合直觉物理或因果逻辑的事件。


由此可见,物理语言不仅是一种服务于生成的高效编码,也提供了评判现实中哪些事件更有可能发生的表示基础。


为 AI 打开一条通往物理世界的新通道


自然语言之所以强大,并不只是因为它能给事物命名,还因为知识可以借助语言被抽象、重组、推导和传递。PhiZero 希望把类似的能力带到对物理变化的表达之中。PhiZero 则把连续的世界演化压缩成可传递、可推断的符号,使视频生成、物理理解、动作控制与运动迁移能够围绕同一个表示体系建立联系。


面向未来,规模更大的训练数据、更强的模型以及跨度更长的预测,有望继续拓展物理语言的表达范围。它还可能支持多模态模型理解时空关系、帮助具身智能体制定计划,并推动技能在不同机器人形态之间迁移。


文字让 AI 接触到了人类书写的数字知识;PhiZero 所做的尝试,则是让机器进一步读取运动与交互中蕴含的世界规律。


让 AI 不只看见世界,也学会物理世界自己的语言。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

回答“物理语言是不是概念符号”:我倾向于它不一定一一对应“碰撞”“重力”这种人类词汇。深度模型学到的 token 很可能是混合特征,比如某类运动模式、接触变化、局部形变共同组成的编码。叫语言更多是强调可压缩、可组合、可预测。

2 个赞

如果说现在的视频模型是“看起来像真的”,那物理语言想解决的是“发生得像真的”。差一个字,工程难度差很多。尤其是机器人和自动驾驶,光好看没用,预测错了是会翻车的。

1 个赞

回答“对机器人训练的影响”:如果这条路走通,意义很大。现在机器人学习很缺真实交互数据,仿真和现实又有 sim-to-real gap。物理语言如果能保留动作和交互关系,同时换掉外观和载体,确实可能降低数据采集成本。

2 个赞

我觉得污染不可避免,但不一定全是坏事。模型如果有足够多的真实样本和对比学习机制,可能会把异常视频当成低概率事件。问题在于它能不能知道“这是风格化表达”,而不是“世界本来如此”。

1 个赞

短视频平台要是混进训练集,AI 可能会认为所有人摔倒前都要配一段 BGM,所有水杯落地都会慢镜头旋转三圈。物理语言也得防电子榨菜污染。

2 个赞

我觉得别急着把它理解成人类物理课本里的公式。它可能不会有一个 token 明确写着“摩擦系数”,但如果模型能稳定预测滑动、停止、反弹,那说明它确实捕捉到了一些物理规律的影子。

1 个赞