VLA 安全综述:当大模型开始控制机器人,风险该如何被设计和评测?

VLA 安全综述:机器人从会说走向会行动,安全设计必须前置。

原文标题:一张全景图看懂 VLA 安全,机器人安全该如何设计

原文作者:数据派THU

冷月清谈:

文章解读了 VLA(Vision-Language-Action)安全综述论文,重点讨论具身 AI 从“生成文本”走向“执行动作”后带来的物理世界风险。VLA 模型连接视觉感知、语言理解和动作控制,安全问题不再局限于幻觉、越狱或有害输出,而可能表现为机械臂误抓、机器人碰撞、自动驾驶误判等现实后果。

论文提出一张 VLA 安全全景图,将问题按训练阶段与推理阶段拆分为训练时攻击、训练时防御、推理时攻击和推理时防御。相比 LLM,VLA 的攻击面更复杂,可能来自文本、图像、物理物体、传感器干扰甚至机器人初始状态。

防御方面,文章强调语义层面的“想明白”和控制层面的“刹得住”需要协同。未来更可行的方向是快慢双环架构:慢环负责规则理解和任务安全判断,快环负责实时动作过滤与碰撞避免。

评测方面,文章指出仿真安全不等于现实安全,VLA 安全评估应关注碰撞率、安全违规率、攻击成功率、异常恢复能力等指标,而不仅是任务完成率。

怜星夜思:

1、如果机器人已经有了“急停按钮”,还需要复杂的 VLA 安全机制吗?
2、VLA 机器人做错动作时,责任应该算在模型、开发者、部署方还是使用者身上?
3、仿真评测很便宜也可复现,为什么还不能证明机器人在现实中安全?
4、未来家用机器人普及后,普通用户最应该关心哪些安全指标?

原文内容

图片
来源:PaperWeekly
本文约2300字,建议阅读5分钟
本文解读 VLA 安全综述,剖析具身 AI 物理风险、攻防与评测体系。


当大模型不再只是聊天,而是开始控制机械臂、车辆和服务机器人,AI 安全问题就不再只是“说错话”,而可能变成真实世界里的物理风险。


过去我们谈大模型安全,更多关注的是幻觉、越狱、有害文本生成。  


这些问题当然重要,但它们大多还停留在屏幕和语言空间里。


但 Vision-Language-Action(VLA)模型正在改变这一点。


VLA 模型把视觉感知、语言理解和动作生成连接在一起,让机器人能够根据自然语言指令观察环境,并直接输出控制动作。也就是说,大模型正在从“会说话”走向“会行动”。


这时,一个更关键的问题出现了:


如果模型不仅说错了,还真的做错了呢?


机械臂抓错物体、自动驾驶误判行人、服务机器人执行危险指令,这些后果都不再是可删除的文本,而是可能发生在现实世界中的不可逆风险。


近期,研究团队发布了综述论文 Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms,系统梳理了 VLA 模型在攻击、防御、评测和真实部署中的安全问题。


论文标题:

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

论文链接:

https://arxiv.org/abs/2604.23775

项目仓库:

https://github.com/LiQiiiii/Awesome-VLA-Safety


1、一图看懂VLA安全全景


〓 Figure 2: VLA safety landscape


这篇综述最核心的贡献,是给 VLA 安全画出了一张统一的“全景地图”。


论文将 VLA 安全问题按照两个时间轴来组织:


  • 攻击发生在什么时候:训练阶段,还是推理阶段?

  • 防御发生在什么时候:训练时防御,还是部署时防御?


在这个框架下,原本分散在机器人学习、对抗攻击、AI 对齐和自动驾驶安全中的研究,被重新整理为四类核心问题:


训练时攻击、训练时防御、推理时攻击、推理时防御。


这让我们可以更清楚地回答一个问题:


当一个机器人由 VLA 模型驱动时,它到底可能在哪里出问题,又应该在哪里被保护?


2、VLA为什么不能直接套用LLM安全方案?


LLM 安全主要处理文本输出。


但 VLA 安全处理的是“感知—语言—动作”的闭环系统。

〓 Figure 3: General architecture of VLA models


VLA 模型通常包括视觉编码器、语言骨干模型和动作解码器。视觉模块负责理解环境,语言模型负责整合任务指令和上下文,动作解码器则直接生成机器人控制命令。


这意味着 VLA 的安全挑战比 LLM 更复杂:


第一,攻击面是多模态的。攻击者不仅可以修改语言指令,还可以利用视觉贴片、物理物体、环境干扰,甚至机器人自身状态来触发异常行为。


第二,错误会进入物理世界。文本错误可以删除,但错误动作可能已经造成碰撞、损坏或伤害。


第三,VLA 存在实时性约束。很多机器人场景中,防御机制不能无限增加推理时间,否则“反应慢”本身就可能变成安全隐患。


第四,动作错误会沿着长时序轨迹累积。一次很小的感知偏差,可能经过多步执行后演变为严重失败。


3、攻击:不只是在图像上贴一个 patch


在训练阶段,攻击者可以向机器人示范数据中注入带有触发器的样本,让模型在学习过程中形成隐藏关联:平时表现正常,一旦触发器出现,就执行异常动作。


〓 Figure 4: Training-time attacks on VLA models


这些触发器不一定是明显的像素噪声。


它可以是一段特定文本、一个视觉 patch、一个普通物理物体,甚至是机器人的某个初始关节状态。


这类攻击的危险之处在于:模型不是在部署时临时“被骗了”,而是在训练阶段就已经学会了错误关联。等到真实环境中触发器出现时,异常行为才会被激活。


而在推理阶段,攻击方式会进一步扩展。


自然语言指令可以诱导语义越狱;视觉扰动可以破坏感知—动作映射;物理环境中的标志、物体移动或传感器干扰,也可能让机器人做出错误决策。


4、防御:机器人既要“想明白”,也要“刹得住”


VLA 防御最困难的地方,是安全性和实时性之间的矛盾。


高层语义推理更聪明,可以理解“远离危险物体”“不要碰撞人类”“不要执行不安全指令”等复杂规则。


但这类推理通常较慢,很难直接放进高频控制循环。


底层控制方法反应更快,可以通过控制屏障函数、运动学约束或阻抗控制来快速过滤危险动作。


但它们通常缺少语义理解,只能处理几何和物理层面的安全约束。

〓 Figure 7: Decoupled inference-time defense architecture


因此,论文总结出一个重要方向:未来 VLA 防御可能需要“快慢双环”架构。


  • 慢环:负责语义理解、规则解析和任务级安全判断;

  • 快环:负责高频动作过滤、碰撞避免和物理约束执行。

换句话说,真正安全的具身智能系统不能只依赖模型“想清楚”,也不能只依赖控制器“刹得住”,而需要二者协同工作。


5、评测:仿真里安全,不代表现实中安全


目前很多 VLA 安全评测仍然主要依赖仿真环境。


仿真环境可控、可复现、成本低,但真实世界更复杂。

〓 Figure 9: Simulation-to-reality gap


光照变化、传感器噪声、机械磨损、通信延迟、执行器误差、不可预测的人类行为,都会让仿真中看似安全的策略在现实中失效。


因此,VLA 安全评测不能只看任务成功率。


更合理的评测体系还需要关注碰撞率、安全违规率、攻击成功率、性能下降率、安全—性能权衡,以及模型在异常情况下的恢复能力。


尤其是在自动驾驶、工业制造、医疗辅助、家庭服务机器人等场景中,“能完成任务”和“能安全完成任务”并不是一回事。


6、结语:具身智能时代,安全不应是能力之后的补丁


VLA 模型代表了 AI 从语言智能走向具身智能的重要一步。


但当模型开始直接控制物理动作时,安全问题也发生了本质变化。


它不再只是模型是否会拒答、是否会输出有害文本,而是机器人是否会碰撞、是否会误操作、是否能在复杂环境中及时停止和恢复。


这篇综述给出的核心提醒是:


在 VLA 时代,安全必须成为和能力同等重要的设计目标。


未来的通用机器人不能只追求更强的理解能力、更高的任务成功率和更复杂的操作技能。


它们还必须具备可评测、可监控、可恢复、可部署的安全机制。


只有这样,VLA 模型才能真正从实验室走向现实世界,从“会看、会说”,走向“会安全地行动”。


7、作者与项目


该综述由来自 National University of Singapore、Monash University、Peking University 等机构的研究者共同完成。项目仓库 Awesome-VLA-Safety 将持续整理 VLA 安全相关论文、方法、基准和资源,欢迎社区关注与补充。


编辑:于腾凯

校对:林亦霖



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU


我回答“急停按钮够不够”这个问题:不太够。急停更像最后一道保险,类似汽车安全气囊,不是刹车系统本身。真正的问题是,机器人最好在危险动作发生前就识别出来,而不是等人发现不对劲再拍按钮。

针对责任归属这个问题,我倾向于不能只看“最后是谁下的指令”。VLA 是一个系统工程,训练数据、模型设计、部署环境、用户操作都会影响结果。比较合理的是按可预见性和控制权分摊责任。

3 个赞

如果真买家用机器人,我会优先关心“失败时会怎样”。任务成功率当然重要,但机器人不可能永远成功。它失败时是停下来求助,还是继续硬执行,这个差别非常大。

2 个赞