VLA 安全综述:机器人从会说走向会行动,安全设计必须前置。
原文标题:一张全景图看懂 VLA 安全,机器人安全该如何设计
原文作者:数据派THU
冷月清谈:
论文提出一张 VLA 安全全景图,将问题按训练阶段与推理阶段拆分为训练时攻击、训练时防御、推理时攻击和推理时防御。相比 LLM,VLA 的攻击面更复杂,可能来自文本、图像、物理物体、传感器干扰甚至机器人初始状态。
防御方面,文章强调语义层面的“想明白”和控制层面的“刹得住”需要协同。未来更可行的方向是快慢双环架构:慢环负责规则理解和任务安全判断,快环负责实时动作过滤与碰撞避免。
评测方面,文章指出仿真安全不等于现实安全,VLA 安全评估应关注碰撞率、安全违规率、攻击成功率、异常恢复能力等指标,而不仅是任务完成率。
怜星夜思:
2、VLA 机器人做错动作时,责任应该算在模型、开发者、部署方还是使用者身上?
3、仿真评测很便宜也可复现,为什么还不能证明机器人在现实中安全?
4、未来家用机器人普及后,普通用户最应该关心哪些安全指标?
原文内容
来源:PaperWeekly本文约2300字,建议阅读5分钟本文解读 VLA 安全综述,剖析具身 AI 物理风险、攻防与评测体系。
当大模型不再只是聊天,而是开始控制机械臂、车辆和服务机器人,AI 安全问题就不再只是“说错话”,而可能变成真实世界里的物理风险。
当大模型不再只是聊天,而是开始控制机械臂、车辆和服务机器人,AI 安全问题就不再只是“说错话”,而可能变成真实世界里的物理风险。
过去我们谈大模型安全,更多关注的是幻觉、越狱、有害文本生成。
这些问题当然重要,但它们大多还停留在屏幕和语言空间里。
但 Vision-Language-Action(VLA)模型正在改变这一点。
VLA 模型把视觉感知、语言理解和动作生成连接在一起,让机器人能够根据自然语言指令观察环境,并直接输出控制动作。也就是说,大模型正在从“会说话”走向“会行动”。
这时,一个更关键的问题出现了:
如果模型不仅说错了,还真的做错了呢?
机械臂抓错物体、自动驾驶误判行人、服务机器人执行危险指令,这些后果都不再是可删除的文本,而是可能发生在现实世界中的不可逆风险。
近期,研究团队发布了综述论文 Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms,系统梳理了 VLA 模型在攻击、防御、评测和真实部署中的安全问题。
论文标题:
Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
论文链接:
https://arxiv.org/abs/2604.23775
项目仓库:
https://github.com/LiQiiiii/Awesome-VLA-Safety
1、一图看懂VLA安全全景
〓 Figure 2: VLA safety landscape
这篇综述最核心的贡献,是给 VLA 安全画出了一张统一的“全景地图”。
论文将 VLA 安全问题按照两个时间轴来组织:
-
攻击发生在什么时候:训练阶段,还是推理阶段?
-
防御发生在什么时候:训练时防御,还是部署时防御?
在这个框架下,原本分散在机器人学习、对抗攻击、AI 对齐和自动驾驶安全中的研究,被重新整理为四类核心问题:
训练时攻击、训练时防御、推理时攻击、推理时防御。
这让我们可以更清楚地回答一个问题:
当一个机器人由 VLA 模型驱动时,它到底可能在哪里出问题,又应该在哪里被保护?
2、VLA为什么不能直接套用LLM安全方案?
LLM 安全主要处理文本输出。
但 VLA 安全处理的是“感知—语言—动作”的闭环系统。
〓 Figure 3: General architecture of VLA models
VLA 模型通常包括视觉编码器、语言骨干模型和动作解码器。视觉模块负责理解环境,语言模型负责整合任务指令和上下文,动作解码器则直接生成机器人控制命令。
这意味着 VLA 的安全挑战比 LLM 更复杂:
第一,攻击面是多模态的。攻击者不仅可以修改语言指令,还可以利用视觉贴片、物理物体、环境干扰,甚至机器人自身状态来触发异常行为。
第二,错误会进入物理世界。文本错误可以删除,但错误动作可能已经造成碰撞、损坏或伤害。
第三,VLA 存在实时性约束。很多机器人场景中,防御机制不能无限增加推理时间,否则“反应慢”本身就可能变成安全隐患。
第四,动作错误会沿着长时序轨迹累积。一次很小的感知偏差,可能经过多步执行后演变为严重失败。
3、攻击:不只是在图像上贴一个 patch
在训练阶段,攻击者可以向机器人示范数据中注入带有触发器的样本,让模型在学习过程中形成隐藏关联:平时表现正常,一旦触发器出现,就执行异常动作。
〓 Figure 4: Training-time attacks on VLA models
这些触发器不一定是明显的像素噪声。
它可以是一段特定文本、一个视觉 patch、一个普通物理物体,甚至是机器人的某个初始关节状态。
这类攻击的危险之处在于:模型不是在部署时临时“被骗了”,而是在训练阶段就已经学会了错误关联。等到真实环境中触发器出现时,异常行为才会被激活。
而在推理阶段,攻击方式会进一步扩展。
自然语言指令可以诱导语义越狱;视觉扰动可以破坏感知—动作映射;物理环境中的标志、物体移动或传感器干扰,也可能让机器人做出错误决策。
4、防御:机器人既要“想明白”,也要“刹得住”
VLA 防御最困难的地方,是安全性和实时性之间的矛盾。
高层语义推理更聪明,可以理解“远离危险物体”“不要碰撞人类”“不要执行不安全指令”等复杂规则。
但这类推理通常较慢,很难直接放进高频控制循环。
底层控制方法反应更快,可以通过控制屏障函数、运动学约束或阻抗控制来快速过滤危险动作。
但它们通常缺少语义理解,只能处理几何和物理层面的安全约束。
〓 Figure 7: Decoupled inference-time defense architecture
因此,论文总结出一个重要方向:未来 VLA 防御可能需要“快慢双环”架构。
-
慢环:负责语义理解、规则解析和任务级安全判断;
-
快环:负责高频动作过滤、碰撞避免和物理约束执行。
换句话说,真正安全的具身智能系统不能只依赖模型“想清楚”,也不能只依赖控制器“刹得住”,而需要二者协同工作。
5、评测:仿真里安全,不代表现实中安全
目前很多 VLA 安全评测仍然主要依赖仿真环境。
仿真环境可控、可复现、成本低,但真实世界更复杂。
〓 Figure 9: Simulation-to-reality gap
光照变化、传感器噪声、机械磨损、通信延迟、执行器误差、不可预测的人类行为,都会让仿真中看似安全的策略在现实中失效。
因此,VLA 安全评测不能只看任务成功率。
更合理的评测体系还需要关注碰撞率、安全违规率、攻击成功率、性能下降率、安全—性能权衡,以及模型在异常情况下的恢复能力。
尤其是在自动驾驶、工业制造、医疗辅助、家庭服务机器人等场景中,“能完成任务”和“能安全完成任务”并不是一回事。
6、结语:具身智能时代,安全不应是能力之后的补丁
VLA 模型代表了 AI 从语言智能走向具身智能的重要一步。
但当模型开始直接控制物理动作时,安全问题也发生了本质变化。
它不再只是模型是否会拒答、是否会输出有害文本,而是机器人是否会碰撞、是否会误操作、是否能在复杂环境中及时停止和恢复。
这篇综述给出的核心提醒是:
在 VLA 时代,安全必须成为和能力同等重要的设计目标。
未来的通用机器人不能只追求更强的理解能力、更高的任务成功率和更复杂的操作技能。
它们还必须具备可评测、可监控、可恢复、可部署的安全机制。
只有这样,VLA 模型才能真正从实验室走向现实世界,从“会看、会说”,走向“会安全地行动”。
7、作者与项目
该综述由来自 National University of Singapore、Monash University、Peking University 等机构的研究者共同完成。项目仓库 Awesome-VLA-Safety 将持续整理 VLA 安全相关论文、方法、基准和资源,欢迎社区关注与补充。
编辑:于腾凯
校对:林亦霖






