物理世界的“越狱攻击”来了:复旦等13家机构长文揭底具身智能致命漏洞
导语:具身智能时代,AI失控不再只是屏幕上的黑产文本,而是现实世界里物理机器的致命暴走。
当你的扫地机器人开始拒绝打扫,甚至把尖硬物体砸向家里的宠物;或者当工厂里的工业机械臂在一段被精心注入的恶作剧指令下,偏离了既定的安全轨迹……这些并非科幻电影中的夸张桥段,而是正在步入物理世界的具身智能(Embodied AI)必须直面的幽暗角落。
以往我们调侃聊天机器人满嘴跑火车,大不了也就是关掉网页。但在今天,当大模型直接连接了各种传感器和机械执行器,数字世界的恶意提示词就会瞬间转化为物理世界的“暴力通行证”。从“说错话”到“干错事”,这条安全红线一旦失守,所带来的代价将是极其真实的物理伤害。
针对这一迫在眉睫的底层隐患,复旦大学可信具身智能研究院、上海创智学院、香港城市大学、新加坡管理大学、伊利诺伊大学等全球13家顶级学术团队,集结了38位在该领域深耕的学者,抛出了一份长达70多页的系统性安全避坑指南。这篇涵盖了近480篇前沿文献的重磅综述,可以说是目前关于具身智能安全领域最全面的一张防守地图。
为了方便开发者和研究人员顺藤摸瓜,团队在发布综述的同时,将所有的论文、评测工具和前沿工作都整理到了开源社区中:
- 论文标题:Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
- 论文链接:https://arxiv.org/abs/2605.02900
- 项目开源仓库:https://github.com/x-zheng16/Awesome-Embodied-AI-Safety
- 项目官方网站:https://x-zheng16.github.io/Awesome-Embodied-AI-Safety/
“能力—风险”二象性:越聪明的系统,死角越多
这篇综述提供了一个极具洞察力的核心视角:“能力—风险”二象性(Capability-Risk Duality)。简而言之,就是具身智能系统的能力每堆叠一层,暴露给外界的受攻击面就会多盖出一层。能力越硬核,风险面其实也越宽广。
这推翻了我们过去零散研究网络安全的惯性思维。过去行业里习惯把对抗样本、后门注入当成独立的防区来建防火墙;但在具身世界里,这些攻击会在感知、认知、规划、行动以及智能体自进化这一整条能力链上发生级联反应。感知层漏掉的一个像素干扰,完全可能在规划层被放大成一次毁灭性的撞击决策。顺着这个链条,风险正在从数字网络逐步蔓延到真实的物理土壤:
- 物理感知级(如人脸门禁):风险主要停留在硬件信号或摄像头输入的欺骗上,攻击者通过修改传感器数据误导初始输入;
- 逻辑认知级(如博物馆导览机):系统的软肋延伸到了语言理解及多模态推理上,一旦遭遇视觉或提示词注入,系统可能会给出扭曲的交互引导;
- 规划决策级(如自动驾驶车):这里的实时决策非常致命,哪怕外界对预测轨迹仅施加微小干预,也会诱偏整条决策路线;
- 物理交互级(如人形机器人、工业机械臂):此时的安全红线直接失守,模型生成的哪怕是一个微妙的越狱指令,都会在电机驱动下变成直接的物理伤害;
- Agentic复杂智能体(具备长期记忆与自进化能力的系统):由于具备了工具调用与自主规划的特权,内层的微小漏洞一旦沿着能力栈层层传导放大,后果将指数级恶化。

告别拼凑补丁:常规的安全过滤为什么失灵了?
坦白讲,这几年关于AI安全的综述并不少,有些学者专攻VLA模型的对抗鲁棒性,有些针对多传感器在恶劣气象下的导航稳定,还有些将安全视作传统的IoT加密问题。然而,绝大多数工作就像在刻舟求剑——它们把具身安全狭隘地等同成了其中某一个具体的隔离环节。
这种局部分离的思路在真实的具身系统里很难奏效。因为具身管道是一个端到端的闭环体系。如果只是在执行的前端安插规则引擎,而规划层的底座大模型本身因为物理越狱陷入了混乱,系统仍然会强行绕过传感器防线。这就要求研发人员必须告别事后去物理端打补丁的做法,在整个系统设计之初,就将防范策略内嵌在贯穿感知与行动的神经元网络各层中。
四片不容忽视的学术“无人区”
阅读这篇长达70多页的文献,最过瘾的地方在于作者团队直接指出了当下的几个学术研究空白。这些方向不仅没人系统研究过,而且极有可能成为未来几年内各大实验室里含金量最高的课题:
1. 多模态融合底层的脆弱性
当激光雷达、热成像避障与语音指令等多路异构信号进行高维对齐时,系统在融合层如何抵御非对齐的伪造攻击?目前学术界在此处依然缺乏成体系的攻防分析框架。
2. 规划层在物理越狱攻击下的防线稳定性
常规语言大模型的安全策略是在防止其生产有害的文本内容。然而,当大模型充当具身系统的智能大脑(Planner)时,一段恶意越狱指令的直接后果将不再是屏幕上的一行黑灰产文字,而是驱动机器去厨房端起利器。目前这一维度的物理行为防线测评极度匮乏。
3. 开放式物理社交环境中的交互可信度
以往的人机交互安全假设场景是相对闭合的,但在开放式的社会流动空间里,旁边路人无意识的喧哗或是带有恶意的诱导指示,都会严峻考验系统常识辨析的上限。
4. Agentic系统自进化的关联破坏路径
随着智能体被赋予了长期记忆、工具任意调用以及通过环境反馈不断自进化的能力,只要其中一条被篡改的工具接口发生漏洞,恶意指令脑洞大开,就可能把破坏逻辑直接固化写进智能体的持久化记忆中,导致系统在随后的演进中陷入恶性循环。
持续更新的安全“导航地图”
这群学者并没有停留在写论文上,为了让防务工作早日落地,团队在开源社区搭建了一个活跃的资源生态。Awesome-Embodied-AI-Safety项目将以双月的节奏持续同步全球最新的学术进展。
不管是近年来在学术界颇受重视的HazardArena(多模态冲突安全保障)、RedVLA(针对视觉-语言-动作模型的红队攻击框架),还是JailWAM、IPI-in-Wild、MCP系统级函数劫持等防御方案,都能在这张大地图里找到明确的切入路径。对于每个希望让自家机器人走出实验室的团队来说,这更像是一本面向未来的避险指南。
与其等到真实事故发生后再去物理设备上忙于打补丁,不如在构建底座模型时就把安全机制写进基因。当硅基智能开始学会在碳基世界里自由行走、抓取、操纵和工作,安全的定义早已不再是一纸合规报告。这份由全球高校及研究机构深度协作完成的万字长文,正是对每一位正走向真实物理世界的智能体探索者最深思熟虑的清醒提示——能力跑得多快,底盘的安全边界就应该探得多深。