OpenClaw爆火背后,Agent安全被低估的真相:从“模型说话”到“系统失控”

导语:当Agent从“说话”走向“行动”,其安全风险也从模型输出蔓延至整个系统。本文深度对话研究者,揭示被低估的长期行为漂移与跨Agent传播风险,探讨治理基础设施的未来。

最近,一个名为OpenClaw的Agent引发了广泛关注。它像一只灵巧的龙虾,能够跨应用执行任务、调用工具,在几乎无需人工干预的情况下完成复杂流程。人们第一次如此直观地意识到:AI正从“生成内容的工具”蜕变为“参与行动的主体”。然而,当Agent的能力边界急速扩张时,一个尖锐的问题浮出水面——它的安全该如何保障?当前的主流讨论仍聚焦于提示词注入、越狱等模型层面的风险,但上海交通大学张伟楠团队在最新论文《From Secure Agentic AI to Secure Agentic Web》中指出,Agent安全的重心已然发生根本性转变。本文基于对论文一作邓智航的深度访谈,试图呈现一个更完整的视角:Agent安全,正从单点防御走向系统级治理。

OpenClaw爆火后,Agent安全的真正危机:从模型对话到系统失控

一、被误解的Agent安全:我们一直在错误的地方找答案?

当OpenClaw等Agent展现出惊人的自主性时,公众和业界的第一反应往往是检查模型有没有“说错话”——提示词是否被注入、输出是否越界、对齐是否失效。邓智航直言,这是一个非常普遍的误解。“现在大多数人在谈Agent安全的时候,还是停留在prompt injection、越狱这些比较‘表层’的问题上,本质上仍然是在关注模型输出这一层。”但今天的Agent早已不是简单的聊天机器人,它们会调用工具、写入长期记忆、持续与外部环境交互。安全问题的重心必须从“模型会不会说话”转向“整个系统在开放环境中是否可控、可审计、可约束”。

这种转变有着深刻的现实根源。以往的Chatbot只是文本进、文本出,而现在的Agent能够直接转化为现实动作:它可以删除文件、泄露隐私,甚至获取敏感信息后自动发送邮件给攻击者。所以,问题不再仅仅是生成内容是否安全,而是执行过程是否安全。这一变化是本质性的,它要求我们重新审视威胁的来源。

二、威胁不仅是工具调用,而是整个开放环境

很多人将Agent安全风险的扩大归咎于工具调用(Tool Use)能力的引入。邓智航承认工具调用是一个重要因素,但他认为更核心的驱动力是Agent在开放环境中的自主行动能力。工具调用只是接口,真正让安全问题发生质变的,是Agent开始在一个动态、复杂甚至对抗性的环境中进行感知、判断和执行。“网页中的内容、文档中的信息、第三方服务返回的数据,这些都会进入Agent的决策流程,从而共同构成一个更大的风险面。”

在论文中,团队将威胁分类为prompt、environment、memory、toolchain等多个维度。邓智航指出,这些攻击有一个统一的本质:争夺对Agent决策的控制权。无论是提示词攻击、环境注入、记忆投毒还是工具链污染,表面上发生在不同模块,但最终都是在影响Agent的理解能力和认知过程,让它在看似正常的情况下被悄悄带偏。这种“控制权的转移”是最大的共性。

这也意味着,外部世界本身已经成为Agent的输入。对于人类来说,网页是用来阅读和判断的,但对于Agent而言,网页、文件和工具返回的内容往往被直接当作可信输入,用于影响任务规划和行为决策。因此,系统安全必须将整个外部环境视为潜在的攻击面,默认其可能带有恶意意图,而非默认可信。

三、System Prompt和拒答机制够用吗?远远不够

有观点认为,通过精心设计的系统提示(System Prompt)和拒答机制,可以解决大部分Agent安全问题。邓智航对此明确反对:“我觉得这是远远不够的。首先,system prompt本身就可能被篡改或者被攻击;其次,很多攻击并不是通过用户正面输入进入系统的,而是来自网页内容、工具返回,甚至是跨Agent的通信。”因此,传统的第一层护栏只能覆盖极小的攻击面。真正可靠的安全方案需要将工具权限控制、运行时监控、协议级校验和持续的红队测试结合起来,形成一个完整的安全体系。这是一个生态级的问题,而非单一模块的修补。

另一个被忽视的维度是Agent的工具链风险。论文将其类比为供应链问题。风险不一定来自模型本身,而可能来自它依赖的第三方工具、API或插件。一个被污染的工具提供方、一个不可靠的接口,或者多个看似安全的工具在组合调用时产生的联动效应,都可能造成严重后果。典型案例是MCP(Model Context Protocol)协议,它统一了上下文和工具交互,极大地提升了Agent的能力,但同时也作为一个统一入口,将权限、信任和污染风险集中放大。因此,在使用MCP这类能力的同时,必须同步设计相应的安全机制,能力越强,风险面越大。

OpenClaw爆火后,Agent安全的真正危机:从模型对话到系统失控

四、被低估的风险:长期行为漂移与跨Agent传播

在当前的讨论中,邓智航认为某些风险被高估,而更隐蔽的风险却被严重低估。高估的是那些容易被发现的问题,比如单轮越狱或即时攻破,它们因为直观而备受关注。但真正危险的,是那些更接近真实部署场景的问题:长期记忆污染、Agent之间的传播效应,以及行为偏移。一个“聪明”的攻击不会让Agent当场失控,而是会缓慢改变它的偏好、信任对象和决策倾向,使其在大量看似正常的微小决策中逐渐偏移。这种长期行为漂移比瞬间失控更隐蔽、更难检测,也更具破坏性。

当Agent组成网络,形成Agentic Web时,问题将变得更加复杂。传统互联网中,人们默认请求的另一端是人类,许多信任关系建立在这个隐含前提之上。但在Agentic Web中,请求可能来自另一个Agent,甚至是多层委托的自动决策。原有的信任基础崩塌,信任关系必须转变为显式表达,并具备可验证、可审计和可追踪的能力。同时,责任追溯也变成一大难题:当一个Agent出错时,我们很难判断它自己是判断错误,还是被其他Agent误导,或是某个中间环节被污染。这需要一整套审计和追溯机制,否则追溯过程就像追查一条漫长的资金链,极为困难。

五、能力与安全的张力:走向可治理的基础设施

Agent的能力与安全之间存在不可避免的张力。能力越强,访问的上下文越多,可调用的工具越丰富,自主性越高,风险也随之增加。如果简单收紧权限,能力又会受限。邓智航认为,关键不在于消除这种张力,而在于通过分级授权、实时监测和事后追溯等机制,将其转化为可控状态。

展望未来两三年,Agent安全的分水岭将出现在哪里?邓智航的判断是:行业能否将身份、授权、溯源和运行时治理这些能力真正做成基础设施。“如果这些基础设施建立起来,Agent才有可能从‘能用但危险’,走向‘可扩展且可治理’。”仅仅依赖提示词工程或局部补丁式防御,一旦Agent大规模进入开放网络,将根本无法支撑。他类比道,两年前工具调用方式千差万别,直到MCP出现才统一标准化。未来的安全机制也可能以类似“协议”的形式出现,通过统一安全协议,让整个Agent生态在运行过程中更安全。

这场由OpenClaw引爆的关注,最终将推动Agent安全从单点模型防御走向系统级治理。毕竟,当AI开始真正“行动”时,我们必须为它的每一步都系上安全带。

OpenClaw爆火后,Agent安全的真正危机:从模型对话到系统失控

 

© 版权声明

相关文章