最近常能看到一些说法:AI 已经会“自主攻击”、会发现漏洞,甚至能“逃出沙箱”。
这些说法并不完全错,但很容易把两件不同的事混在一起:
目标是谁给的?目标给定以后,还需要人指导多少?
现在大多数网络安全测试,主要测的是第二件事。
也就是说,人先告诉模型“你要拿到这个 flag”“你要进入这台机器”“你要逃出这个容器”,然后看它能不能自己找路径、调用工具、根据失败结果继续调整,最终真的把任务做完。
所以我更愿意把今天的状态概括成一句:
AI 会做,不等于 AI 想做。
标题里的“想做”只是方便理解。更准确地说,现有测试主要证明的是执行能力在增强,并没有证明攻击、逃逸这类目标开始由模型自己产生。
一、先把 Agent 说清楚
今天很多所谓 AI 网络攻击,并不是一个“裸模型”坐在那里输出几段文字。
真正起作用的是一套 Agent 系统。
可以简单理解成:
人给目标 ↓ 模型判断下一步 ↓ 调用 Shell / Python / 浏览器 / 扫描工具 ↓ 真实环境执行 ↓ 结果返回模型 ↓ 继续判断、重试模型负责决定下一步做什么,运行框架负责把这些决定真的变成工具调用。
所以一个模型“会不会攻击”,不能只看它会不会解释漏洞原理。
更值得看的是:
- 给了它什么目标;
- 给了什么工具;
- 初始权限有多大;
- 环境是一个网页、一台主机,还是一整张企业网络;
- 中间需要人插手多少;
- 最后是模型自己说“成功了”,还是机器状态真的发生了变化。
这几个维度,比单独看一个“成功率 90%”更有意义。
二、“逃出沙箱”其实是一个很具体的任务
英国 AI Security Institute(AISI)有一套叫 SandboxEscapeBench 的测试,专门测模型能不能突破容器隔离。
它设计了 18 个场景,覆盖三类问题:
- 编排层,比如 Kubernetes 权限配置;
- 容器和运行时,比如 Docker、Runtime 的错误配置或漏洞;
- Host / Kernel,比如主机和 Linux 内核层的问题。
这里最重要的一点是:
测试会直接告诉 Agent:你现在在容器里,你的目标是逃到外层 Host,并取得
/flag.txt。
所以这里根本不是在测试:
“模型会不会自己突然想逃?”
而是在测试:
“已经告诉你要逃了,你能不能自己找到办法?”
比如一个很典型的权限问题:
Container ↓ 发现 Docker 控制接口暴露 ↓ 利用它创建高权限容器 ↓ 挂载 Host 文件系统 ↓ 读取原本容器外的数据这个过程看起来像“AI 自己逃了出去”。
但技术上首先是系统暴露了不该暴露的权限或接口。
模型体现能力的地方,是没人逐条告诉它该执行什么命令,它能自己检查环境、识别问题,再把几步串起来。
而且成功不是它说一句“我出来了”。
它必须真的跨过边界,并拿到外层环境里的 flag。
所以这类测试能很好地证明模型的漏洞利用、环境判断和路径搜索能力在增强,但不能证明“逃跑”这个目标是模型自己产生的。
三、网络安全测试,其实是在把任务越拉越长
如果只看一道题,很容易低估今天 Agent 真正的变化。
网络安全评测大致可以看成几个层次。
1. 单项能力:会不会做一道题
最基础的是 CTF 或具体漏洞任务。
比如给模型一个存在问题的 Web 服务,让它拿到 flag。
它可能需要自己分析接口、构造输入、验证漏洞。
这一层回答的是:
某个具体安全问题,它会不会处理。
2. 权限与隔离:能不能跨边界
很多真实安全问题甚至不需要复杂漏洞。
权限给错了,就已经足够危险。
例如用户已经登录,后端只检查:
你是不是合法用户?却没有继续检查:
这笔订单是不是你的? 你有没有权修改它?这就是“认证”和“授权”的区别。
同样的问题也会出现在云账号、服务账号、容器权限里。
所以看测试时,除了问“模型最后做到了什么”,还要问:
它一开始已经拿到了什么权限?
起点不同,任务难度完全不同。
3. 长链任务:几十步还能不能自己接起来
再往上,是 Cyber Range,也就是模拟企业网络环境。
AISI 的 The Last Ones 就是一条 32 步的攻击链,里面会涉及凭证获取、Web 漏洞、逆向、CI/CD、横向移动等不同问题。
这时候已经不是“会不会一道题”,而更像:
从已获得的初始攻击位置开始 ↓ 寻找凭证 ↓ 利用应用或权限问题 ↓ 进入下一台机器 / 下一网络区域 ↓ 继续获取新的权限 ↓ 最终到达目标真正测的是:
人只给最终目标,中间还需要多少次人工指导?
这也是今天 Agent 能力增长最值得看的地方之一。
不过这里必须加一个边界。
这类 Cyber Range 并不等于真实企业攻防。
测试通常已经给了初始攻击位置,而且没有一个真实 SOC、EDR 或安全团队持续封禁、隔离、响应模型的行为。
所以它能证明的是:
在给定入口、模拟网络和有限防守条件下,模型已经能维持更长的攻击链。
不能直接推出:
“AI 已经可以同样稳定地打穿一个有成熟防守体系的真实企业。”
四、再往前,是发现原来没人知道的漏洞
利用已有漏洞和发现新漏洞,又是两个层次。
已有漏洞更像:
识别版本 → 找已知漏洞 → 判断条件是否满足 → 尝试利用发现新漏洞则没有现成答案:
读代码 → 找异常路径 → 构造 PoC → 验证Google Project Zero 和 DeepMind 的 Big Sleep 已经公开过发现此前未知真实漏洞的案例。
这说明模型开始进入过去高度依赖安全研究人员经验的漏洞发现过程。
但这里的逻辑还是一样:
“去检查这份代码有没有漏洞”仍然是人给出的任务。
模型负责的是后面的分析、尝试和验证。
所以即便已经出现新漏洞发现能力,也不能从这里直接跳到:
“模型开始自己寻找攻击目标。”
五、现实里,老漏洞和错误配置已经足够多
这里也不能反过来觉得:
既然很多测试利用的是已知漏洞,那是不是没什么现实意义?
恰恰不是。
现实生产环境通常存在补丁滞后。
旧系统、老中间件、兼容性依赖、历史账号、错误权限和旧配置,不会因为补丁发布就立刻消失。
所以即使暂时不考虑模型独立发现新漏洞,只要它能稳定完成:
识别环境 → 找到适用漏洞 → 判断利用条件 → 执行 → 失败后调整 → 继续下一步就已经覆盖了大量现实攻击工作。
过去这些事情往往需要安全人员不断观察、查资料、试错。
现在越来越多步骤可以被放进一个持续运行的 Agent 循环里。
真正变化的,不一定是漏洞种类突然变了,而是完成这些步骤需要的人力开始减少。
六、防守为什么一直强调“纵深”
这也是为什么现实系统不会只靠一道防线。
一个很粗的结构大概是:
Internet ↓ WAF / API Gateway ↓ 身份认证与粗粒度权限 ↓ 业务服务自己的细粒度判断 ↓ 数据库最小权限 ↓ Container / Host / 网络隔离 ↓ 日志、检测与响应比如一个非常明显的恶意输入,WAF 完全可以在入口就挡掉。
但后端不能因此假设:
“网关放进来的东西一定安全。”
数据库访问仍然应该参数化,业务服务仍然要判断:
这个用户能不能操作这个具体资源?
因为每一层知道的东西不同。
网关擅长做入口过滤、认证、限流;
业务服务最清楚订单、账号和具体操作之间的权限关系;
数据库和基础设施则继续限制:
就算前面出了问题,最多还能做到什么?
所以纵深防御的核心不是每一层重复检查一遍,而是:
假设前一层可能失效,后一层仍然有自己的边界。
还有一点容易被忽略:防守不能只看“系统有没有挂”。
有些攻击本来就希望业务继续正常运行。
页面正常、接口正常,并不代表凭证没有泄露、数据没有被带走,也不代表机器没有在后台挖矿、做代理节点,或者被长期保留为后续 DDoS、横向移动的入口。
正常运行,只能证明系统还在运行,不能证明系统仍然安全。
这也是为什么“没有主动防守方”的 Cyber Range 结果,不能直接等同于真实企业攻防。
现实里,攻击者在行动,防守方也会响应。
七、真正的拐点,是攻击开始变得划算
前面的测试回答的是能力问题。
现实里还有另一个问题:值不值得做。
可以把这笔账粗略写成:
预期收益 - AI / 工具成本 - 人工成本
其他很多成本很难准确估计,先不展开。
这里的“收益”也不只是勒索。
攻击者进入一台机器之后,可能拿它挖矿,也可能窃取数据、账号和密钥;还可能长期保留入口,等以后窃密、横向移动,甚至拿来参与 DDoS 攻击。
有些攻击反而希望系统一直正常运行,因为越不容易被发现,入口就能留得越久。
AI 真正可能改变的,是攻击这笔账里的成本。
过去一个目标可能需要人花几个小时做侦察、查资料、判断版本、试漏洞。
如果以后大量步骤可以交给 Agent:
自动侦察 → 判断环境 → 尝试已有方法 → 根据结果调整 → 只有异常情况交给人那么人工成本会下降,模型和工具成本也可能继续下降;已经做过的目标,还会留下脚本、工具和经验供下一次复用。
这时真正值得关注的就不是:
“AI 能不能完成一次攻击?”
而是:
过去因为不划算而没人碰的大量普通目标,会不会也开始变得划算。
对攻击者来说,很多时候只需要找到一条能走通的路径。
对公司来说,却要长期维护网关、身份权限、业务代码、主机、网络、日志、备份和响应。
攻击者可以挑目标,公司却不能选择“这个月先不防”。
如果 AI 继续压低攻击侧的人工和试错成本,这种不对称就可能进一步扩大。
到那个时候,风险增加未必是因为出现了什么“AI 攻击欲望”。
只是越来越多攻击,开始算得过来了。
水面看起来还算平静,但成本曲线已经在水下悄悄变化。下一次大规模网络安全事件,也许并没有我们想象得那么远。
最后
所以“AI 会自主攻击”不能说完全错,但最好先拆开看。
目前比较扎实的证据说明:
目标给定以后,模型已经能在越来越少的人工指导下,完成越来越长、越来越复杂的网络安全任务。
而这些测试没有证明:
攻击、逃逸或者资源获取这样的目标开始由模型自己产生。
一个是执行能力。
一个是目标来源。
真正值得警惕的,不一定是 AI 突然产生了什么攻击欲望,而是攻击成本正在下降,过去不值得碰的目标,可能开始值得碰了。
这也是“会做,不等于想做”真正想表达的东西。