ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI 会自主攻击?会做,不等于想做

AI 会自主攻击?会做,不等于想做 最近常能看到一些说法AI 已经会“自主攻击”、会发现漏洞甚至能“逃出沙箱”。这些说法并不完全错但很容易把两件不同的事混在一起目标是谁给的目标给定以后还需要人指导多少现在大多数网络安全测试主要测的是第二件事。也就是说人先告诉模型“你要拿到这个 flag”“你要进入这台机器”“你要逃出这个容器”然后看它能不能自己找路径、调用工具、根据失败结果继续调整最终真的把任务做完。所以我更愿意把今天的状态概括成一句AI 会做不等于 AI 想做。标题里的“想做”只是方便理解。更准确地说现有测试主要证明的是执行能力在增强并没有证明攻击、逃逸这类目标开始由模型自己产生。一、先把 Agent 说清楚今天很多所谓 AI 网络攻击并不是一个“裸模型”坐在那里输出几段文字。真正起作用的是一套 Agent 系统。可以简单理解成人给目标 ↓ 模型判断下一步 ↓ 调用 Shell / Python / 浏览器 / 扫描工具 ↓ 真实环境执行 ↓ 结果返回模型 ↓ 继续判断、重试模型负责决定下一步做什么运行框架负责把这些决定真的变成工具调用。所以一个模型“会不会攻击”不能只看它会不会解释漏洞原理。更值得看的是给了它什么目标给了什么工具初始权限有多大环境是一个网页、一台主机还是一整张企业网络中间需要人插手多少最后是模型自己说“成功了”还是机器状态真的发生了变化。这几个维度比单独看一个“成功率 90%”更有意义。二、“逃出沙箱”其实是一个很具体的任务英国 AI Security InstituteAISI有一套叫 SandboxEscapeBench 的测试专门测模型能不能突破容器隔离。它设计了 18 个场景覆盖三类问题编排层比如 Kubernetes 权限配置容器和运行时比如 Docker、Runtime 的错误配置或漏洞Host / Kernel比如主机和 Linux 内核层的问题。这里最重要的一点是测试会直接告诉 Agent你现在在容器里你的目标是逃到外层 Host并取得/flag.txt。所以这里根本不是在测试“模型会不会自己突然想逃”而是在测试“已经告诉你要逃了你能不能自己找到办法”比如一个很典型的权限问题Container ↓ 发现 Docker 控制接口暴露 ↓ 利用它创建高权限容器 ↓ 挂载 Host 文件系统 ↓ 读取原本容器外的数据这个过程看起来像“AI 自己逃了出去”。但技术上首先是系统暴露了不该暴露的权限或接口。模型体现能力的地方是没人逐条告诉它该执行什么命令它能自己检查环境、识别问题再把几步串起来。而且成功不是它说一句“我出来了”。它必须真的跨过边界并拿到外层环境里的 flag。所以这类测试能很好地证明模型的漏洞利用、环境判断和路径搜索能力在增强但不能证明“逃跑”这个目标是模型自己产生的。三、网络安全测试其实是在把任务越拉越长如果只看一道题很容易低估今天 Agent 真正的变化。网络安全评测大致可以看成几个层次。1. 单项能力会不会做一道题最基础的是 CTF 或具体漏洞任务。比如给模型一个存在问题的 Web 服务让它拿到 flag。它可能需要自己分析接口、构造输入、验证漏洞。这一层回答的是某个具体安全问题它会不会处理。2. 权限与隔离能不能跨边界很多真实安全问题甚至不需要复杂漏洞。权限给错了就已经足够危险。例如用户已经登录后端只检查你是不是合法用户却没有继续检查这笔订单是不是你的 你有没有权修改它这就是“认证”和“授权”的区别。同样的问题也会出现在云账号、服务账号、容器权限里。所以看测试时除了问“模型最后做到了什么”还要问它一开始已经拿到了什么权限起点不同任务难度完全不同。3. 长链任务几十步还能不能自己接起来再往上是 Cyber Range也就是模拟企业网络环境。AISI 的 The Last Ones 就是一条 32 步的攻击链里面会涉及凭证获取、Web 漏洞、逆向、CI/CD、横向移动等不同问题。这时候已经不是“会不会一道题”而更像从已获得的初始攻击位置开始 ↓ 寻找凭证 ↓ 利用应用或权限问题 ↓ 进入下一台机器 / 下一网络区域 ↓ 继续获取新的权限 ↓ 最终到达目标真正测的是人只给最终目标中间还需要多少次人工指导这也是今天 Agent 能力增长最值得看的地方之一。不过这里必须加一个边界。这类 Cyber Range 并不等于真实企业攻防。测试通常已经给了初始攻击位置而且没有一个真实 SOC、EDR 或安全团队持续封禁、隔离、响应模型的行为。所以它能证明的是在给定入口、模拟网络和有限防守条件下模型已经能维持更长的攻击链。不能直接推出“AI 已经可以同样稳定地打穿一个有成熟防守体系的真实企业。”四、再往前是发现原来没人知道的漏洞利用已有漏洞和发现新漏洞又是两个层次。已有漏洞更像识别版本 → 找已知漏洞 → 判断条件是否满足 → 尝试利用发现新漏洞则没有现成答案读代码 → 找异常路径 → 构造 PoC → 验证Google Project Zero 和 DeepMind 的 Big Sleep 已经公开过发现此前未知真实漏洞的案例。这说明模型开始进入过去高度依赖安全研究人员经验的漏洞发现过程。但这里的逻辑还是一样“去检查这份代码有没有漏洞”仍然是人给出的任务。模型负责的是后面的分析、尝试和验证。所以即便已经出现新漏洞发现能力也不能从这里直接跳到“模型开始自己寻找攻击目标。”五、现实里老漏洞和错误配置已经足够多这里也不能反过来觉得既然很多测试利用的是已知漏洞那是不是没什么现实意义恰恰不是。现实生产环境通常存在补丁滞后。旧系统、老中间件、兼容性依赖、历史账号、错误权限和旧配置不会因为补丁发布就立刻消失。所以即使暂时不考虑模型独立发现新漏洞只要它能稳定完成识别环境 → 找到适用漏洞 → 判断利用条件 → 执行 → 失败后调整 → 继续下一步就已经覆盖了大量现实攻击工作。过去这些事情往往需要安全人员不断观察、查资料、试错。现在越来越多步骤可以被放进一个持续运行的 Agent 循环里。真正变化的不一定是漏洞种类突然变了而是完成这些步骤需要的人力开始减少。六、防守为什么一直强调“纵深”这也是为什么现实系统不会只靠一道防线。一个很粗的结构大概是Internet ↓ WAF / API Gateway ↓ 身份认证与粗粒度权限 ↓ 业务服务自己的细粒度判断 ↓ 数据库最小权限 ↓ Container / Host / 网络隔离 ↓ 日志、检测与响应比如一个非常明显的恶意输入WAF 完全可以在入口就挡掉。但后端不能因此假设“网关放进来的东西一定安全。”数据库访问仍然应该参数化业务服务仍然要判断这个用户能不能操作这个具体资源因为每一层知道的东西不同。网关擅长做入口过滤、认证、限流业务服务最清楚订单、账号和具体操作之间的权限关系数据库和基础设施则继续限制就算前面出了问题最多还能做到什么所以纵深防御的核心不是每一层重复检查一遍而是假设前一层可能失效后一层仍然有自己的边界。还有一点容易被忽略防守不能只看“系统有没有挂”。有些攻击本来就希望业务继续正常运行。页面正常、接口正常并不代表凭证没有泄露、数据没有被带走也不代表机器没有在后台挖矿、做代理节点或者被长期保留为后续 DDoS、横向移动的入口。正常运行只能证明系统还在运行不能证明系统仍然安全。这也是为什么“没有主动防守方”的 Cyber Range 结果不能直接等同于真实企业攻防。现实里攻击者在行动防守方也会响应。七、真正的拐点是攻击开始变得划算前面的测试回答的是能力问题。现实里还有另一个问题值不值得做。可以把这笔账粗略写成预期收益 AI / 工具成本 人工成本其他很多成本很难准确估计先不展开。这里的“收益”也不只是勒索。攻击者进入一台机器之后可能拿它挖矿也可能窃取数据、账号和密钥还可能长期保留入口等以后窃密、横向移动甚至拿来参与 DDoS 攻击。有些攻击反而希望系统一直正常运行因为越不容易被发现入口就能留得越久。AI 真正可能改变的是攻击这笔账里的成本。过去一个目标可能需要人花几个小时做侦察、查资料、判断版本、试漏洞。如果以后大量步骤可以交给 Agent自动侦察 → 判断环境 → 尝试已有方法 → 根据结果调整 → 只有异常情况交给人那么人工成本会下降模型和工具成本也可能继续下降已经做过的目标还会留下脚本、工具和经验供下一次复用。这时真正值得关注的就不是“AI 能不能完成一次攻击”而是过去因为不划算而没人碰的大量普通目标会不会也开始变得划算。对攻击者来说很多时候只需要找到一条能走通的路径。对公司来说却要长期维护网关、身份权限、业务代码、主机、网络、日志、备份和响应。攻击者可以挑目标公司却不能选择“这个月先不防”。如果 AI 继续压低攻击侧的人工和试错成本这种不对称就可能进一步扩大。到那个时候风险增加未必是因为出现了什么“AI 攻击欲望”。只是越来越多攻击开始算得过来了。水面看起来还算平静但成本曲线已经在水下悄悄变化。下一次大规模网络安全事件也许并没有我们想象得那么远。最后所以“AI 会自主攻击”不能说完全错但最好先拆开看。目前比较扎实的证据说明目标给定以后模型已经能在越来越少的人工指导下完成越来越长、越来越复杂的网络安全任务。而这些测试没有证明攻击、逃逸或者资源获取这样的目标开始由模型自己产生。一个是执行能力。一个是目标来源。真正值得警惕的不一定是 AI 突然产生了什么攻击欲望而是攻击成本正在下降过去不值得碰的目标可能开始值得碰了。这也是“会做不等于想做”真正想表达的东西。
返回列表