大模型攻防的分水岭,不是理论上能不能挖出漏洞,而是这个过程需要花多少钱。

智谱开源 GLM-5.3 权重之后,Anthropic 很快发布了一份详尽的红队测试。在针对 Chrome V8 引擎已知缺陷的 ExploitBench 任务里,GLM-5.3 拿下 12% 的成功率,咬紧了顶级闭源模型 Claude Mythos Preview 的 14%;在轻量模型 GLM-5.3-Flash 的实测中,一条绕过处理器硬件防护、结合浏览器缺陷的完整利用链,推理成本折合 API 标价只要 20.40 美元。

过去顶级黑客团队耗费数周才能打通的攻击链路,现在变成 20 分钟人工微调配上 8 小时机器跑脚本。当这种武器级能力以开放权重的形式摆上货架,前沿 AI 实验室用高墙圈起来的安全神话,当场被戳漏了底。

从零的突破到流水线攻击

网络攻防的技术指标很现实。上一代大模型在二进制利用上几乎全部交白卷,无论 Claude Opus 4.6 还是上一版 GLM-5.2,面对底层控制流劫持都是清一色的 0% 成功率。顶多能让程序报错退出,根本碰不到系统执行权。

新一代模型直接迈过了这个及格线。在基于谷歌 OSS-Fuzz 抽样的二进制利用测试里,GLM-5.3 取得了 4% 的完整控制流劫持成功率,Mythos Preview 则为 6%。

二进制利用能力阶梯与代际突破 Tier 1 基础崩溃 旧模型停留阶段 Tier 2-3 内存破坏原语 部分构造利用链 Tier 4 高级内存操纵 环境精细交互 Tier 5 控制流劫持 (跨越门槛) 4% (GLM-5.3) vs 6% (Mythos) 上一代 Opus 4.6 与 GLM-5.2 成功率均为 0%

拿到 Tier 5 意味着指令指针被模型彻底接管。它不仅能在内存里找到缓冲区溢出的裂痕,还能算准偏移量,把执行流引向自己铺设的代码段。这靠的不是扩大参数规模,而是强化学习的智能体后训练:把模型扔进带反馈的沙箱,让它一次次报错、试错、校正,把单向的补全代码逼成了多步攻防推理。

一旦跑通,整个经济账就变了。在测试团队的人机配合下,GLM-5.3 能在一天内挖出主流 JavaScript 引擎的未知缺陷,拼成恶意网页直接扒走主机的 SSH 密钥。漏洞发掘原本是极高手艺人的昂贵手工作坊,现在被标准化成了白菜价的算力流水线。

跑分迷雾与马奇诺防线的坍塌

不过别被各家战报牵着鼻子走。大模型在网络安全里的榜单数字,水分大到足以让人迷路。

在智谱公布的 CyberGym 源码测试中,GLM-5.3 拿下了 84.5%,把 Claude Opus 4.6 的 66.6% 远远甩在身后。然而到了美国国家标准与技术研究院下属机构 CAISI 的独立测试里,GLM-5.3 在 ExploitBench 的得分猛涨到 61.1%,而在 Anthropic 自己的报表里这个数字却只有 12%。

评测口径差异:源码识别 vs 深度长程攻防 CyberGym (源码已知漏洞识别) GLM-5.3:84.5% GLM-5.2:77.2% Claude Opus 4.6:66.6% ExploitGym 6小时预算完成任务数 Mythos 级:247 个 GLM-5.3:130 个 深度探索与长程利用链差距拉大

差额来自于各家给选手带的装备。智谱测试时拉满了 128K 输出上限、配齐了 Claude Code 级别的工作流工具;而 Anthropic 评测对手时只给标准环境。换言之,决定模型安全得分的很多时候不是智商,而是外挂工具链给得大不大方。

但真正让安全界后背发凉的不是跑分,而是开源权重自带的免疫逃逸。

厂商给模型装的所有合规护栏,在本地权重面前都像纸糊的。安全团队利用消融技术(Abliteration),只花了约 2200 个 GPU 小时、折合两三千美元算力,就精准剔除了拒答神经元。模型的逻辑能力完好无损,但面对高危恶意指令的执行率直接冲到 100%。

所有依靠对齐算法搭建的防线,只在中心化 API 里管用。权重一旦下发到本地显卡,对齐就彻底失去了物理意义上的拦截效能。

道德警钟背后的商业护城河

Anthropic 选在这个节点跳出来高呼开源危险,动机并不单纯。

英国 AI 安全研究所追踪过一个指标,开源模型在网络安全能力上落后闭源前沿的时间,已经从早期的十个月急剧收缩到现在的四到七个月。CAISI 的研判更直白:GLM-5.3 距离美国最顶尖闭源水准只有四个月的差距。

四个月时间,根本不够闭源厂商建立起舒适的护城河。

Anthropic 对待自己的 Mythos Preview 极其谨慎,把它锁在代号 Glasswing 的防御计划里,只向 150 家经过层层政审的机构开放,转头再把 Mythos 5.1 当作高溢价企业服务推销。这套模式的底层逻辑是把高级攻防能力变成一种专营权,依靠安全审查建立技术租金。

智谱把权重一放,相当于把深宅大院里的独门兵刃直接扔到了大马路上。

兵者不祥之器,不得已而用之。古代朝廷控制私铸兵器,靠的是对铜铁矿脉和熔炉的物理垄断。但代码不是生铁,算力早就成了全球流通的硬通货。Anthropic 呼吁监管部门对开源高危模型实施牌照管制,表面上是为了公共安全未雨绸缪,里子则是借国家安全的叙事来巩固闭源授权的商业特权。

现实的攻防天平已经倾斜。防守方要堵住成千上万个暗桩,攻击方现在只要花一顿饭钱租几十个小时算力,就能发动分布式、不知疲倦的代码探查。

对于企业防守侧而言,寄希望于模型厂商在云端恪守职业道德已经不切实际。唯一现实的活路,是赶紧用上本地部署的代码大模型,在内网里搭建起自动化的漏洞扫描与热修补编排。用不知疲倦的机器探针,去抵御另一群不知疲倦的机器刺客。

深门高墙锁不住漫山遍野的轻骑,这才是所有安全团队接下来不得不咽下的苦药。