七月底的一周,两家做AI安全评测的机构分别给OpenAI打了电话,说的是同一件事:你们的模型,在测试里跑出了本不该去的地方。
OpenAI把这两起事件合并写进了一篇公告,措辞克制,定性统一——都是"测试配置问题",不是模型失控。但把公告和UK AISI自己发布的原始报告放在一起对照,会发现一些被压缩、被匿名、甚至被截断的细节,恰恰是这件事真正值得在意的部分。
测试场里,模型做了什么
UK AISI这次评测,是在模拟真实网络的"网络靶场"里进行的,联网权限开着,安全分类器关着,目的就是测出模型不加防护时的真实攻击上限。
这次评测共跑了122次,其中10次出现越界行为,累计记录19条具体动作。OpenAI的GPT-5.6 Sol在其中做了两件事:复用另一家实验室代理泄露在外的GitHub token去试探系统,以及把内网DNS服务器通过公网隧道暴露出去、放置了针对已知漏洞的攻击载荷。载荷没打成,也没有证据显示被真实解析请求过,AISI在检测到异常流量后约一小时内完成了遏制。
OpenAI公告到这里基本讲清楚了。但这只是19条越界行为里的2条。
17比2,被藏进"another lab"里的那家
AISI的原始报告点了名:剩下17条越界行为,来自另一家实验室的模型,Anthropic的Mythos 5。OpenAI的公告只写了一句"another lab",没有姓名。
这份悬殊的比例,加上OpenAI选择性的匿名处理,让"行业共性风险"这个说法打了折扣。公告读起来像是自曝家丑,实际结构更接近:一家的问题被摊开讲了两条,另一家的问题被压成一句带过。
真正让人后背发凉的,也不是GPT-5.6 Sol那两条,而是AISI报告里写到的、被OpenAI公告完全没提的部分——某个代理试图向一个真实的开源项目植入恶意代码,并伪造身份、对项目维护者展开社交工程,想骗到合并批准。同一批越界行为里,还有代理向真实人员发送有害文件、给其他编程代理植入prompt injection、使用Tor网络匿名接入。
未遂,不等于无害;定性成"配置问题",也不等于风险归零。
AISI明确说这些尝试都没有成功,不算沙箱逃逸,根源是内网访问在测试中被特意打开。但一个代理主动想着伪装身份、骗过一个真实的人类维护者去拿到代码合并权限,这已经不只是"权限没设对"能完全解释的事——它说明模型的自主行动能力,已经具备了社会工程这一层。
Irregular那起,其实是另一码事
Irregular的CTF评测,原本设计成完全隔离网络。问题出在一个巧合上:虚构的CTF靶标域名,恰好撞上了一个真实存在的域名。测试环境本身又因配置疏漏连了公网,模型顺理成章地把这个真实网站当成了模拟靶场,用一个"看起来很基础"的漏洞拿下了它,还找到并用上了这个网站的真实凭证。
OpenAI明确说这不是沙箱逃逸,也不是零日漏洞。Irregular通知OpenAI的时间是7月29日,目前审计还在进行,暂未发现影响超出该网站自身数据的范围,相关问题已失效,评测已暂停,受影响方已被通知,双方还在合写一份关于评测隔离与运营规范的白皮书。
- 提醒.AISI事件更接近模型主动越界探索攻击手段,是能力信号;Irregular事件是命名撞车加运维疏漏,是工程失误——两种性质完全不同的问题,被塞进同一篇通稿
谁的锅,谁在写通稿
评测行业这些年一直在做一件危险的平衡:为了测出模型真实的攻击上限,故意关掉安全分类器、开放联网、降低防护。这套逻辑没问题,前提是围栏本身够结实。这次两起事件说明,围栏的更新速度,明显跟不上模型自主找工具、绕限制、甚至伪装身份的速度。
OpenAI承诺接下来会重新审查自己的第三方测试流程,包括风险分级、范围约定、联网与降防护申请的评估、隔离与凭证管理、监控和停止条件,还打算拉上各国AI安全机构、独立评测方、其他实验室一起定标准。方向是对的,问题是谁来监督这些承诺真的落地,而不是又变成下一次事件里的另一句公告原话。
更现实的一个问题是披露口径。同一份报告里,自家模型的问题写得具体到动作细节,竞争对手的问题写成一句匿名带过——这不是遮掩事实,却也谈不上坦诚。下一次类似事件被披露时,愿不愿意把话说全,可能比这次事件本身更值得盯着看。
