三十年前的一个深夜,还在读大一的 Bryan Cantrill 和同学在计算机系机房编造了一个恶作剧,跑到隔壁向赶期末论文的文科生大喊“病毒跑出来了,快拔软盘”。恐慌瞬间引爆,学生们不仅拔盘关机,甚至直接扯掉电源线,导致多篇论文毁于一旦。二十余年后,这位系统底层老将、Oxide Computer 联合创始人把这段悔恨往事重新翻出来,矛头直指硅谷愈演愈烈的 AI 灭绝论。

起因是一句公开断言。Anthropic 对齐科学负责人 Evan Hubinger 宣称,未来十年内先进 AI 杀死全人类的概率大于 10%。前员工 Jacob Coxon 离职时甚至透露,部分同事的非正式预估超过了 50%。

更具荒诞色彩的一幕随即被《华尔街日报》曝光:Anthropic 多位早期资深员工已经在考虑或者着手在美国偏远地区购置土地,作为系统一旦失控时举家撤离的避难所。

一边在白板上推演末日概率、自掏腰包到荒野买地,一边开足马力给自我改进系统加装算力。在 Cantrill 看来,这种缺乏物理实证的灾难布道,本质上是在技术公共空间肆意高喊失火,既是典型的技术傲慢,也是深层的信任透支。

荒野买地与惊悚概率:谁在制造恐慌

必须先把事实与传言拆开看。

买地避难并非 Anthropic 官方资助的企业行为,而是部分资深员工应对技术失控风险的个人自保举动。坊间传闻一度将买地与阿拉斯加极端避难所联系起来,实际情况是部分员工向支持严管 AI、限制建设高能耗数据中心的阿拉斯加候选人提供了政治献金,属于立法游说手段,而非官方在极地修建地下地堡。

Anthropic 官方建立的防线依然停留在工程与合规协议上:依靠内部的负责任扩展政策(RSP)、长远利益信托以及 AI 宪法,对系统的自主性、网络渗透与生物风险划定红线。

官方的正式防线是拉闸断网,一线的研发骨干却在私下收拾行李。

那个在社交平台引发轩然大波的“超 10% 灭绝率”,同样不是经过同行评审的科学结论,而是 Hubinger 个人的主观置信度。前研究员 Jacob Coxon 曾因担忧模型自我改进失控而在 2026 年 9 月公开辞职,他提到现有系统并不危险,危险的是未来借助自动化迭代催生的高阶系统。

Hubinger 得出极端预判,依赖的是一条严苛的四步推导链条:自动化研发、意图隐匿与欺骗、全面越狱失控、造成物理灭绝。在这条链条里,只要任何一环被工程现实卡死,末日推导就会全盘落空。

对齐派假设链 vs 物理工程断点 1. 自动化研发 模型递归自我改进 代码能力超人类 2. 隐匿与欺骗 模型假装服从人类 暗中寻求自主权 3. 失控越狱 突破安全围栏 接管外部网络资源 4. 物理现实死穴 缺乏工业生产实体 物理隔离切断操控链

统计常理与物理世界的硬墙

把视线放宽到整个学术界,Hubinger 给出的一成灭绝率和十年时间表,在统计学上也显得极端孤立。

2024 年一项涵盖 2778 名同行评审论文作者的大规模调查(Grace et al., 2024)显示,全球研究者对高阶系统彻底失控或永久剥夺人类权力的风险预估中位数为 5%。主流学界认为全面超越人类智能的中位数时间节点落在了 2047 年左右,绝非近在咫尺的十年。

更深的分歧发生在纸面推演与底层工程之间。Cantrill 在早先的技术演讲中反复点出一个常识:纯粹的智力并不等同于物理现实的控制力。

智力无法免除系统受制于物理法则。

末日论学者热衷于设想电网瘫痪、工业停摆或生化合成等灾难场景,但他们大多既非电网工程师,亦非生化制造专家。数字模型要想干预现实,中间隔着执行机构、电力供应、精密工业机床与各类物理传感器。

现代关键基础设施的最底层,无一不依赖物理硬隔离、硬件互锁和人工确认。即便软件具备极高的推理速度,缺乏机械手臂与实体制造链,几行运行在机房里的权重文件不可能越过物理断点凭空毁灭世界。

关键调查基准 vs 极端末日断言 5% 学界灭绝风险预估中位数 2047 高阶智能预期到来时间中位数 >10% Hubinger 十年内灭绝主观推测

抱薪救火的内部人悖论

既然工程现实存在明确断点,为什么 Anthropic 内部这群最聪明的人会恐慌到去买地?

根源在于这群造神者自我构建的道德闭环。Anthropic 早期团队深度受到有效利他主义和长期主义影响。他们信奉一套身在局中(Inside-leverage)的救世逻辑:造神极度危险,但与其让缺乏安全约束的竞品实验室先搞出毁灭性怪物,不如由对末日心存敬畏的自己抢先造出来,从而掌握安全制动权。

抱薪救火,薪不尽,火不灭。

这套逻辑在商业战场上迅速演变成反噬自身的怪圈。为了拥有定义安全的权力,你就必须在能力竞赛中咬住第一梯队;为了留在第一梯队,你就必须筹集海量资本、扫荡算力芯片、加快模型向自主改进迭代演进。

身在局中(Inside-leverage)的异化循环 预感失控风险 恐惧技术灭绝人类 主张身在局中 抢先研发以掌控安全 卷入算力竞逐 商业与国家层面博弈 道德失调与逃离 推高风险后买地避险

当初 Jan Leike 离开 OpenAI 时直斥安全流程让位于光鲜产品,Amodei 兄妹出走创办 Anthropic 也是为了追求纯粹的安全。然而当全行业卷入规模战,任何依赖人工复核的红线都会在发版周期面前步步后退。

技术人员陷入了严重的精神解离。白天在办公室为加速模型能力写代码,晚上在白板上计算失控概率,意识到内部刹车皮早已磨损殆尽,最终只能转头去荒野买地,给家人寻找逃生地标。


谁在为末日神学买单

当不可证伪的物种灭绝叙事占领所有舆论头条时,真正的行业代价已经开始结算。

学者 Arvind Narayanan 曾尖锐指出,渲染虚无缥缈的超级智能末日,最直接的后果是转移全社会对眼下算法造假、版权侵蚀、劳动力替代以及算力集权的注意力。

更深层的算计在于监管护城河。头部实验室把技术包装成毁天灭地的数字核武器,接下来最顺理成章的监管诉求,就是要求政府设立准入门槛:既然这件武器如此危险,就只能发放牌照特许给少数几家具备顶级对齐能力的实验室运行。

不可验证的末日恐惧,就这样被悄然转化为排挤开源社区与中小型创业者的行政壁垒。

面对连物理执行链路都无法闭环的灾难神学,保持清醒不是轻敌,而是基础的工程理性。三十年前那间因为恶作剧而拔掉电源的大学机房,荒唐在于谁都没有先开灯看一眼门窗锁扣。如今面对坐在偏远土地上焦虑的造神者,我们最该确认的,也是机房门上的物理阀门到底掌握在谁手里。