AI 已经能设计出降解塑料的工程酶和中和蛇毒的结合蛋白,但生命科学的防暴门却被推到了悬崖边。
以往生物安全拦截全靠已知数据库。只要提交合成的核酸序列跟天花或埃博拉吻合,流水线立刻报警。当生成模型凭空捏造出自然界从未存在、三维结构却致命的全新毒性蛋白时,传统的比对系统直接脱靶。
Google DeepMind 选在《Nature》给出了自己的解法:专为蛋白质设计的水印技术 SynthID Bio。这项技术微调了 AlphaFold 3 扩散网络与 ProteinMPNN 的采样逻辑,试图在不影响蛋白质活性和空间折叠的前提下,把一段隐形密码刻进物理实体。
研发团队用湿实验证明了分子功效。在针对 VEGF-A、新冠病毒刺突蛋白 RBD 和 PD-L1 的测试中,带水印分子的结合亲和力与未修改版毫无差异。此前 AlphaProteo 针对 VEGF-A 设计的结合蛋白亲和力曾冲到 0.48 nM 与 4.7 nM,这次的水印注入确实做到了零功能损耗。
DeepMind 想建立一条合规快速通道:商业基因代工厂识别到受信任私钥,就放行订单。然而,把数字版权领域的防伪逻辑搬进湿法实验室,注定要撞上物理现实。数字水印能证明分子出自哪座算法工厂,却给不出分子进入物理世界后的安全背书。
20种氨基酸里的极简密室
在大语言模型或数字图片里藏信息并不难。图片拥有数百万像素,大语言模型坐拥数万词表,算法只要在概率分布上施加人眼难察的轻微扰动,就能把信号摊薄在巨大的冗余空间里。DeepMind 在 2024 年发表于《Nature》的文本水印,走的正是这条统计路子。
蛋白质的世界完全是另一重物理极境。
自然界搭建蛋白质的原料只有 20 种氨基酸。一条 500 个残基的序列在生化领域已属大分子,放在信息编码视角下,只是区区数百个字符的狭窄窗口。更严苛的是侧链物理法则,电荷、极性、疏水性只要错位一个原子,三维结构就会垮塌,分子活性瞬间归零。
当前主流蛋白质生成管线分工清晰:RFdiffusion 负责主链骨架,华盛顿大学 David Baker 团队 2022 年发表在《Science》上的 ProteinMPNN 负责氨基酸逆折叠匹配,ESM-3 负责多模态生成。
SynthID Bio 把干预点卡在 ProteinMPNN 逐位放置残基的环节。算法依照私钥偏置候选,遇到亮氨酸与异亮氨酸、丝氨酸与苏氨酸这类化学性质相近的残基时,优先选择命中的密码位;一旦检测到位点变动可能破坏结合活性,系统立刻放弃编码。它没留任何明码标签,而是把统计扰动散布在整条长链上。
这在工程上非常巧妙,甚至比 DNA 层面的同义密码子标记更进了一步。密码子标记只要换一套宿主表达系统就会脱落,氨基酸水印则跟着实体结构走。但本质上,它依旧只是一张证明技术来源的出生证明。
代工厂的数学账本与误报泥潭
美国白宫科技政策办公室(OSTP)在 2024 年发布了《核酸合成筛查框架》,要求代工厂接单时必须过滤生物威胁。Twist Bioscience 这类合成厂商每天都在面对巨量陌生序列带来的人工审核延误。2025 年红队测试表明,现有系统对已知高风险变体的拦截率维持在 97%,但对纯算法生成的未知蛋白,审核人员常常陷入两难。
DeepMind 设想给合规药企和科研所发放私钥,代工厂通过验证水印建立绿色通道。这一设想在实验室样本里跑得通,下沉到高通量工业流水线时,却撞上了严酷的统计学阻碍。
在学术基准中,ProteinWatermark 在 10,000 条序列和 1,000 个私钥测试下的单次误报率为 0.000107,漏报率为 0.0022。单看万分之一的假阳性率似乎足够安全。但工业代工厂面对的是全行业生态,必须同时维护数百上千个科研实体的私钥库。
统计学推导非常无情:即便每个私钥的误报率被压制在万分之一(10^-4),当系统去比对 1,000 个授权私钥时,整体产生至少一次假阳性匹配的概率就会飙升到 9.5%。而在日处理数千万碱基对的高通量流水线上,哪怕把单条误报率压到百万分之一(10^-6),筛查 1 亿条阴性序列样本依然会炸出约 100 次人工核查警报。
近十分之一的误报归属,意味着正常科研订单会被无休止地挂起核验。代工厂经不起这种流水线迟滞,更承担不起把陌生毒素误判为合法机构输出的法律后果。
本地脱缰与湿实验清洗
撇开统计账本,单纯把安全押注在软件层,忽视了合成生物学的攻防物理不对称。
学术界早前针对 AF3 与 RFdiffusion 开发的结构水印 FoldMark,数据同样惊艳:在假阳性率 10^-5 门槛下保有 90% 以上真阳性率,32 位签名恢复率超 95%,结构质量评分 scTM 维持在 0.9 以上。但研究人员直接在论文里写明了破绽:只需用开源的 ProteinMPNN 或 ESM-IF 对该构象执行一次逆向反折叠,重新采样氨基酸,空间水印瞬间瓦解,致病构象完好无损。
恶意制造者甚至不需要高等级实验室。ProteinMPNN 的权重早已开源,任何人都能在断网的工作站上运行没有植入 SynthID Bio 补丁的原生模型,随心所欲生成裸奔序列。
而在正规研发环节,真实的分子生物学操作同样是水印粉碎机。为了提升表达量或热稳定性,研究员会对序列做定向进化与随机点突变,或者将人工肽段跟天然载体蛋白融合表达。
一条 300 个残基的多肽被动了 10% 的非关键位点,或者前后挂上了数千碱基的载体片段,原本微弱的统计偏置就会被迅速稀释。此时下游代工厂该拒单还是该放行?
防务之难常在末梢
《商君书》有言:立禁者,重在必行;塞邪者,贵在得法。以软件私钥防范物理生物威胁,本质上是试图用数字围栏圈住具备物理杀伤力的物质实体。
这就像枪械工业的发展史。你可以要求主流兵工厂在枪膛内雕刻防伪编号,但如果黑作坊在地下室靠简易车床就能切削零件,枪膛上的编号就只能约束良民。
如果代工厂因为政策倾斜,把巨头的水印作为唯一放行凭证,开源社区和独立高校实验室会立刻沦为审批泥潭里的二等公民;而真正的恶意分子,早已绕过受控 API,在本地算力上抹平了特征。
生物防御真正的硬闭环永远在末梢。它必须落在无法被算法绕过的物理节点上:核酸合成仪的底层固件锁与硬件销售许可、商业代工厂对合成物直接展开的物理结合毒性预测,以及双重用途生化试剂的实体流通溯源。
SynthID Bio 证明了工程团队能在极端苛刻的化学空间里给分子刺青,这种数学精密感值得称赞。但指望在模型接口处贴一张数字良民证来买单生物安全,终究是高估了算法的管辖权,低估了大自然的容差与对抗的代价。
