OpenAI 把顶尖学者请进普林斯顿高等研究院当顾问,原本想借象牙塔的金字招牌平息学界对长链推导伪证明的质疑。
事情的发展完全超出了公关团队的预案。
由菲尔兹奖得主 Timothy Gowers、Martin Hairer 与理论物理学家 Edward Witten 领衔的数学与人工智能咨询小组(AGMAI),在汇总超 600 份同行意见后正式发布倡议,公开反对在闭源专有模型上测试高深数学,并对科技公司下达了一份发布规则清单。这记耳光直接抽在了一系列高调宣传的战报脸上。
商业机构本想买一张体面的背书贴纸,结果学者直接在贴纸上写满了刚性禁令。
跑分榜首下的公信力泥潭
纯数学容不下任何模糊空间。做对选择题与完成严谨证明,在科学体系里完全是两种量级的智力劳动。
在初等赛题上,GPT-5 无需外部工具就能在 AIME 邀请赛拿下 94.6% 的高分。到了面向更高难度的长证明评测,OpenAI 的 GPT-5.5 Pro 在 60 道强化题的 Advanced IMO-ProofBench 专家评审中跑出 88.1%,甩开 Gemini 3 Deep Think 的 76.7% 与 Claude Opus 4.5 的 23.8%。第三方测试里甚至流出过满分表现。
但高分没有换来学界的掌声。
DeepMind 靠竞赛协调员官方批改拿到了 35/42 分的国际奥数金牌水平证明,拥有严格的学术背书。OpenAI 的高分却始终停留在未经大赛官方背书的自测状态。更致命的是,自然语言大模型存在结构性顽疾:在数千步的长链推导中,依靠行文的华丽流畅,掩盖逻辑因果中的致命跳步。
强化学习会本能地引导模型去讨好自动化打分器。机器评分只看术语工整、结构连贯,人类数学家扫一眼,就会发现某些代数几何变换纯属无中生有。
九成准确的短答案是有用的计算器;九成正确但中间断了一环的长篇证明,在数学上等于废纸。当商业公司把待评估的 100 多道题库包装成已攻克的科研捷报,甚至暗示拿下了纳维-斯托克斯千禧难题时,象牙塔感受到的不是技术震撼,而是学术优先权被工业级噪声污染的愤怒。

克雷数学所白纸黑字写得清楚,七大千禧难题至今唯一被官方确认攻克的,只有格里戈里·佩雷尔曼证出的庞加莱猜想。FrontierMath 就算再难,人类学者手里也攥着不对模型公开的标准答案;真正的基础科研开放命题,全人类都没有参考书。把评测题库的概念偷换成前沿突破,让 OpenAI 惹上了极其严重的信誉危机。
形式化机器检查与自然语言幻觉的鸿沟
在这轮数理高地争夺战中,主流实验室其实走出了两条截然不同的路线。
一条是依托形式化语言的机器校验。DeepMind 的 AlphaProof 依靠 Lean 这类交互式定理证明系统,推导过程直接编译成严谨的代码。在形式化证明器面前,任何逻辑跳步都无法通过编译。每一步推导必须绝对闭环,不存在给模型自圆其说的语言腾挪空间。
另一条则是依靠大参数与自然语言强推的生成式推理。OpenAI 押注在语言生成的逻辑延展上,模型可以用极为典雅的行文推进拓扑展开,却会在微小的极值条件下发生断裂,甚至把局部数值逼近直接断言成全局完备解。

这就解释了为什么数学家对工业级 AI 发出的战报抱有极深戒心。大模型生成长推导的速度是人类的上万倍,如果不经严格同行评议直接在公关渠道单方面宣布结果,学界要耗费海量智力资源去帮它排查隐蔽漏洞。
Anthropic 面对这轮军备竞赛显得格外收敛,旗下 Opus 4.5 在 ProofBench 上仍停留在两成左右的水位,并没有跟进这场数学数字游戏。OpenAI 跑得最快,也最先撞上了信任墙壁。
跑通代码不等于读懂数学
为了彻底解决形式化编译的软肋,OpenAI 随后亮出了更夸张的工程肌肉:动用约 10,000 个并发智能体、耗时 88 小时,并通过 GPT-6 Astra 完成 17 小时 Lean 验证,声称攻破纳维-斯托克斯方程。按照内部计价,单次猜想验证仅耗费约 2,000 美元算力成本。
代码全亮绿灯,数学家却彻底怒了。
跑通代码和读懂数学是两回事。数学发现千百年来的底层逻辑从来不是只要一个正确答案,而是建立在人类可理解的证明架构上。作者必须通晓全篇脉络,用学术声誉承担责任,进而把个人洞见沉淀为人类智识资产。
OpenAI 呈现出的黑盒怪兽切断了理解链条。写提示词的工程师看不懂推导,背后的研发人员讲不清机制,整套经过 Lean 形式化核验的代码如同一卷完全不可读的天书。机器验证闭环,人类依然两眼一抹黑。
更现实的伤害在于科研秩序被公关截流。正如国际数学联盟支持的《莱顿宣言》所警示,商业机构绕过同行评议直接在博客发布所谓的世纪突破,严重扰乱了青年学者的学术评价与优先权确认。算力巨头在闭源温室里宣称所有权,同行既无法复现,也无法基于黑盒代码继续推进理论构建。
这绝非技术的真正胜利,而是将庞大的排查成本强行扣在学界头上。
两阶段规则与人类消化税
于是,AGMAI 委员会不再充当温和的门面客卿。
这个由 9 位顶尖数学家牵头的小组,在合作之初被商业条款焊死在咨询层面,明文剥夺了对 OpenAI 研发进度的干预权。然而这次联名发布的倡议,直接跳过公司管理层,向整个 AI 工业界立下了规矩。

倡议拿出的两阶段发布框架极为狠辣:
第一阶段锁死技术披露底线。任何实验室发布未被人类理解的成果,必须先完成文献溯源,由语言模型改写出符合学术规范的人类可读论文,并封存进独立学术仓库。更要命的是,巨头必须公开模型版本、提示词、耗费算力,以及尝试失败总数。这一条直接剥光了靠万次并发撞大运、只挑幸存者做公关的底裤。
第二阶段直切利益结算。AI 实验室必须自掏腰包设立非营利专项基金,资助博士后与青年学者去研讨、翻译和消化机器输出的代码。
这绝不是象牙塔向企业索取赞助,而是一笔人类消化税。机器借着资本优势,可以用极低边际成本批量抛出数以百计的高深黑盒推导;人类学者的认知带宽却极为有限。制造信息泥沙的一方,理应为清理河道承担治理成本。
无法被人理解的算力产出不是智识资产,而是转嫁给学术共同体的认知负债。
算力特权割裂学术主权
汉代扬雄论学曾言:“言,心声也;书,心画也。”在纯粹公理的世界里,推导是思维最硬核的刻痕,从来容不得半点文过饰非。
数学曾被视作人类最后的精神自留地。理论物理需要对撞机,现代天文学离不开巨型射电阵列,唯有数学只需纸笔和大脑。如今科技巨头试图用万卡集群和闭源专有模型,把这门古老学科强行拉进算力垄断的轨道。
如果这种黑盒风气不加约束,年轻学者将被迫沦为无薪的代码校对员,百年的同行评议与学术尊严会在算力通胀面前被冲刷殆尽。AGMAI 这次联名立规,是学者在母体学科里夺回话语权的集体自卫。
接下来最值得盯紧的变量非常具体:在下一轮所谓数学突破的战报里,OpenAI 究竟敢不敢交出完整的失败尝试数据与全套推理链条。
知其然而不知其所以然。任凭算力跑通万行代码,若无人类思维的通透洞见,繁复推演不过是精巧的无字天书。
