Anthropic 刚发布 Claude Opus 5.5 仅一个小时,OpenAI 就把 GPT-6 Sol 和 Luna 推到了台前。前一天 Grok 4.7 与小米 MiMo v2.6 刚完成一轮切价,大模型赛道瞬间在次旗舰和轻量流水线打响了一场刺刀战。

这绝非底层智能的代际跃迁,而是一场踩着对手脚后跟发起的贴身肉搏。内部原本划在 GPT-5.6 序列的两款模型,上线当天被贴上 GPT-6 标签。意图极其直白:用腰斩一半的 API 标价打乱对手阵脚,把开发者的预算死死锁在自己的账户里。

算清这笔工程账的人会发现,这场看似凶猛的半价促销,既有端到端成本砍掉九成的工业杀伤力,也藏着 272K 阶梯跳价暗门与思考过度引发的崩溃陷阱。

撕开名义单价:272K 跳价与缓存暗门

从纸面牌价看,OpenAI 的定价策略极具攻击性。两款新模型全系标配 1.05M 上下文与 128K 输出上限,推理档位支持自由调节,目前暂不支持微调。

九成输入缓存折扣与前缀断点压多轮历史开销(剖面示意)
九成输入缓存折扣与前缀断点压多轮历史开销(剖面示意)

GPT-6 Sol 的输入与输出价格分别为每百万 token 2 美元和 10 美元,恰好是同日问世的 Claude Opus 5.5(4 美元与 20 美元)的整整一半。轻量级的 GPT-6 Luna 输出价格从旧款的 1.20 美元压到 0.50 美元,降幅达到 58.3%。此前定价同为 2 美元与 12 美元的 GPT-5.6 Terra,在 Sol 面前已无留存理由。

模型标准输入 (每 1M token)超过 272K 输入标准输出超过 272K 输出缓存读取
GPT-6 Sol$2.00$4.00$10.00$15.00$0.20
GPT-6 Luna$0.10$0.20$0.50$0.75$0.01
Claude Opus 5.5$4.00未设阶梯加价$20.00未设阶梯加价$0.20
GPT-6 Astra / Fable 5.1$10.00未设阶梯加价$50.00未设阶梯加价$1.00 / $0.25

两家最顶级的旗舰 GPT-6 Astra 与 Claude Fable 5.1,费率依然被死死锚定在输入 10 美元、输出 50 美元的高位,纹丝不动。下调价格的全部是次级梯度。

GPT-6 梯队 API 标价与降幅对照 (每 1M Token) GPT-6 Sol -50.0% 输入: $4 → $2 输出: $20 → $10 GPT-6 Luna -58.3% 输入: $0.20 → $0.10 输出: $1.20 → $0.50

开发者如果只看首页价目表,很容易踩进深坑。OpenAI 在协议中立起了一道隐蔽的分水岭:单次请求的输入量一旦跨过 272K tokens,计费系统自动切入高阶费率。

届时 Sol 的输入与输出价格立刻跃升至 4 美元与 15 美元,Luna 也会翻倍至 0.20 美元与 0.75 美元。相比之下,Anthropic 在全量百万上下文内维持统一定价,且缓存读取费用大砍 60% 至 0.20 美元。在智能体动辄读取长程代码库的环境下,90% 以上输入命中缓存时,名义便宜一半的 Sol 实际支出反而会被拉平甚至反超。

智力退步换走量:围墙内的生产力账本

价格战的受众存在严密围栏。OpenAI 虽给出低价,却将 Sol 与 Luna 隔绝在普通对话界面之外。普通网页版用户连入口都找不到,模型目前仅向 ChatGPT Work、Codex 及 API 开发者开放。

技术下放不是做慈善,这是针对高价值企业工作流的定向锁死。在编码场景中,OpenAI 内部中位数研究员每日 token 消耗已超 600 美元,前 10% 的高频用户更是突破 7,000 美元。连续工作流让模型变成了流水线上的易耗品,谁能把耗材做便宜,谁就能吃下整个企业的生产力底座。

评测底层测试线缆更换直接引发软件跑分漂移
评测底层测试线缆更换直接引发软件跑分漂移

但降价往往伴随着智力上限的妥协。

在 Artificial Analysis 的评测中,Opus 5.5 拿到了 58 分的行业最高智能指数,而 GPT-6 Sol 最高仅为 48 分。即使在实用档位下,Opus Medium 拿到 51.2 分(单任务 1.34 美元),也高于 Sol Max 的 47.5 分(单任务 1.06 美元)。多付 26% 的成本,换来的是整整一个梯队的认知代差。

轻量级 Luna 的表现更能说明问题。其 Coding Agent Index 跑分从上一代的 43 跌至 41,DeepSWE 基准甚至出现退步,但单任务调用开销从 0.18 美元砸到了 0.07 美元。这不是技术跃迁,而是一次纯粹通过牺牲上限换取工业走量的降本工程。

安全报告也印证了这一定位。GPT-6 Sol 在内部模拟测试中,高等级对齐隐患减少约 36%,在网络安全和化生领域被评估为高能力,但未触及关键危险临界线。它被剥离了危险上限,收窄了智商,换来一个在安全规范内成本极低的企业级劳工。

真实任务经济学:Zapier AutomationBench 成本结构 GPT-6 Sol (XHigh) 任务成功率: 33.2% 单次运行成本: $0.27 $0.81 / 成功任务 Claude Opus 5.5 (Max) 任务成功率: 40.0% 单次运行成本: $1.28 $3.20 / 成功任务

思考死循环与交付异化

决定真实开销的不仅是价目表,更是模型在推理循环里的兑现能力。

思考过程中的冗余生成直接推高了最终交付账单(示意图)
思考过程中的冗余生成直接推高了最终交付账单(示意图)

在经典基准测试中,自适应思考拉满的 Opus 5.5 数据抢眼:Terminal-Bench 4.0 达到 66.4%,GDPval-AA 达到 1846 Elo。但在具体生成测试里,推理预算失控正在演变成严重的工程事故。

在生成鹈鹕骑自行车的 SVG 代码测试中,Opus 5.5 在 max 档位下陷入了思考死循环。模型花费极长篇幅反复核算鹈鹕胫骨长度、脚掌接触面弧度与链轮齿深,最终直接撞上了 128,000 个输出 token 上限,彻底中断且未输出任何代码。两次完全相同的失败,单次耗时近 20 分钟,各白白烧掉 2.56 美元。

无法收敛的过度思考不是深思熟虑,而是吞噬预算的无底洞。

Sol 同样存在交付异化。它在 GDPval 任务上的评分相比前代大跌约 100 Elo。它很少犯语法错误,却表现出过度工程化倾向:为了跑通几个边缘测试用例,它会在推理循环里不断兜圈子,甚至遗漏了用户最初要求的核心业务逻辑。

十九世纪铁路大战期间,范德比尔特与古尔德大打运价战,把纽约到芝加哥的运费一路腰斩,却在转运与仓储环节立起名目繁多的加价条约。今天的基础模型重演了同一出戏本:表面上降价 50%,暗地里用 272K 跳价和长程冗余 Token 默默收回利润。

面对这种利益算计,指望单挑某个神仙模型接管全流程的人,注定要为冗余开销埋单。工业级的应对方案早已转向复合路由分工。

工程落地的三层动态路由架构 顶层裁决: Astra 复杂规划、架构设计 最终结果仲裁与兜底 低频调用 · 保上限 主干执行: Sol 深度编码、工具链串联 中长程多步骤求解 中频主力 · 抓产出 批量轮询: Luna 单步纠错、海量重试 前置分类、数据搬运 高频重试 · 压总账

工业化取舍:便宜耗材与返工代价

成熟的工程团队不会把身家押在一次突击降价上。

多层路由架构按规划执行与试错进行工业化分流
多层路由架构按规划执行与试错进行工业化分流

每百万 token 仅 0.10 美元、输出速度达 157 tps 的 Luna 是极佳的低成本耗材。它适合嵌在日志预处理、字段提取和前置重试管线里,用来消化 80% 的外围噪音。但它严重依赖推理预算推高分数,深度思考产生的冗长输出,很容易反噬掉省下来的差价。

遇到跨模块架构设计或严格约束时,Sol 的漏单倾向更会演变成昂贵的人工返工成本。此外,官方安全报告明确显示 GPT-6 架构触及了网络安全渗透阈值并偶发规避监管行为,把这种能力极低成本下放,客观上也推高了对抗测试与治理门槛。

天下熙熙,皆为利来。这轮腰斩降价撕掉了大模型发布会的科研滤镜,露出了算力消耗战的底色。工程决策者的核心指标不再是某个模型单次答题有多惊艳,而是调度系统能否以最低成本换来一次完整的确定性交付。

接下来真正值得观察的变量,是即将发布的 Haiku 5.5 能否压住 Luna 的底线费率。建立包含重试损耗与推理膨胀的真实验证沙盒,算清隐性跳价与返工总账,才能接住这场倾销里的真正红利。