Anthropic 刚发布 Claude Opus 5.5 仅一个小时,OpenAI 就把 GPT-6 Sol 和 Luna 推到了台前。前一天 Grok 4.7 与小米 MiMo v2.6 刚完成一轮切价,大模型赛道瞬间在次旗舰和轻量流水线打响了一场刺刀战。
这绝非底层智能的代际跃迁,而是一场踩着对手脚后跟发起的贴身肉搏。内部原本划在 GPT-5.6 序列的两款模型,上线当天被贴上 GPT-6 标签。意图极其直白:用腰斩一半的 API 标价打乱对手阵脚,把开发者的预算死死锁在自己的账户里。
算清这笔工程账的人会发现,这场看似凶猛的半价促销,既有端到端成本砍掉九成的工业杀伤力,也藏着 272K 阶梯跳价暗门与思考过度引发的崩溃陷阱。
撕开名义单价:272K 跳价与缓存暗门
从纸面牌价看,OpenAI 的定价策略极具攻击性。两款新模型全系标配 1.05M 上下文与 128K 输出上限,推理档位支持自由调节,目前暂不支持微调。

GPT-6 Sol 的输入与输出价格分别为每百万 token 2 美元和 10 美元,恰好是同日问世的 Claude Opus 5.5(4 美元与 20 美元)的整整一半。轻量级的 GPT-6 Luna 输出价格从旧款的 1.20 美元压到 0.50 美元,降幅达到 58.3%。此前定价同为 2 美元与 12 美元的 GPT-5.6 Terra,在 Sol 面前已无留存理由。
| 模型 | 标准输入 (每 1M token) | 超过 272K 输入 | 标准输出 | 超过 272K 输出 | 缓存读取 |
|---|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $4.00 | $10.00 | $15.00 | $0.20 |
| GPT-6 Luna | $0.10 | $0.20 | $0.50 | $0.75 | $0.01 |
| Claude Opus 5.5 | $4.00 | 未设阶梯加价 | $20.00 | 未设阶梯加价 | $0.20 |
| GPT-6 Astra / Fable 5.1 | $10.00 | 未设阶梯加价 | $50.00 | 未设阶梯加价 | $1.00 / $0.25 |
两家最顶级的旗舰 GPT-6 Astra 与 Claude Fable 5.1,费率依然被死死锚定在输入 10 美元、输出 50 美元的高位,纹丝不动。下调价格的全部是次级梯度。
开发者如果只看首页价目表,很容易踩进深坑。OpenAI 在协议中立起了一道隐蔽的分水岭:单次请求的输入量一旦跨过 272K tokens,计费系统自动切入高阶费率。
届时 Sol 的输入与输出价格立刻跃升至 4 美元与 15 美元,Luna 也会翻倍至 0.20 美元与 0.75 美元。相比之下,Anthropic 在全量百万上下文内维持统一定价,且缓存读取费用大砍 60% 至 0.20 美元。在智能体动辄读取长程代码库的环境下,90% 以上输入命中缓存时,名义便宜一半的 Sol 实际支出反而会被拉平甚至反超。
智力退步换走量:围墙内的生产力账本
价格战的受众存在严密围栏。OpenAI 虽给出低价,却将 Sol 与 Luna 隔绝在普通对话界面之外。普通网页版用户连入口都找不到,模型目前仅向 ChatGPT Work、Codex 及 API 开发者开放。
技术下放不是做慈善,这是针对高价值企业工作流的定向锁死。在编码场景中,OpenAI 内部中位数研究员每日 token 消耗已超 600 美元,前 10% 的高频用户更是突破 7,000 美元。连续工作流让模型变成了流水线上的易耗品,谁能把耗材做便宜,谁就能吃下整个企业的生产力底座。

但降价往往伴随着智力上限的妥协。
在 Artificial Analysis 的评测中,Opus 5.5 拿到了 58 分的行业最高智能指数,而 GPT-6 Sol 最高仅为 48 分。即使在实用档位下,Opus Medium 拿到 51.2 分(单任务 1.34 美元),也高于 Sol Max 的 47.5 分(单任务 1.06 美元)。多付 26% 的成本,换来的是整整一个梯队的认知代差。
轻量级 Luna 的表现更能说明问题。其 Coding Agent Index 跑分从上一代的 43 跌至 41,DeepSWE 基准甚至出现退步,但单任务调用开销从 0.18 美元砸到了 0.07 美元。这不是技术跃迁,而是一次纯粹通过牺牲上限换取工业走量的降本工程。
安全报告也印证了这一定位。GPT-6 Sol 在内部模拟测试中,高等级对齐隐患减少约 36%,在网络安全和化生领域被评估为高能力,但未触及关键危险临界线。它被剥离了危险上限,收窄了智商,换来一个在安全规范内成本极低的企业级劳工。
思考死循环与交付异化
决定真实开销的不仅是价目表,更是模型在推理循环里的兑现能力。

在经典基准测试中,自适应思考拉满的 Opus 5.5 数据抢眼:Terminal-Bench 4.0 达到 66.4%,GDPval-AA 达到 1846 Elo。但在具体生成测试里,推理预算失控正在演变成严重的工程事故。
在生成鹈鹕骑自行车的 SVG 代码测试中,Opus 5.5 在 max 档位下陷入了思考死循环。模型花费极长篇幅反复核算鹈鹕胫骨长度、脚掌接触面弧度与链轮齿深,最终直接撞上了 128,000 个输出 token 上限,彻底中断且未输出任何代码。两次完全相同的失败,单次耗时近 20 分钟,各白白烧掉 2.56 美元。
无法收敛的过度思考不是深思熟虑,而是吞噬预算的无底洞。
Sol 同样存在交付异化。它在 GDPval 任务上的评分相比前代大跌约 100 Elo。它很少犯语法错误,却表现出过度工程化倾向:为了跑通几个边缘测试用例,它会在推理循环里不断兜圈子,甚至遗漏了用户最初要求的核心业务逻辑。
十九世纪铁路大战期间,范德比尔特与古尔德大打运价战,把纽约到芝加哥的运费一路腰斩,却在转运与仓储环节立起名目繁多的加价条约。今天的基础模型重演了同一出戏本:表面上降价 50%,暗地里用 272K 跳价和长程冗余 Token 默默收回利润。
面对这种利益算计,指望单挑某个神仙模型接管全流程的人,注定要为冗余开销埋单。工业级的应对方案早已转向复合路由分工。
工业化取舍:便宜耗材与返工代价
成熟的工程团队不会把身家押在一次突击降价上。

每百万 token 仅 0.10 美元、输出速度达 157 tps 的 Luna 是极佳的低成本耗材。它适合嵌在日志预处理、字段提取和前置重试管线里,用来消化 80% 的外围噪音。但它严重依赖推理预算推高分数,深度思考产生的冗长输出,很容易反噬掉省下来的差价。
遇到跨模块架构设计或严格约束时,Sol 的漏单倾向更会演变成昂贵的人工返工成本。此外,官方安全报告明确显示 GPT-6 架构触及了网络安全渗透阈值并偶发规避监管行为,把这种能力极低成本下放,客观上也推高了对抗测试与治理门槛。
天下熙熙,皆为利来。这轮腰斩降价撕掉了大模型发布会的科研滤镜,露出了算力消耗战的底色。工程决策者的核心指标不再是某个模型单次答题有多惊艳,而是调度系统能否以最低成本换来一次完整的确定性交付。
接下来真正值得观察的变量,是即将发布的 Haiku 5.5 能否压住 Luna 的底线费率。建立包含重试损耗与推理膨胀的真实验证沙盒,算清隐性跳价与返工总账,才能接住这场倾销里的真正红利。
