大模型榜单往往充斥着小数点后两位的微弱胜利,但小米这次把破坏力直接砸在价格上。

基于 MIT 协议开源的 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数评测中以 46 分抢下开源模型头名。更刺眼的是其单项基准测试成本,只有 0.13 美元。在同一张评估表上,45 分的 GLM-5.3 评测成本是 2.01 美元,44 分的 Kimi K3 是 2.00 美元,40 分的 Qwen3.8 2.4T A95B 则是 2.16 美元。纸面数据上,小米不仅压过了同行,还将同级测试成本压缩到了对手的十六分之一。

开源大模型智能指数与单项评测成本对照 MiMo-V2.6-Pro 46分 / 0.13美元 GLM-5.3 45分 / 2.01美元 Kimi K3 44分 / 2.00美元 Qwen3.8 2.4T A95B 40分 / 2.16美元 数据来源:Artificial Analysis v4.3.2(置信区间 ±1分,加权任务成本)

但在登顶的光鲜数据背后,这件事的复杂度远超一次常规的模型上新:

  • 小米公开了强化学习训练全流程开销,Pro 版本训练不到 6 天烧掉 262 万美元,轻量级 Flash 耗资 85 万美元。
  • 极低测试成本源自 4.1% 激活率的稀疏架构与高达 99% 的缓存折扣,普通开发者脱离测试集后很难复现这一低价。
  • Anthropic 随后发布威胁情报,指控小米集群在 20 天内发起超 40 万次交互窃取 Claude 数据,涉嫌违反条款进行微调与强化学习蒸馏。

0.13美元背后的工程杠杆与算力账本

任何看似违反常识的商业低价,拆开来看都是精密的工程取舍。

MiMo-V2.6-Pro 采用稀疏专家架构,虽然标称具备 1.02 万亿总参数并支持 100 万 token 上下文,但单次推理只激活其中的 420 亿参数。每次请求真正调动的计算网络只有 4.1%。这种设计直接降低了前向推理的显存吞吐压力。

更大的价格杠杆藏在 API 的计费结构里。小米把 Pro 的无缓存输入价格定在每百万 token 0.435 美元、输出 0.87 美元,但命中缓存的输入价格骤降至 0.0036 美元。Artificial Analysis 给出的 0.13 美元加权测试成本,由 30% 智能体、20% 代码、20% 科学推理与 30% 通用任务组成,评测流程中重复注入的前缀把缓存折扣放到了最大。如果换成企业日常的随机真实请求,这个成本优势会大幅缩水。

模型检查点 / 对比对象总参数 / 激活参数智能得分评测单任务成本缓存输入单价(/M)输出单价(/M)
MiMo-V2.6-Pro1.02T / 42B46分0.13美元0.0036美元0.87美元
GLM-5.3未完全公开45分2.01美元行业常规价行业常规价
Kimi K3未完全公开44分2.00美元行业常规价行业常规价
Qwen3.8 2.4T2.4T / A95B40分2.16美元行业常规价行业常规价

与低价标准版同步上架的还有高吞吐版本 Pro-UltraSpeed。其输出速度提升约 20 倍,调用单价顺势拉高到输入 4.35 美元、输出 8.70 美元。超低单价负责吸引开发者建立心智,高速版本才是高并发生产场景的收费主力。

小米 MiMo-V2.6 成本与训练宣称解构 公开 RL 运行成本 $2.62M 耗时不到6天 / 7000任务 注:未计入底模预训练总账 DeepSWE 评测偏差 72.6/71.9 报告记录 vs 官方权重表 测试集波动在正常阈值内 架构利用效率 4.1% 1.02T 总量 / 42B 激活 极端稀疏 MoE 换取推理低价

从百万直播到262万落定,大模型自进化的真实开销

在此次正式开源权重前,小米曾上线过一个强化学习实时遥测看板,向全网直播未发布模型的后训练过程。当时看板记录下了一次次真实的显存故障、节点重启与阶段性账单,两项实验累计消耗超百万美元算力与近 600 亿 token。

MiMo-V2.6 阶段性训练记账盘点(截至2026年9月16日快照) 累计算力记账总开销 $106.2万 Pro分支:$76.3万 Flash分支:$33.3万 累计训练采样总量 58.4B Pro已训样本:22.8B Flash已训样本:37.8B 综合百万Token均价 $18.18 Pro单价:约$35.94 / 1M Flash单价:约$8.50 / 1M

随着训练收敛与技术报告公布,最终数据尘埃落定。Pro 版本的完整强化学习训练耗费了 262 万美元,轻量级 Flash 则花去 85 万美元。

这笔钱换来的是整个后训练基础设施的重构。MiMo-V2.6 采用全异步架构,单步设置 1,568 个提示词批次,每个提示词展开 16 条轨迹采样,单步推演生成的计算负荷约 20 亿 token。系统在沙箱中运行代码、捕获异常,利用多环境奖励归一化来调整策略网络。

全异步 Agentic RL 训练回路 动态采样路由 1,568 Prompts 批次 16x 轨迹并行 Rollout 交互环境与行为验证 单步生成吞吐 ~20亿 Token 代码沙箱运行与测试判定 信用分配与策略迭代 多环境混合奖励归一化 异步梯度更新与权重同步

这套高开销工程把 Pro 的 DeepSWE 测试跑分拉升到 70 分以上。在训练看板早期,Pro 第 8 步的得分仅为 62.24,Flash 第 12 步为 60.77;最终技术报告宣称达到了 72.6,开源社区在 Hugging Face 权重实测为 71.9。虽然略有波动,但确实跨过了可用门槛。

不过必须厘清一个事实:262 万美元只是这轮强化学习对齐的开销,底模预训练消耗的惊人资源并没有算在这笔账里。

40万次调用的蒸馏疑云与后发者的灰色捷径

如果说 0.13 美元撕开的是定价体系,Anthropic 甩出的威胁情报报告则直接指向了合规隐患。

Anthropic 在报告中指出,代号 GTG-16008 的集群在 20 天内调动 1,500 多个账号,向 Claude 发起了超过 40 万次调用。Anthropic 认定这批流量来自小米,指控其收集真实用户问题后灌入 Claude 生成高价值微调与奖励反馈数据,以此规避条款限制完成低成本蒸馏。

把这份指控摆在放大镜下,结论需要审慎区分:

  1. 40 万次对话对于万亿参数基础模型而言体量太小,无法单独撑起一个底座的通识能力。
  2. Anthropic 承认未发现普通用户会话被直接透传也没有美国敏感个人数据泄露的证据。
  3. 截至目前小米并未对此公开表态,也没有第三方机构对 MiMo-V2.6 的权重完成溯源审查。

在工业界,这种争端更像一场不可避免的遭遇战。先行者筑起付费围墙与防抓取条款,后发者则利用先行模型产出高质量合成数据来快速对齐。

《淮南子》有言:名者,实之宾也。榜单上的 46 分抢下了第一的名声,但在真实软件工程的重构与修复中,极端稀疏的 MoE 架构能否扛住无缓存场景的考验,社区的代码复现会给出答案。工程手段能压缩账本,但当数据来源的争议摆上桌面,低成本超车的代价迟早需要对冲结算。