大模型榜单往往充斥着小数点后两位的微弱胜利,但小米这次把破坏力直接砸在价格上。
基于 MIT 协议开源的 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数评测中以 46 分抢下开源模型头名。更刺眼的是其单项基准测试成本,只有 0.13 美元。在同一张评估表上,45 分的 GLM-5.3 评测成本是 2.01 美元,44 分的 Kimi K3 是 2.00 美元,40 分的 Qwen3.8 2.4T A95B 则是 2.16 美元。纸面数据上,小米不仅压过了同行,还将同级测试成本压缩到了对手的十六分之一。
但在登顶的光鲜数据背后,这件事的复杂度远超一次常规的模型上新:
- 小米公开了强化学习训练全流程开销,Pro 版本训练不到 6 天烧掉 262 万美元,轻量级 Flash 耗资 85 万美元。
- 极低测试成本源自 4.1% 激活率的稀疏架构与高达 99% 的缓存折扣,普通开发者脱离测试集后很难复现这一低价。
- Anthropic 随后发布威胁情报,指控小米集群在 20 天内发起超 40 万次交互窃取 Claude 数据,涉嫌违反条款进行微调与强化学习蒸馏。
0.13美元背后的工程杠杆与算力账本
任何看似违反常识的商业低价,拆开来看都是精密的工程取舍。
MiMo-V2.6-Pro 采用稀疏专家架构,虽然标称具备 1.02 万亿总参数并支持 100 万 token 上下文,但单次推理只激活其中的 420 亿参数。每次请求真正调动的计算网络只有 4.1%。这种设计直接降低了前向推理的显存吞吐压力。
更大的价格杠杆藏在 API 的计费结构里。小米把 Pro 的无缓存输入价格定在每百万 token 0.435 美元、输出 0.87 美元,但命中缓存的输入价格骤降至 0.0036 美元。Artificial Analysis 给出的 0.13 美元加权测试成本,由 30% 智能体、20% 代码、20% 科学推理与 30% 通用任务组成,评测流程中重复注入的前缀把缓存折扣放到了最大。如果换成企业日常的随机真实请求,这个成本优势会大幅缩水。
| 模型检查点 / 对比对象 | 总参数 / 激活参数 | 智能得分 | 评测单任务成本 | 缓存输入单价(/M) | 输出单价(/M) |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro | 1.02T / 42B | 46分 | 0.13美元 | 0.0036美元 | 0.87美元 |
| GLM-5.3 | 未完全公开 | 45分 | 2.01美元 | 行业常规价 | 行业常规价 |
| Kimi K3 | 未完全公开 | 44分 | 2.00美元 | 行业常规价 | 行业常规价 |
| Qwen3.8 2.4T | 2.4T / A95B | 40分 | 2.16美元 | 行业常规价 | 行业常规价 |
与低价标准版同步上架的还有高吞吐版本 Pro-UltraSpeed。其输出速度提升约 20 倍,调用单价顺势拉高到输入 4.35 美元、输出 8.70 美元。超低单价负责吸引开发者建立心智,高速版本才是高并发生产场景的收费主力。
从百万直播到262万落定,大模型自进化的真实开销
在此次正式开源权重前,小米曾上线过一个强化学习实时遥测看板,向全网直播未发布模型的后训练过程。当时看板记录下了一次次真实的显存故障、节点重启与阶段性账单,两项实验累计消耗超百万美元算力与近 600 亿 token。
随着训练收敛与技术报告公布,最终数据尘埃落定。Pro 版本的完整强化学习训练耗费了 262 万美元,轻量级 Flash 则花去 85 万美元。
这笔钱换来的是整个后训练基础设施的重构。MiMo-V2.6 采用全异步架构,单步设置 1,568 个提示词批次,每个提示词展开 16 条轨迹采样,单步推演生成的计算负荷约 20 亿 token。系统在沙箱中运行代码、捕获异常,利用多环境奖励归一化来调整策略网络。
这套高开销工程把 Pro 的 DeepSWE 测试跑分拉升到 70 分以上。在训练看板早期,Pro 第 8 步的得分仅为 62.24,Flash 第 12 步为 60.77;最终技术报告宣称达到了 72.6,开源社区在 Hugging Face 权重实测为 71.9。虽然略有波动,但确实跨过了可用门槛。
不过必须厘清一个事实:262 万美元只是这轮强化学习对齐的开销,底模预训练消耗的惊人资源并没有算在这笔账里。
40万次调用的蒸馏疑云与后发者的灰色捷径
如果说 0.13 美元撕开的是定价体系,Anthropic 甩出的威胁情报报告则直接指向了合规隐患。
Anthropic 在报告中指出,代号 GTG-16008 的集群在 20 天内调动 1,500 多个账号,向 Claude 发起了超过 40 万次调用。Anthropic 认定这批流量来自小米,指控其收集真实用户问题后灌入 Claude 生成高价值微调与奖励反馈数据,以此规避条款限制完成低成本蒸馏。
把这份指控摆在放大镜下,结论需要审慎区分:
- 40 万次对话对于万亿参数基础模型而言体量太小,无法单独撑起一个底座的通识能力。
- Anthropic 承认未发现普通用户会话被直接透传也没有美国敏感个人数据泄露的证据。
- 截至目前小米并未对此公开表态,也没有第三方机构对 MiMo-V2.6 的权重完成溯源审查。
在工业界,这种争端更像一场不可避免的遭遇战。先行者筑起付费围墙与防抓取条款,后发者则利用先行模型产出高质量合成数据来快速对齐。
《淮南子》有言:名者,实之宾也。榜单上的 46 分抢下了第一的名声,但在真实软件工程的重构与修复中,极端稀疏的 MoE 架构能否扛住无缓存场景的考验,社区的代码复现会给出答案。工程手段能压缩账本,但当数据来源的争议摆上桌面,低成本超车的代价迟早需要对冲结算。
