Liquid AI在8月4日发布了一款叫LFM2.5-2.6B的端侧智能体模型,通稿里的数字很漂亮:2.6B参数,训练量约34万亿token,上下文扩到128K,苹果M5 Max上能跑到220 tokens/s,内存占用不到2.5GB。官方的说法是,这颗小模型能打过体量4倍的对手。
但把这套规格摊开,对着Liquid AI自己前后发布的另外两款模型一比,会发现一件更值得琢磨的事:这些数字不是全新的成绩单,更像是从别的型号身上抠出来又拼了一遍,彼此对不上号。
官方讲了什么
事实先说清楚。LFM2.5-2.6B的后训练分四步:两轮监督微调,重点喂工具调用和网页搜索数据;针对数学、代码、工具等领域各训一个专家教师;把专家蒸馏进一个学生模型(官方叫MOPD);最后在真实agent环境里做多轮强化学习,让模型在OpenClaw、Hermes Agent这类真实工具框架里学着干活,而不是纸上答题。
在官方自测的跑分里,LFM2.5-2.6B确实好看:指令遵循类基准全面领先,工具调用除了BFCLv4被9.7B的Qwen3.5小胜之外全部拿下,编程一项则明确输给更大的模型——这一点官方自己也没藏。
数字从哪来
问题出在“34T tokens、128K上下文、220 tok/s”这套具体数字上。检索能查到的Liquid AI在售的LFM2-2.6B(注意,没有“.5”),模型卡写的是10T训练token、32,768上下文长度。而同系列的LFM2.5-8B-A1B,官方规格是38T token、128K上下文、M5 Max上253 tok/s、内存占用低于6GB。
| 型号 | 训练量 | 上下文 | M5 Max速度 | 内存占用 |
|---|---|---|---|---|
| LFM2-2.6B | 10T tokens | 32,768 | — | — |
| LFM2.5-2.6B(本次) | ~34T tokens | 128K | 220 tok/s | <2.5GB |
| LFM2.5-8B-A1B | 38T tokens | 128K | 253 tok/s | <6GB |
一个2.6B的模型,训练量、上下文长度、推理速度都跟一个8B的模型贴得很近,唯独体量小三倍。这不必然是错的——小架构确实可能吃得下更多数据、跑得更快——但截至发布当天,检索没能定位到LFM2.5-2.6B完整独立的官方模型卡,只在Liquid AI更早一篇研究博客里见过一个内部早期checkpoint的提法。数字对得上还是抄错了页码,目前谁也说不清。
通稿里的胜负,终究只是自家账本。
验证链缺在哪一环
更该在意的是另一件事:文中所有对比Gemma、Qwen的benchmark,全部是Liquid AI自己测的。没有任何独立机构或开源社区做过复现。
- 风险.所有对比数据均为厂商自测,尚无独立复现,选型或做技术评估前建议等模型卡数字对齐、等社区跑一轮验证。
谁该在意,接下来看什么
端侧agent小模型是真趋势,这点不用怀疑。隐私数据不出设备、不用付云端推理费、手机笔记本就能跑本地agent——Gemma、Qwen、Phi都在同一条赛道上抢位置,Liquid AI用LFM2这套非标准Transformer架构打速度和内存牌,方向没错。
- 结论.LFM2、LFM2.5-350M、LFM2.5-8B-A1B、LFM2.5-2.6B几个型号密集发布,规格自己都对不齐,说明这一轮竞争已经进入“发布节奏跑到工程验证前面”的阶段。
这不是说LFM2.5-2.6B不行,而是它现在能证明的东西,比通稿里写的少一截。荀子说“耳闻之不若目见之,目见之不若足践之”——听说的不如亲眼看到的可靠,亲眼看到的又不如亲手验证过。Liquid AI给的是耳闻,开发者真正要的,是足践。开发者和企业客户接下来该盯的,不是这次跑分好不好看,而是官方模型卡什么时候把数字钉死、社区什么时候跑出第一份独立复现——这两步走完之前,“2.6B打4倍体量”还只是一句漂亮的开场白。
