让几百亿参数的大模型逐字吐出一段 JSON,只为了给工单分流或判断用户是否想退款,是当下智能体架构里最笨拙的工程妥协。开发团队在提示词里求神拜佛约束格式,在下游挂满正则表达式防崩溃,本质上是在用写长篇小说的引擎去充当机房网络开关。
Cloudflare 近期正式开源决策模型 Clef 与轻量版 Clef-flash,宣布把判断延迟压进 38.8 毫秒,甚至打出 AI 智能体不再需要人类在环的公关口号。
这家掌控全球大量网络流量的基础设施巨头,正试图用边缘节点的地理包抄,从中心化大模型手里抢下第一道调度权。
斩断自回归:把模型降维为类型化电键
通用大模型擅长推理,但不适合做开关。自回归机制要求模型逐词解码,一旦网络抖动或语法微调,格式漂移就会让整个业务链路挂起。
Clef 的思路非常干脆。底模分别采用阿里的 Qwen3.8-27B 与 Qwen3.5-9B,但在推理阶段直接剔除了自回归文本生成。它只执行预填充阶段来提取上下文特征,再通过联合模式头并行评估候选标签。模型不再向客户端吐出一个汉字或字符,而是直接输出确定性的浮点数概率分布。
这套输出形态被固化在三种类型内:布尔判断 noul、多选分类 choice 与顺序量表 score,单次调用能并发评估最多 64 个问题。两款模型原生支持 65,536 tokens 上下文与多模态输入,接口完全对齐了此前 TypeSafe 推出的 Jev 规范。
官方基准测试里,Clef-flash 中位延迟压在 38.8 毫秒,p95 延迟为 122.4 毫秒,比竞品 Jev 的 524.1 毫秒缩短了 13.5 倍;全尺寸 Clef 延迟在 209.3 毫秒。
程序网关不需要再去解析不可靠的长文本,而是能够像配置防火墙一样,把阈值设在特定的浮点数上。容错逻辑和粘合代码被成批移除,系统获得了确定性的数据格式。
5倍溢价与物理包抄:算力账本里的商业算盘
极速通常有其代价。如果把目光从漂亮的时延柱状图移到账单明细上,这场技术创新的底色就变了。
| 评估维度 | Cloudflare Clef (27B) | Cloudflare Clef-flash (9B) | TypeSafe Jev |
|---|---|---|---|
| 中位延迟 | 209.3 ms | 38.8 ms | 524.1 ms |
| 输入 Token 单价 | 0.24 美元 / M tokens | 0.09 美元 / M tokens | 0.042 美元 / M tokens |
| 输出计算计费 | 计入请求 | 计入请求 | 完全免费 |
| 模型交付形态 | Apache 2.0 开源权重 | Apache 2.0 开源权重 | 闭源托管 API |
在云端推理价格战白热化的阶段,Clef 出现了明显的价格倒挂。专有模型 Jev 的输入单价压在每百万 Token 0.042 美元且输出免费,而 Clef-flash 单价为 0.09 美元,大尺寸 Clef 更高达 0.24 美元。这意味着采用 27B 参数 Clef 的 Token 成本是竞品的 5.7 倍。
所谓的 13.5 倍延迟优势,背后还藏着物理拓扑层面的信息差。Clef 依托 Cloudflare 全球分布的边缘算力就近计算,对照组里的 Jev 则硬生生背负了跨越公网往返中心机房的网络传输开销。这并非纯粹的模型算力代差,而是一次边缘云网络利用机房距离对中心服务器的物理包抄。
天下熙熙,皆为利来。Cloudflare 并不想安分地充当底层管道工。Clef 采用 Apache 2.0 协议开源权重,且在调用接口上全盘复制 Jev,意图非常明显:用近在咫尺的低延迟作为诱饵,诱导开发者把分流网关直接搬到自己的边缘节点上,在流量发往第三方云厂商之前顺道收下一道算力过路费。
闭集陷阱与脆弱的统计反射
砍掉自回归解码,换来毫秒级响应,同时也斩断了模型展开逻辑演进的可能性。
受限的分类任务里它的确有效。伯克利函数调用基准 BFCL 达到 98.8%,API-Bank 达到 93.1%,金融意图分类 BANKING77 取得 94.2 的 F1 分数。布里尔概率校准评分上,Clef-flash 拿到 10.6,优于 Jev 的 17.4。
但脱离了既定轨道,模型就显出局限。
| 核心评测维度 | Clef-flash (9B) | Clef (27B) | TypeSafe Jev (基准) |
|---|---|---|---|
| GPQA Diamond 复杂推理 | 51.0% | 48.0% | 78.3% |
| When2Call 调用边界判断 | 65.58% | 72.37% | 80.97% |
| BRIGHT 长文本检索推理 | 43.10% | 45.91% | 47.52% |
在极度依赖长程推演的 GPQA Diamond 测试里,通用模型 Jev 维持在 78.3%,Clef 系列骤跌至 48.0% 左右。更具系统破坏力的是边界抑制失效,在判断模型何时应当停止调用的 When2Call 测试中,Clef-flash 得分跌到 65.58%,面对未定义的越界提问,它缺乏识别自己能力边界的机制。
这引出了 Softmax 带来的数学漏洞:闭集归一化。
无论底层模型是否理解当前输入,Softmax 的数学逻辑都会强行把预设选项的概率相加凑成 1.0。若选项只设了方案 A 与方案 B,遇到恶意构造的脏数据,模型依然会在二者之间强行摊派概率。只要开发者在定义模式时漏写了弃权或未知分支,系统就会以极高的置信度把错误请求当场放行。
第三方测试机构 Nicia AI 在针对 85 例企业知识库准入判定的独立实测中,发现了更危险的鲁棒性漏洞:仅仅把输入上下文中两条记录的前后顺序对调,Clef 对同一个事务的冲突判定概率就会从 0.04 剧变到 0.60。
荀子言:君子博学而日参省乎己,知明而行无过。
思维链的本质是模型的自我推演与校验,而 Clef 被切除了这个过程。它没有内生的大脑皮层,只保留了毫秒级的脊髓电反射。在这样的统计抖动面前,宣称 AI 决策可以彻底剔除人类在环,无异于拆除安全带在冰面上超速行驶。
谁在买单,以及接下来的分流抉择
把高频的逻辑开关交还给轻量判别模型,把多轮分析留给中心化的生成底座,架构分工的方向没有错。但工程师不能把官方的公关话术直接写进生产配置。
对于面向终端交互、极度依赖几十毫秒加载响应的前端路由,Clef-flash 确实能省掉大量的格式校验负担;但在离线批处理、海量数据分类或低延迟容忍的后台流水线里,盲目引入 Clef 只会带来五倍的 Token 支出,吞噬原本微薄的业务利润。
比账单更关键的是安全底线。极速的轻巧扳机,如果自身识别不了边界,开火与走火就只有一线之隔。
在黑天鹅频发的真实业务中,38.8 毫秒只是把工具磨快了,绝不构成解雇人类审核者的理由。
