让几百亿参数的大模型逐字吐出一段 JSON,只为了给工单分流或判断用户是否想退款,是当下智能体架构里最笨拙的工程妥协。开发团队在提示词里求神拜佛约束格式,在下游挂满正则表达式防崩溃,本质上是在用写长篇小说的引擎去充当机房网络开关。

Cloudflare 近期正式开源决策模型 Clef 与轻量版 Clef-flash,宣布把判断延迟压进 38.8 毫秒,甚至打出 AI 智能体不再需要人类在环的公关口号。

这家掌控全球大量网络流量的基础设施巨头,正试图用边缘节点的地理包抄,从中心化大模型手里抢下第一道调度权。

Agent 意图调度的两种工程路径 生成式 LLM 路由(System 2) 计算方式:自回归 Token 逐字解码 典型耗时:500ms 至数秒不等 输出形态:自由文本 / JSON 字符串 系统痛点:格式漂移、概率黑盒、推理昂贵 专用决策模型 Clef(System 1) 计算方式:单次 Prefill 前向并行打分 典型耗时:Clef-flash 中位 38.8ms 输出形态:绑定类型的确定性概率分 系统收益:超低时延、天然免解析、边缘直出

斩断自回归:把模型降维为类型化电键

通用大模型擅长推理,但不适合做开关。自回归机制要求模型逐词解码,一旦网络抖动或语法微调,格式漂移就会让整个业务链路挂起。

Clef 的思路非常干脆。底模分别采用阿里的 Qwen3.8-27B 与 Qwen3.5-9B,但在推理阶段直接剔除了自回归文本生成。它只执行预填充阶段来提取上下文特征,再通过联合模式头并行评估候选标签。模型不再向客户端吐出一个汉字或字符,而是直接输出确定性的浮点数概率分布。

这套输出形态被固化在三种类型内:布尔判断 noul、多选分类 choice 与顺序量表 score,单次调用能并发评估最多 64 个问题。两款模型原生支持 65,536 tokens 上下文与多模态输入,接口完全对齐了此前 TypeSafe 推出的 Jev 规范。

主流决策模型中位延迟对比(ms) Clef-flash 38.8 ms Kev-9B 51.4 ms DiffGemma Jev 84.4 ms Clef (27B) 209.3 ms Jev 524.1 ms

官方基准测试里,Clef-flash 中位延迟压在 38.8 毫秒,p95 延迟为 122.4 毫秒,比竞品 Jev 的 524.1 毫秒缩短了 13.5 倍;全尺寸 Clef 延迟在 209.3 毫秒。

程序网关不需要再去解析不可靠的长文本,而是能够像配置防火墙一样,把阈值设在特定的浮点数上。容错逻辑和粘合代码被成批移除,系统获得了确定性的数据格式。

5倍溢价与物理包抄:算力账本里的商业算盘

极速通常有其代价。如果把目光从漂亮的时延柱状图移到账单明细上,这场技术创新的底色就变了。

评估维度Cloudflare Clef (27B)Cloudflare Clef-flash (9B)TypeSafe Jev
中位延迟209.3 ms38.8 ms524.1 ms
输入 Token 单价0.24 美元 / M tokens0.09 美元 / M tokens0.042 美元 / M tokens
输出计算计费计入请求计入请求完全免费
模型交付形态Apache 2.0 开源权重Apache 2.0 开源权重闭源托管 API

在云端推理价格战白热化的阶段,Clef 出现了明显的价格倒挂。专有模型 Jev 的输入单价压在每百万 Token 0.042 美元且输出免费,而 Clef-flash 单价为 0.09 美元,大尺寸 Clef 更高达 0.24 美元。这意味着采用 27B 参数 Clef 的 Token 成本是竞品的 5.7 倍。

所谓的 13.5 倍延迟优势,背后还藏着物理拓扑层面的信息差。Clef 依托 Cloudflare 全球分布的边缘算力就近计算,对照组里的 Jev 则硬生生背负了跨越公网往返中心机房的网络传输开销。这并非纯粹的模型算力代差,而是一次边缘云网络利用机房距离对中心服务器的物理包抄。

天下熙熙,皆为利来。Cloudflare 并不想安分地充当底层管道工。Clef 采用 Apache 2.0 协议开源权重,且在调用接口上全盘复制 Jev,意图非常明显:用近在咫尺的低延迟作为诱饵,诱导开发者把分流网关直接搬到自己的边缘节点上,在流量发往第三方云厂商之前顺道收下一道算力过路费。

闭集陷阱与脆弱的统计反射

砍掉自回归解码,换来毫秒级响应,同时也斩断了模型展开逻辑演进的可能性。

受限的分类任务里它的确有效。伯克利函数调用基准 BFCL 达到 98.8%,API-Bank 达到 93.1%,金融意图分类 BANKING77 取得 94.2 的 F1 分数。布里尔概率校准评分上,Clef-flash 拿到 10.6,优于 Jev 的 17.4。

但脱离了既定轨道,模型就显出局限。

核心评测维度Clef-flash (9B)Clef (27B)TypeSafe Jev (基准)
GPQA Diamond 复杂推理51.0%48.0%78.3%
When2Call 调用边界判断65.58%72.37%80.97%
BRIGHT 长文本检索推理43.10%45.91%47.52%

在极度依赖长程推演的 GPQA Diamond 测试里,通用模型 Jev 维持在 78.3%,Clef 系列骤跌至 48.0% 左右。更具系统破坏力的是边界抑制失效,在判断模型何时应当停止调用的 When2Call 测试中,Clef-flash 得分跌到 65.58%,面对未定义的越界提问,它缺乏识别自己能力边界的机制。

这引出了 Softmax 带来的数学漏洞:闭集归一化。

无论底层模型是否理解当前输入,Softmax 的数学逻辑都会强行把预设选项的概率相加凑成 1.0。若选项只设了方案 A 与方案 B,遇到恶意构造的脏数据,模型依然会在二者之间强行摊派概率。只要开发者在定义模式时漏写了弃权或未知分支,系统就会以极高的置信度把错误请求当场放行。

第三方测试机构 Nicia AI 在针对 85 例企业知识库准入判定的独立实测中,发现了更危险的鲁棒性漏洞:仅仅把输入上下文中两条记录的前后顺序对调,Clef 对同一个事务的冲突判定概率就会从 0.04 剧变到 0.60。

荀子言:君子博学而日参省乎己,知明而行无过。

思维链的本质是模型的自我推演与校验,而 Clef 被切除了这个过程。它没有内生的大脑皮层,只保留了毫秒级的脊髓电反射。在这样的统计抖动面前,宣称 AI 决策可以彻底剔除人类在环,无异于拆除安全带在冰面上超速行驶。

谁在买单,以及接下来的分流抉择

把高频的逻辑开关交还给轻量判别模型,把多轮分析留给中心化的生成底座,架构分工的方向没有错。但工程师不能把官方的公关话术直接写进生产配置。

对于面向终端交互、极度依赖几十毫秒加载响应的前端路由,Clef-flash 确实能省掉大量的格式校验负担;但在离线批处理、海量数据分类或低延迟容忍的后台流水线里,盲目引入 Clef 只会带来五倍的 Token 支出,吞噬原本微薄的业务利润。

比账单更关键的是安全底线。极速的轻巧扳机,如果自身识别不了边界,开火与走火就只有一线之隔。

在黑天鹅频发的真实业务中,38.8 毫秒只是把工具磨快了,绝不构成解雇人类审核者的理由。