为了让智能体选一个工具或者判断一条工单是否放行,今天绝大多数团队还在调用千亿参数的大模型,逼着它们逐字吐出一长串思考词和括号包裹的标记。这种做法又慢又贵,一次简单的路由调度往往要白白耗掉数秒,还动不动就因为少了个引号导致下游的结构化解析直接崩溃。
AWS 旗下的 Strands Labs 试图用物理手段切断这种算力空耗。他们开源了决策模型 Strands Decider 2B,直接切掉了预训练语言模型的自然语言生成头,换成只有约 100 万参数的指针头,把原本拖沓的生成过程压缩为单次前向计算。
在单张英伟达 RTX 3090 上,它的中位响应延迟降到了 115 毫秒。但在高难度多跳因果与数值计算面前,其准确率也直接跌破了 30%。
剥离自回归生成头,百毫秒级的控制平面重构
在多智能体系统里,协调层的任务本质上是选项分流,而不是写文章。让自回归模型逐字输出内容,既耗费带宽,也容易引发语法解析灾难。
这次 AWS Strands Labs 发布的模型代码基于 Apache-2.0 协议开源,权重命名为 hobson-v19。工程团队没有从头预训练,而是对约 19 亿参数的阿里开源底模 Qwen3.5-2B-Base 动了一次精准的外科手术:
- 切除语言建模头彻底剥离底层用于输出词表概率的 LM Head,主干部分配合 Rank-16 LoRA 适配器进行微调。
- 挂载专用读出指针在 Transformer 最后一层隐状态上,接入约 100 万参数的指针与读出头。
- 固化决策范式输出结果不再是任意自然语言字符,而是被限定在是非判断、多选一和有序量规打分这三类结构化概率。
由于不再维护自回归解码缓存,也不需要做多轮逐词采样,系统在本地单张 RTX 3090(WSL2)环境下,JevBench 评测的中位延迟压缩到了 115 毫秒,P95 延迟为 299 毫秒。就算部署在苹果 M3 Pro 设备上,处理 300 token 以内的短任务时,中位延迟也能维持在 153 毫秒。
这种构造很像认知心理学里的直觉快思考。只要预先定义好候选集,模型扫一遍上下文就能给出各个选项的概率分布,从物理层面杜绝了因为格式错漏引发的解析崩溃。
穿透基准:简单任务拿满分,复杂推理直接腰斩
然而,跑得快绝不等于选得准。
在涵盖 231 道测试题的 JevBench 公开测试集上,hobson-v19 给出的成绩是 167 题命中,综合准确率为 72.3%,预期校准误差(ECE)为 0.052。在同等 2B 规模的 33 款评测模型里,它其实只排在第 3 位,同台竞争的第三方开发者项目 Mapika decider-2b 以 175 题的命中成绩压过了它。
把任务按认知难度一层层剥开,模型的断层立刻暴露无遗:
| 评估指标 / 任务分级 | OpenAI GPT-5.6 Luna | TypeSafe Jev 1.13 | Strands Decider 2B (v19) |
|---|---|---|---|
| 公开集综合准确率 | 97.1% | 96.3% | 72.3% |
| 简单任务准确率 | 99.4% | 99.1% | 100% |
| 标准任务准确率 | 97.8% | 96.5% | 87.5% |
| 高难任务准确率 | 94.2% | 93.3% | 50.5% |
| 多跳推理准确率 | - | - | 44.4% |
| 长策略文档匹配 | - | - | 36.8% |
| 时序与数值计算 | - | - | 26.7% |
| 调用时延 (中位数) | 0.98秒 | 0.65秒 | 0.115秒 |
在没有歧义、规则直白的单步分流任务上,Strands Decider 2B 拿下了 100% 满分;标准场景也有 87.5% 的水准。但只要进入需要多步因果推导的困难任务,准确率直接跌至 50.5%。
多跳推理正确率只有 44.4%,遇到长策略文档降到 36.8%,而在涉及前后时序与数值计算的题目里,命中率只有 26.7%。失去思考链缓存的 2B 躯干,一旦遇到两层以上的逻辑嵌套,基本就是在拿预设概率去撞大运。
不可穿透的黑盒,以及类型安全的幻觉
比断崖下跌更棘手的是脆弱的泛化边界与缺乏解释力。
实测数据显示,模型的释义一致性仅有 0.833。同一套业务意图,用户只要换一种提问句式,输出的类别分布就可能发生漂移。社区在测试边缘样本时还发现过典型翻车:面对高度不确定的模糊输入,模型直接以 0.72 的高置信度选出了完全错误的选项。
在 4 个未见泛化测试集上,当模型给出的置信度大于等于 0.9 时,准确率能达到 95.2%。但这种模型敢打包票的高置信场景,仅仅覆盖了 23% 的样本。在其余近八成的长尾业务中,它表现出严重的欠置信倾向。
更致命的是调试成本。单次前向直接给出概率,意味着模型彻底放弃了自回归吐字的过程。它不会写下任何分析步骤,工程团队只拿到一个看似笃定的分类分数,却根本查不出它究竟依据哪行文字下的判断。
现在的工业界并非只有这一条路:
- 静态嵌入分类.ModernBERT 配合传统分类器,在单张 A100 上能在 15 到 120 毫秒内完成意图路由,吞吐极高,缺点是标签完全固定,无法在运行时动态注入新的选择项。
- 混合云端路由.RouteLLM 依赖远端 Embedding 服务做门控,在保留 GPT-4 级别 95% 效果的同时省掉大部分开销,但每一跳仍受制于跨网络调用的网络往返延迟。
Strands Decider 刚好卡在二者之间。它比传统固定分类器更具语义灵活性,能动态读取输入里的候选名单,成本又远低于大语言模型。但它也完全继承了底模的弱点,黑客在上下文里伪造一条虚假的审批通过记录,依然能轻易骗过它的指针头。
级联架构才是唯一的工程出路
消除了格式解析错误,并不等于业务逻辑成立。交付了一个合法的枚举值,里面装的却是一个致命的误判,在关键生产链路里同样是灾难。
TypeSafe 创始人 Diogo Almeida 在谈及开源复刻时表达过类似的保留态度。工程团队很容易被架构上的微创新吸引,却低估了在极小参数下维持稳健智能的门槛。其商业方案 Jev 1.13 虽然中位延迟稍慢(0.65 秒),千次调用收费 0.027 美元,但高难推理准确率依然保持在 93.3% 的可用水平。
工程落地不需要非黑即白的站队,而是要划清职责边界:
- 禁止单点终审.在数据删除、资金融通、权限放行等不可逆场景,绝对不能把这类轻量指针模型设为唯一的仲裁节点。结构合法挡不住提示词注入。
- 建立分层级联.把它放在调度网关的最前端,充当毫秒级粗筛阀门。对高置信度的常见意图就地放行,一旦置信度跌破阈值,立即静默转交大尺寸思考模型兜底。
《孙子兵法》有云:“多算胜,少算不胜,而况于无算乎?”砍掉生成头换来了百毫秒的速度,却也剥除了模型进行逐步验算的能力。在多智能体系统里,轻量决策模型是极其趁手的高速道岔,但它替代不了真正的调度大脑。懂得在什么时候分流、在什么时候交出控制权,才是工程确定性真正的压舱石。
