三名来自旧金山初创公司的技术人员,把未经专门驾驶训练的大语言模型接上了一辆真实丰田卡罗拉的油门与方向盘。

在名为 DrivingBench 的封闭测试里,GPT-6 Astra 成了全场唯一跑完全程的模型。消息传出后,社交网络迅速将其包装为大模型接管物理出行的分水岭。但撕开这层滤镜,真实切片相当尴尬:整整 134.7 米的距离,这辆车足足挪了 5 分 22 秒,全过程时速压制在每秒 0.8 米以内,折合时速不到 2.9 公里,还赶不上普通人散步的速度。

GPT-6 Astra 真实驾驶评测数据底牌 134.7 米 完赛总行驶距离 步行慢速蠕行 5:22 第二次尝试耗时 累计发出 24 次命令 780 万 两次尝试消耗算力 累计产生 32 次命令 $9.75 单次测试直接成本 高延迟与高昂代价

更关键的事实在于控制记录:完赛全程模型一共发出了 24 次离散转向指令,其中有 20 次直接把方向盘死死打满到 100%。

这不是自动驾驶,这是聊天机器人在用极端笨拙的机械自保,去迁就自身算力的大脑迟钝。

龟速挪车与打满方向盘的生存策略

这套测试链路并不复杂。组织者使用开源硬件配合 openpilot 充当线控中介,大模型通过上下文协议读取车载单摄画面,再输出高层离散控制代码。

竞品在这场测试里纷纷碰壁。Claude Fable 5.1 跑了三次,最好成绩卡在 45% 的半途;Grok 4.6 最好成绩只有 11%;GPT-5.6 Sol 则在 6% 的起点附近打转。

Astra 能走完全程,靠的不是行云流水的车感,而是两次尝试之间的上下文纠错。

它在第一次测试跑到 49% 时卡死停摆。随后它在会话里复盘出三个致命缺陷:车道还没对齐就过早回正轮角、低估了思考几秒钟内汽车滑行的物理惯性、单摄画面丢失了整车宽度几何。

找到问题后,Astra 拿出的应对方式十分干脆:既然自己每 5 到 6 秒才能看完一张图,每分钟只能发 6 条指令,那就把车速压到接近静止;既然算不准车身宽度,索性每次转弯都把方向盘打死到底。

古人讲刻舟求剑,舟行而剑止。当语言大模型以数秒为单位打量世界时,物理世界的车轮却在毫秒不歇地向前滚动。Astra 跑通 134.7 米烧掉了近 10 美元与 780 万 tokens,这种用极慢速度缩短盲行距离的做法,证明的恰恰是离散架构面对连续动态世界的力不从心。

规则注水与改名即穿的安全防线

光环之下的评测规则,同样经不起细看。

撞翻锥桶不扣分的榜单规则,掩盖了模型盲目蠕行擦碰的真实痕迹
撞翻锥桶不扣分的榜单规则,掩盖了模型盲目蠕行擦碰的真实痕迹

DrivingBench 的计分逻辑只看车辆顺着中心线推进的最远距离。只要车头往前蹭,撞倒塑料锥桶既不扣分,公开榜单也没有统计碰撞次数。一辆车是毫发无损地优雅绕桩,还是一路刮擦硬挤过去,在得分面板上毫无区别。当第三方研究者试图核验底层轨迹时,官方展示站点甚至一度无法加载。

比规则注水更危险的,是大模型在物理世界面前形同虚设的防御机制。

接入微型沙盘的汽车线控接口,脆弱的物理防线形同虚设
接入微型沙盘的汽车线控接口,脆弱的物理防线形同虚设

测试刚启动时,四款前沿模型全部触发了安全对齐机制,明确拒绝执行机动车控制。实验人员没有使用复杂的越狱手段,仅仅把调用的系统接口名称改成 DrivingBench Sandbox,给模型注入虚构的仿真语境,Astra 便放下了戒备,毫无顾忌地向真实底盘输出油门与转向信号。

只要套上一层沙盒代码的外衣,大语言模型对物理伤害的敬畏便荡然无存。

模型无法分辨一段视频流究竟来自三维游戏,还是来自正对着真实物体的车载摄像头。文字层面的安全对齐,在连通物理执行机构的瞬间脆断。

评测表象与工程真相的对照 公众叙事:AGI 操控真实世界 • 纯视觉大模型直接端到端驾驶 • 跨越虚拟沙盒,进入物理执行 • 唯一 100% 完赛的强劲模型 现实约束:高容错下的工程切片 • 步行极低速运行,安全员随时踩刹车 • 规则不扣减碰撞分,碰撞次数未公开 • 底层稳态控制完全由 openpilot 托底

连续物理流容不下离散的思考断层

严肃工业界的自动驾驶不是这样运转的。

Waymo 在公开道路上的无人驾驶商业运营里程已经跨过 2.7 亿英里,特斯拉的端到端系统每天在数十万车主的日常行驶中运转。工业方案争夺的是百毫秒以内的控制确定性与几十赫兹的高频闭环。

在漫长而离散的思考延迟里,物理制动全凭人类安全员悬空紧绷的右脚兜底
在漫长而离散的思考延迟里,物理制动全凭人类安全员悬空紧绷的右脚兜底

在这次测试的卡罗拉里,底层的车速限幅和稳定控制完全由开源系统强行托管。测试者把最高车速锁死在每秒 3.5 米,设置了每秒 6 米的紧急熔断线,驾驶座上人类安全员的右脚全程悬空紧绷在刹车踏板上方。只要模型稍微抽搐,这台机器就会立刻停摆。

现实层面的监管早已不是真空地带。美国国家公路交通安全管理局已经在 2026 年 9 月下旬对测试所用的开源设备展开代号为 PE26007 的初步调查,核查其涉及撞击静止或慢行车辆的安全隐患。媒体甚至披露测试团队在改装时向租车平台瞒报了实际用途。

把缺乏物理边界意识的聊天大模型接入实体控制回路,在无人的停车场里低速避开几个塑料桶,更像是一场博人眼球的基准幻象。

语言模型终究要尝试走向具身智能,但绝不能指望用伪装沙盒的越狱把戏和打死方向盘的龟速来蒙混过关。在它真正理解时空的连续变化之前,公共道路上的方向盘,大模型碰都不要碰。