靠文生图立足的 Black Forest Labs(BFL)把手伸向了机械臂。
团队正式上线专为机器人控制设计的开源世界-动作模型 FLUX 3 Action。参数量仅 70 亿(7B),不到此前最佳开源模型 Cosmos 3 Nano(16B)的一半,却在 NVIDIA RoboLab-120 模拟基准测试中以 42.92% 的成功率拿下榜首,把 16B 的 Cosmos 3 Nano(36.8%)和 3.3B 的专业动作模型 π0.5(28.0%)甩在身后。
做视觉生成的黑马跨界做硬件控制,看起来像是一次降维打击。但在具身智能领域,把视频像素去噪当成物理动作预测,真正的账本经得起细算吗?
拿生图模型控机械臂,BFL 赌的是什么
传统具身控制长久卡在两派路线上。符号推理模型长于多步规划,但推理延迟动辄几秒,跟不上电机的毫秒级响应;端侧策略网络响应极快,却缺乏物理常识和长程因果理解。

BFL 押注的是世界-动作模型路线。它放弃分步规划,直接借用 Diffusion Transformer,让模型在预测未来环境画面的同时,联合去噪解码出机械臂要执行的物理动作。
这个 7B 模型在 NVIDIA GB200 集群上完成训练,核心结构嵌套了冻结的视频 VAE 和冻结的 Qwen3-VL-4B 指令编码器。动作标记与视频标记在同一个潜空间内同步去噪。模型单次吐出包含 32 个动作的块序列,在 15Hz 控制频率下覆盖未来 2.13 秒的动作。相比之下,专门做控制的 π0.5 单次调用只能给出一秒的动作跨度。
大规模视频预训练构成了这套系统的地基。其预训练数据里超过 95% 是视频标记。如果不做大规模视频预训练、直接拿机器人轨迹开练,基准测试成功率连 1% 都不到;加上视频预训练后,同套流程的成功率直接升到 11.6%。随后团队在中期训练塞入第一人称手部视频、遥操作轨迹,把 14 种机器人的控制动作统一映射到 50 维末端执行器空间。
看似精巧,但画出未来两秒的画面,并不等于理解了现实世界的力学。
榜首背后的偏科账单
在 NVIDIA RoboLab-120 基准测试里,FLUX 3 Action 以 515/1,200 的胜场拿到 42.92% 的胜率,击败了 Cosmos 3 Nano 的 36.8%。

拆开具体任务维度,模型的偏科十分刺眼。
| 任务评估维度 | FLUX 3 Action (7B) | Cosmos 3 Nano (16B) | 差距分析 |
|---|---|---|---|
| 整体任务胜率 | 42.92% (515/1200) | 36.8% (441/1200) | 胜率提升 6.1 个百分点 |
| 简单任务成功率 | 49.1% | 较低 | 基础动作执行相对稳定 |
| 复杂长程任务 | 28.2% | 偏低 | 规划能力随动作步数锐减 |
| 视觉感知类 | 35.6% | 26.1% | 视觉语义优势扩大 9.5 个百分点 |
| 空间关系推理 | 49.5% | 49.3% | 二者持平,无明显代际提升 |
FLUX 最大的领先幅度压在视觉感知类任务上,超出对手 9.5 个百分点。但在涉及相对方位、遮挡处理和三维交互的几何关系推理任务上,FLUX 拿到 49.5%,与对手的 49.3% 几乎完全一致。
一旦进入复杂长程任务,成功率直接跌落到 28.2%。扩散模型擅长辨识画面语义,但在没有明确三维几何标定和力学反馈的情况下,光靠二维像素去噪,并不能自然长出真正的空间推理能力。
速度与显存的现实引力
宣传把 7B 包装成轻量化部署的代表,但工程账本并不轻松。

官方宣称运行速度最高提速 3.95 倍,该数据来自 B200、H200 和 RTX 5090 等高端卡的峰值区间。在 B200 芯片示例中,蒸馏版 FLUX 块延迟为 101.71 毫秒对 Cosmos 的 320.40 毫秒,实际加速倍率为 3.15 倍。
延迟压缩同样付出了精度代价。在 B200 的 FP8 格式下,标准 4 步引导推理中位延迟为 182 毫秒;如果采用极限的 1 步无引导方案,延迟压到 32.29 毫秒,但基准测试成功率立刻从 42.24% 跌到 37.92%。
显存落差更为直接。官方 Model Card 称其 DROID 策略在 H200 上运行 BF16 约需 32 GB,若经过 FP8 量化并卸载文本编码器,能塞进 24 GB 显存。但 NVIDIA 官方维护的天梯榜上,FLUX 3 Action 的实测显存占用标定为 69 GB,显著高于 16B 对手的 40 GB。评测为了保住成功率,拉满了无损缓存与全精度权重;量化与换入换出能降低门槛,代价则是推理延迟被拉长。
真实碰撞与商业围墙
仿真测试从来不能等同于物理世界的确定性。

在真机测试中,官方给出了 28/30(93.3%)的抓取成功率。但这组数据仅来自合作方在单台 Franka 机械臂上的双盲实验,总共 10 个桌面任务,每个任务跑 3 次、限时 240 秒,所用测试库还处于早期 Alpha 阶段。
社区开发者的实际反馈更显骨感。有人尝试把模型部署到开源机械臂 SO-101 上,随即遭遇坐标系与 LeRobot 校准失配。机械臂在初测时直接撞击台面停机,人工纠偏后依然无法完成稳定抓取。
原生模型直接输出 50 维末端执行器目标,底层缺乏速度、力矩与工作空间的硬限幅保护。一旦外部工控拦截机制缺失,纯视觉驱动在非标硬件上极易引发物理损伤。研究团队曾尝试接入 GPT-6 Astra 做协同规划以弥补短板,高算力支持下成功率能做到 90%,但单次执行耗时超过 8 分钟,调用成本高达 8.77 美元,彻底脱离了实用范畴。
更现实的壁垒在于授权条款。FLUX 3 Action 采用 FLUX Kommunity License v1.0,明文规定年营收超过 500 万美元的企业必须另行购买商业授权,微调与蒸馏产生的衍生模型同样受到传染约束。而且官方没有开源极速版本的蒸馏训练方案,外部工业团队拿到权重后,依然很难复现超低延迟的控制策略。
《淮南子》有言:“按图索骥,不可得也。”拿着生成的图像走位,终究抵不过现实的阻力。FLUX 3 Action 证明了视频生成模型在具身感知上的上限,但离进入真实工厂产线,它还差着力学闭环与工业安全的最后几道关卡。
