靠文生图立足的 Black Forest Labs(BFL)把手伸向了机械臂。

团队正式上线专为机器人控制设计的开源世界-动作模型 FLUX 3 Action。参数量仅 70 亿(7B),不到此前最佳开源模型 Cosmos 3 Nano(16B)的一半,却在 NVIDIA RoboLab-120 模拟基准测试中以 42.92% 的成功率拿下榜首,把 16B 的 Cosmos 3 Nano(36.8%)和 3.3B 的专业动作模型 π0.5(28.0%)甩在身后。

做视觉生成的黑马跨界做硬件控制,看起来像是一次降维打击。但在具身智能领域,把视频像素去噪当成物理动作预测,真正的账本经得起细算吗?

FLUX 3 Action 架构管线:视频生成模型如何驱动动作输出 多路感知输入 工作空间多相机流 冻结 Qwen3-VL-4B 指令与视觉特征编码 7B Diffusion Transformer 联合去噪核心引擎 动作 Token + 视频 Token 冻结视频 VAE 重构未来 双重推演输出 环境演化画面(预测) 32 动作 Chunk 序列 覆盖 2.13 秒(15Hz 物理控制)

拿生图模型控机械臂,BFL 赌的是什么

传统具身控制长久卡在两派路线上。符号推理模型长于多步规划,但推理延迟动辄几秒,跟不上电机的毫秒级响应;端侧策略网络响应极快,却缺乏物理常识和长程因果理解。

模型单次吐出未来两秒动作块,尝试直接借视频去噪预测动作
模型单次吐出未来两秒动作块,尝试直接借视频去噪预测动作

BFL 押注的是世界-动作模型路线。它放弃分步规划,直接借用 Diffusion Transformer,让模型在预测未来环境画面的同时,联合去噪解码出机械臂要执行的物理动作。

这个 7B 模型在 NVIDIA GB200 集群上完成训练,核心结构嵌套了冻结的视频 VAE 和冻结的 Qwen3-VL-4B 指令编码器。动作标记与视频标记在同一个潜空间内同步去噪。模型单次吐出包含 32 个动作的块序列,在 15Hz 控制频率下覆盖未来 2.13 秒的动作。相比之下,专门做控制的 π0.5 单次调用只能给出一秒的动作跨度。

大规模视频预训练构成了这套系统的地基。其预训练数据里超过 95% 是视频标记。如果不做大规模视频预训练、直接拿机器人轨迹开练,基准测试成功率连 1% 都不到;加上视频预训练后,同套流程的成功率直接升到 11.6%。随后团队在中期训练塞入第一人称手部视频、遥操作轨迹,把 14 种机器人的控制动作统一映射到 50 维末端执行器空间。

看似精巧,但画出未来两秒的画面,并不等于理解了现实世界的力学。


榜首背后的偏科账单

在 NVIDIA RoboLab-120 基准测试里,FLUX 3 Action 以 515/1,200 的胜场拿到 42.92% 的胜率,击败了 Cosmos 3 Nano 的 36.8%。

视觉感知虽有优势,但面对物体遮挡与空间推理时频频失误卡位
视觉感知虽有优势,但面对物体遮挡与空间推理时频频失误卡位

拆开具体任务维度,模型的偏科十分刺眼。

任务评估维度FLUX 3 Action (7B)Cosmos 3 Nano (16B)差距分析
整体任务胜率42.92% (515/1200)36.8% (441/1200)胜率提升 6.1 个百分点
简单任务成功率49.1%较低基础动作执行相对稳定
复杂长程任务28.2%偏低规划能力随动作步数锐减
视觉感知类35.6%26.1%视觉语义优势扩大 9.5 个百分点
空间关系推理49.5%49.3%二者持平,无明显代际提升

FLUX 最大的领先幅度压在视觉感知类任务上,超出对手 9.5 个百分点。但在涉及相对方位、遮挡处理和三维交互的几何关系推理任务上,FLUX 拿到 49.5%,与对手的 49.3% 几乎完全一致。

一旦进入复杂长程任务,成功率直接跌落到 28.2%。扩散模型擅长辨识画面语义,但在没有明确三维几何标定和力学反馈的情况下,光靠二维像素去噪,并不能自然长出真正的空间推理能力。

宣传话术与工程指标的落差对比 榜单评测显存标称 69 GB 远高于对手标称的 40 GB B200 典型加速倍率 3.15x 宣传上限宣称最高 3.95x 极速单步推理的代价值 4步引导中位延迟 182ms (成功率 42.24%) → 1步无引导延迟压缩至 32.29ms (成功率跌至 37.92%)

速度与显存的现实引力

宣传把 7B 包装成轻量化部署的代表,但工程账本并不轻松。

原生显存占用高达69GB,轻量化端侧设备难以承受其重压
原生显存占用高达69GB,轻量化端侧设备难以承受其重压

官方宣称运行速度最高提速 3.95 倍,该数据来自 B200、H200 和 RTX 5090 等高端卡的峰值区间。在 B200 芯片示例中,蒸馏版 FLUX 块延迟为 101.71 毫秒对 Cosmos 的 320.40 毫秒,实际加速倍率为 3.15 倍。

延迟压缩同样付出了精度代价。在 B200 的 FP8 格式下,标准 4 步引导推理中位延迟为 182 毫秒;如果采用极限的 1 步无引导方案,延迟压到 32.29 毫秒,但基准测试成功率立刻从 42.24% 跌到 37.92%。

显存落差更为直接。官方 Model Card 称其 DROID 策略在 H200 上运行 BF16 约需 32 GB,若经过 FP8 量化并卸载文本编码器,能塞进 24 GB 显存。但 NVIDIA 官方维护的天梯榜上,FLUX 3 Action 的实测显存占用标定为 69 GB,显著高于 16B 对手的 40 GB。评测为了保住成功率,拉满了无损缓存与全精度权重;量化与换入换出能降低门槛,代价则是推理延迟被拉长。


真实碰撞与商业围墙

仿真测试从来不能等同于物理世界的确定性。

缺乏几何标定与力学闭环,开源机械臂初测时直接撞击台面停机
缺乏几何标定与力学闭环,开源机械臂初测时直接撞击台面停机

在真机测试中,官方给出了 28/30(93.3%)的抓取成功率。但这组数据仅来自合作方在单台 Franka 机械臂上的双盲实验,总共 10 个桌面任务,每个任务跑 3 次、限时 240 秒,所用测试库还处于早期 Alpha 阶段。

社区开发者的实际反馈更显骨感。有人尝试把模型部署到开源机械臂 SO-101 上,随即遭遇坐标系与 LeRobot 校准失配。机械臂在初测时直接撞击台面停机,人工纠偏后依然无法完成稳定抓取。

原生模型直接输出 50 维末端执行器目标,底层缺乏速度、力矩与工作空间的硬限幅保护。一旦外部工控拦截机制缺失,纯视觉驱动在非标硬件上极易引发物理损伤。研究团队曾尝试接入 GPT-6 Astra 做协同规划以弥补短板,高算力支持下成功率能做到 90%,但单次执行耗时超过 8 分钟,调用成本高达 8.77 美元,彻底脱离了实用范畴。

更现实的壁垒在于授权条款。FLUX 3 Action 采用 FLUX Kommunity License v1.0,明文规定年营收超过 500 万美元的企业必须另行购买商业授权,微调与蒸馏产生的衍生模型同样受到传染约束。而且官方没有开源极速版本的蒸馏训练方案,外部工业团队拿到权重后,依然很难复现超低延迟的控制策略。

《淮南子》有言:“按图索骥,不可得也。”拿着生成的图像走位,终究抵不过现实的阻力。FLUX 3 Action 证明了视频生成模型在具身感知上的上限,但离进入真实工厂产线,它还差着力学闭环与工业安全的最后几道关卡。