做 FLUX 系列画图模型的那家公司,这次没发新画图模型。
9 月 23 日,Black Forest Labs 发布了 FLUX 3 Action——一个只有 70 亿参数、权重完全公开的机器人控制模型。在英伟达的 RoboLab-120 仿真基准上,它的任务成功率是 42.2%,比之前最强的开源模型 Cosmos 3 Nano(36.8%,160 亿参数)高出 6.1 个百分点,参数少一半以上,速度还快约三倍。
一个做图像的团队,第一次踩进机器人领域就拿了开源第一。这件事本身比分数更值得聊。
先搞清楚它是什么:世界动作模型
大多数人理解的机器人模型是”看到画面 → 输出动作”的一步映射。FLUX 3 Action 不是这么做的,它走的是世界动作模型(World Action Model)的路子:一次同时预测两件事——接下来该做什么动作,以及做完之后摄像头会看到什么。
具体输入输出是这样:
- 输入:多路摄像头画面 + 机器人当前位姿 + 一句自然语言指令
- 输出:接下来 32 个动作(按每秒 15 条指令算,约两秒的动作),同时给出对未来画面的预测
- 重规划:执行完一段,重新观察环境,再从新状态继续预测
背后的假设是:一个已经学会预测视频帧的模型,其实早就理解了物体怎么动。所以它需要的机器人数据比纯策略模型少得多——官方给出的数字是,大约 200 次人工演示就能完成一次微调。
架构上,它是一个扩散 Transformer,配一个冻结的视频 VAE 处理画面,再加一个冻结的 Qwen3-VL-4B 编码器处理指令。官方报告里有个数字挺能说明问题:预训练阶段超过 95% 的 token 来自视频,之后才进入混合了游戏、第一人称手部数据、手持夹爪和遥操作的动作对齐阶段。这基本就是在说——先学会”世界怎么运转”,再学会”手该怎么动”。
数据拆开看:赢在哪,赢了多少
官方放出的对比表可以拆成三块:
- 仿真基准:RoboLab-120 成功率 42.2%,对比 Cosmos 3 Nano 的 36.8%;同系列较弱的一档 checkpoint 是 38.3%,对比 π0.5 的 28.0% 和 DreamZero 的 25.7%。
- 参数与速度:70 亿参数,对比 160 亿;推理速度是 Cosmos 3 Nano 的 2.85 到 3.15 倍,在 B200 上一组动作耗时 41.06 毫秒。
- 真机测试:单台 Franka 机械臂上 30 个任务过了 28 个,93.3%。
同时发了三个 checkpoint,覆盖不同硬件:
flux-3-action-base:通用基座flux-3-action-so101:面向低成本的 SO-101 机械臂,走 Hugging Face 的 LeRobotflux-3-action-droid:在 DROID 机器人数据集上训练的版本
权重放在 Hugging Face,用新的 FLUX Kommunity License v1.0;文本编码器 Qwen3-VL-4B 仍是 Apache-2.0。模型也已经接进 LeRobot,可以部署到英伟达 Jetson 这类边缘设备上。
需要说清楚的是,上面这些分数都是厂商自己发的,头部成绩标了正负 0.36 分的误差范围;RoboLab-120 本身就是英伟达的仿真基准,等于在人家的主场打;93.3% 那个真机结果只有 30 个任务、单台机械臂,也没公布是哪两个没过。它证明的是”开源阵营里的第一名”,不是”全世界的第一名”。
上手要花多少功夫
如果你手上正好有一台机械臂在台面上,这条路径是清晰的:
- 挑对应权重。用 SO-101 就拿
flux-3-action-so101,用 Franka 或 DROID 数据集的路线就取对应的版本。 - 接进 LeRobot。官方给了 LeRobot 的 policy class 和参数高效微调配方,跟着仓库走即可,不用自己写训练框架。
- 录约 200 次演示。遥操作完成一组相关的抓放任务,按官方说法这是一个周末的量级,不是一个大项目。
- 微调 + 验证。微调完先在训练集之外的任务上测,官方演示里它还能处理没见过的容器和摄像头位置变化。
- 自己加安全层。这一步不能省,原因见下。
部署上,70 亿参数意味着你在实验室现有的卡上大概率跑得动;41 毫秒一组动作的延迟,也足够撑起一个真正的控制回路,而不是”想得太慢用不上”。
优点、短板与适合谁
优点:开源权重、代码、基准和训练配方一起给;参数小、速度快、能上边缘设备;微调数据需求低;视频预训练迁移到动作的思路,让它在跨本体泛化上更有余地。
短板(这几条官方也是明说的):
- 商用条款没写清。许可证是新的,官方说有商用和非商用两种选择,但没公布商用要花多少钱、要满足什么条件。要做产品的话,这是目前最硬的堵点。
- 没有和闭源系统的对比。表里所有对手都是开源的,Physical Intelligence 和谷歌在这条线上的系统根本没被拉进来比。
- 输出的是裸关节目标,速度、力矩、行程都没有内置限制。官方很坦诚地让你自己加安全层——这既是正确的披露,也是在提醒你离能用还有多少活。
- 证据全部来自厂商和合作方,没有第三方复现。
适合现在就试的人:实验室里已经有机械臂的团队、做小规模自动化的工程组。建议再等等的人:想拿它做商业产品的公司——许可证没谈清楚之前,技术指标再好看也不能立项。
替代方案怎么看
- Cosmos 3 Nano(英伟达,开源):参数大一倍、分数低 5.4 个百分点,但背靠英伟达生态,仿真到部署的工具链更成熟。要省心选它,要省硬件选 FLUX 3 Action。
- π0.5(Physical Intelligence):同基准 28.0%,商业化路径更清晰,但不开源。
- 自己搭 VLA 策略:用现成的视觉语言模型加一层动作头。灵活,但需要的数据量和工程投入都远超”200 次演示”。
- 不碰硬件,先做数字化验证:如果你只是想摸清”世界模型怎么驱动行为”这套逻辑,官方也提到视频游戏可以作为导航能力的试验场。站内这篇《1 万个 AI Agent 花 88 小时解出千禧年难题》虽然是纯软件场景,但对理解”长期自主执行”这件事有帮助。
老达点评
第一,图像公司跨界的这一步,比分数更重要。 这是过去两个月里第三个”用视频预测作为机器人控制基础”的发布,这个路线正在从想法变成共识。以前做机器人策略要专门攒一堆机器人数据,现在可以拿海量视频先学”世界怎么运转”,再花很小的代价迁移到具体本体上。数据成本被重算了一遍。
第二,注意它绕开了谁。 就在上个月,本站写过《英伟达 129 亿美元买下 Hugging Face》——模型分发这一层现在归英伟达了。FLUX 3 Action 选择的发布路径恰恰是 Hugging Face 加 LeRobot,而它对比、并且赢过的对手是英伟达自家的 Cosmos 3 Nano。开源生态内部的竞争格局,比”开源 vs 闭源”那条线热闹得多。
第三,也是最实际的一条:许可证没谈清楚之前,别急着往产品上押。 模型开源了、权重下载了,不等于你能拿它赚钱。做技术研究现在就可以开跑,做商业决策等条款落地。这个判断对所有”权重开放但许可未明”的新模型都适用。
想系统看具身智能这条线怎么走到今天的,可以顺着看《2026 具身智能爆发元年》、《2026 年 AI 具身智能大爆发》和百科词条《具身智能》;想看清 FLUX 这个模型家族的脉络,本站早前的《Stable Diffusion 完全指南》和《AI 画图工具完全指南》里的 FLUX.1 对比可以对照着读。更多工具实测收录在 AI 工具评测专题,实践类内容在 老达 AI 实践专题。