做 AI 画图的公司,转头教机器人干活:FLUX 3 Action 用 70 亿参数拿下开源第一

深石板蓝工作台上,机械臂从多路摄像头画面和一句指令推导出连续动作轨迹,画面同时显示对未来视觉的预测,周围散布演示数据记录块,整体无文字
内容摘要

做 AI 画图的公司这次没发新画图模型,而是放出一个 70 亿参数的开源机器人控制模型 FLUX 3 Action。它把摄像头画面加一句指令直接变成机械臂动作,在英伟达仿真基准上拿到 42.2% 成功率,参数只有之前最强开源模型的一半不到,速度还快约三倍,约 200 次演示就能微调。

做 FLUX 系列画图模型的那家公司,这次没发新画图模型。

9 月 23 日,Black Forest Labs 发布了 FLUX 3 Action——一个只有 70 亿参数、权重完全公开的机器人控制模型。在英伟达的 RoboLab-120 仿真基准上,它的任务成功率是 42.2%,比之前最强的开源模型 Cosmos 3 Nano(36.8%,160 亿参数)高出 6.1 个百分点,参数少一半以上,速度还快约三倍。

一个做图像的团队,第一次踩进机器人领域就拿了开源第一。这件事本身比分数更值得聊。

先搞清楚它是什么:世界动作模型

大多数人理解的机器人模型是”看到画面 → 输出动作”的一步映射。FLUX 3 Action 不是这么做的,它走的是世界动作模型(World Action Model)的路子:一次同时预测两件事——接下来该做什么动作,以及做完之后摄像头会看到什么。

具体输入输出是这样:

  • 输入:多路摄像头画面 + 机器人当前位姿 + 一句自然语言指令
  • 输出:接下来 32 个动作(按每秒 15 条指令算,约两秒的动作),同时给出对未来画面的预测
  • 重规划:执行完一段,重新观察环境,再从新状态继续预测

背后的假设是:一个已经学会预测视频帧的模型,其实早就理解了物体怎么动。所以它需要的机器人数据比纯策略模型少得多——官方给出的数字是,大约 200 次人工演示就能完成一次微调。

架构上,它是一个扩散 Transformer,配一个冻结的视频 VAE 处理画面,再加一个冻结的 Qwen3-VL-4B 编码器处理指令。官方报告里有个数字挺能说明问题:预训练阶段超过 95% 的 token 来自视频,之后才进入混合了游戏、第一人称手部数据、手持夹爪和遥操作的动作对齐阶段。这基本就是在说——先学会”世界怎么运转”,再学会”手该怎么动”。

数据拆开看:赢在哪,赢了多少

官方放出的对比表可以拆成三块:

  • 仿真基准:RoboLab-120 成功率 42.2%,对比 Cosmos 3 Nano 的 36.8%;同系列较弱的一档 checkpoint 是 38.3%,对比 π0.5 的 28.0% 和 DreamZero 的 25.7%。
  • 参数与速度:70 亿参数,对比 160 亿;推理速度是 Cosmos 3 Nano 的 2.85 到 3.15 倍,在 B200 上一组动作耗时 41.06 毫秒。
  • 真机测试:单台 Franka 机械臂上 30 个任务过了 28 个,93.3%。

同时发了三个 checkpoint,覆盖不同硬件:

  • flux-3-action-base:通用基座
  • flux-3-action-so101:面向低成本的 SO-101 机械臂,走 Hugging Face 的 LeRobot
  • flux-3-action-droid:在 DROID 机器人数据集上训练的版本

权重放在 Hugging Face,用新的 FLUX Kommunity License v1.0;文本编码器 Qwen3-VL-4B 仍是 Apache-2.0。模型也已经接进 LeRobot,可以部署到英伟达 Jetson 这类边缘设备上。

需要说清楚的是,上面这些分数都是厂商自己发的,头部成绩标了正负 0.36 分的误差范围;RoboLab-120 本身就是英伟达的仿真基准,等于在人家的主场打;93.3% 那个真机结果只有 30 个任务、单台机械臂,也没公布是哪两个没过。它证明的是”开源阵营里的第一名”,不是”全世界的第一名”。

上手要花多少功夫

如果你手上正好有一台机械臂在台面上,这条路径是清晰的:

  1. 挑对应权重。用 SO-101 就拿 flux-3-action-so101,用 Franka 或 DROID 数据集的路线就取对应的版本。
  2. 接进 LeRobot。官方给了 LeRobot 的 policy class 和参数高效微调配方,跟着仓库走即可,不用自己写训练框架。
  3. 录约 200 次演示。遥操作完成一组相关的抓放任务,按官方说法这是一个周末的量级,不是一个大项目。
  4. 微调 + 验证。微调完先在训练集之外的任务上测,官方演示里它还能处理没见过的容器和摄像头位置变化。
  5. 自己加安全层。这一步不能省,原因见下。

部署上,70 亿参数意味着你在实验室现有的卡上大概率跑得动;41 毫秒一组动作的延迟,也足够撑起一个真正的控制回路,而不是”想得太慢用不上”。

优点、短板与适合谁

优点:开源权重、代码、基准和训练配方一起给;参数小、速度快、能上边缘设备;微调数据需求低;视频预训练迁移到动作的思路,让它在跨本体泛化上更有余地。

短板(这几条官方也是明说的):

  • 商用条款没写清。许可证是新的,官方说有商用和非商用两种选择,但没公布商用要花多少钱、要满足什么条件。要做产品的话,这是目前最硬的堵点。
  • 没有和闭源系统的对比。表里所有对手都是开源的,Physical Intelligence 和谷歌在这条线上的系统根本没被拉进来比。
  • 输出的是裸关节目标,速度、力矩、行程都没有内置限制。官方很坦诚地让你自己加安全层——这既是正确的披露,也是在提醒你离能用还有多少活。
  • 证据全部来自厂商和合作方,没有第三方复现。

适合现在就试的人:实验室里已经有机械臂的团队、做小规模自动化的工程组。建议再等等的人:想拿它做商业产品的公司——许可证没谈清楚之前,技术指标再好看也不能立项。

替代方案怎么看

  • Cosmos 3 Nano(英伟达,开源):参数大一倍、分数低 5.4 个百分点,但背靠英伟达生态,仿真到部署的工具链更成熟。要省心选它,要省硬件选 FLUX 3 Action。
  • π0.5(Physical Intelligence):同基准 28.0%,商业化路径更清晰,但不开源。
  • 自己搭 VLA 策略:用现成的视觉语言模型加一层动作头。灵活,但需要的数据量和工程投入都远超”200 次演示”。
  • 不碰硬件,先做数字化验证:如果你只是想摸清”世界模型怎么驱动行为”这套逻辑,官方也提到视频游戏可以作为导航能力的试验场。站内这篇《1 万个 AI Agent 花 88 小时解出千禧年难题》虽然是纯软件场景,但对理解”长期自主执行”这件事有帮助。

老达点评

第一,图像公司跨界的这一步,比分数更重要。 这是过去两个月里第三个”用视频预测作为机器人控制基础”的发布,这个路线正在从想法变成共识。以前做机器人策略要专门攒一堆机器人数据,现在可以拿海量视频先学”世界怎么运转”,再花很小的代价迁移到具体本体上。数据成本被重算了一遍。

第二,注意它绕开了谁。 就在上个月,本站写过《英伟达 129 亿美元买下 Hugging Face》——模型分发这一层现在归英伟达了。FLUX 3 Action 选择的发布路径恰恰是 Hugging Face 加 LeRobot,而它对比、并且赢过的对手是英伟达自家的 Cosmos 3 Nano。开源生态内部的竞争格局,比”开源 vs 闭源”那条线热闹得多。

第三,也是最实际的一条:许可证没谈清楚之前,别急着往产品上押。 模型开源了、权重下载了,不等于你能拿它赚钱。做技术研究现在就可以开跑,做商业决策等条款落地。这个判断对所有”权重开放但许可未明”的新模型都适用。

想系统看具身智能这条线怎么走到今天的,可以顺着看《2026 具身智能爆发元年》、《2026 年 AI 具身智能大爆发》和百科词条《具身智能》;想看清 FLUX 这个模型家族的脉络,本站早前的《Stable Diffusion 完全指南》和《AI 画图工具完全指南》里的 FLUX.1 对比可以对照着读。更多工具实测收录在 AI 工具评测专题,实践类内容在 老达 AI 实践专题。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *