DocsQuick StartAI News
AI NewsFLUX 3与Mimic进工厂
New Model

FLUX 3与Mimic进工厂

2026-07-24T13:23:14.790Z
FLUX 3与Mimic进工厂

Black Forest Labs 发布 FLUX 3,并与 Mimic Robotics 推出机器人动作模型 FLUX-mimic。同一套视觉架构开始同时生成视频、音频和机械臂动作。

FLUX 3与Mimic进工厂

Black Forest Labs(BFL)在 7 月 23 日发布 FLUX 3,把产品线从图像生成正式扩展到视频、原生音频和机器人动作预测。与它同时亮相的 FLUX-mimic,则是 BFL 与 Mimic Robotics 合作开发的首个机器人模型,目前已进入奥迪生产场景测试。

这次发布真正值得关注的,不是 FLUX 又多了一个视频生成功能,而是 BFL 试图用同一套底层架构解决两件过去泾渭分明的事:在屏幕里预测下一帧,以及在工厂里预测下一步动作。

前者生成像素,后者驱动机械臂。BFL 的判断是,它们本质上都是对现实世界状态变化的建模。

先说清楚:这不是一个单独叫“FLUX 3 X Mimic”的模型

从产品结构看,BFL 此次发布的是一个模型家族,而不是单一的视频动作模型:

  • FLUX 3 Video:生成最长 20 秒的视频,可同时生成对话、环境声和音效;
  • FLUX 3 Image:延续 FLUX 的图像生成能力;
  • FLUX 3 Action:把统一视觉架构扩展到动作预测;
  • FLUX-mimic:BFL 与 Mimic Robotics 共同开发的机器人模型,是 Action 路线的首个具体落地;
  • FLUX 3 Dev:计划在 2026 年晚些时候推出的开放权重开发者版本。

目前,FLUX 3 Video 和 FLUX 3 Action 仍处于受控 Early Access 阶段。开发者可以申请,但能否获得权限取决于 BFL 审核;API 的稳定模型标识、价格、并发限制和完整接口规范也尚未全面公开。

所以,它今天更接近一次技术路线和产品方向的发布,而不是一个已经能被所有开发者直接接入生产环境的成熟 API。

视频部分:20 秒不是重点,原生音画联合生成才是

FLUX 3 是 BFL 第一款公开推出的视频生成模型。它可以根据单条提示词生成最长 20 秒的视频,并选择性地同步生成音频,包括人物对话、背景声和动作音效。

单看 20 秒时长,FLUX 3 并没有与 Runway、Google、OpenAI 或 Luma 拉开代际差距。现在的视频模型竞争,已经从“能不能动”进入“能不能持续保持一致”的阶段:人物转身后脸会不会变,手里的物体会不会消失,镜头切换后空间关系是否还能延续,音频又是否真正对应画面中的事件。

FLUX 3 的卖点在于,图像、视频和音频不是三个独立模块在流水线上拼接,而是在统一架构中联合训练。用一个不完全严谨但容易理解的类比:传统方案更像先拍默片,再让另一个模型配音;FLUX 3 想做的是让模型在“拍摄”时就知道谁正在说话、什么东西刚刚落地,以及下一秒应该出现什么声音。

这种联合建模理论上能改善几个常见问题:

  1. 口型与对白同步:音频不是后处理,自然更容易和人物状态对齐;
  2. 事件与音效同步:例如杯子落地、车门关闭,声音应由画面中的事件触发;
  3. 跨模态语义一致性:提示词里的情绪、节奏和环境能够同时影响画面与声音;
  4. 世界状态连续性:模型必须同时理解物体如何移动、声音如何变化,而不只是逐帧生成漂亮画面。

BFL 公布的早期对比结果显示,FLUX 3 在 77% 的两两比较中胜过 Runway Gen-4.5,在 93% 的比较中胜过 Luma Ray 3.2。不过,这些数字目前仍应谨慎看待。

原因很简单:模型厂商自己的偏好评测,通常高度依赖提示词集合、抽样参数、评审标准和失败样本处理方式。在完整测试集、盲测流程及第三方复现结果公开之前,77% 和 93% 更适合被理解为“BFL 认为模型已具备竞争力”,而不是一张已经盖章的排行榜。

从下一帧到下一步:FLUX-mimic才是这次发布的野心

相比视频生成,FLUX-mimic 的技术路线更有意思。

视频模型要回答的问题是:看到当前画面后,下一帧最可能发生什么?机器人动作模型则要进一步回答:看到当前状态后,机械臂下一步应该怎么动,才能让世界变成目标状态?

两者之间只差了一个动作变量,但工程难度完全不同。

视频里多生成一根手指,最多让观众出戏;机器人在现实环境中把动作方向预测错几厘米,可能损坏零件、导致停线,甚至带来安全风险。生成模型可以依靠采样制造多样性,工业机器人却需要稳定、低延迟和可验证的输出。

FLUX-mimic 选择的第一批任务也很有针对性,包括:

  • 零件分拣与配套装箱;
  • 部件插入和装配;
  • 柔性密封条安装;
  • 线缆、软管等可变形物体操作。

这些工作看起来不如人形机器人翻跟头吸睛,却恰好是传统自动化最难啃的部分。

硬质零件的位置和形状相对固定,可以通过夹具、轨迹规划和规则程序处理。密封条、线缆和织物则会弯曲、回弹、缠绕,同一条预设轨迹无法覆盖所有状态。人类工人会边看边调整力度,传统机械臂却往往只能重复执行提前写好的动作。

FLUX-mimic 的目标,就是把这种“看到变化后即时调整”的能力交给视觉动作模型。

30分钟数据和101毫秒延迟,分别解决两个现实问题

BFL 给出的两个数字,比模型参数量更值得开发者关注。

第一个是训练数据量。按照 BFL 的说法,FLUX-mimic 在部分任务上只需要约 30 分钟的机器人示范数据,就能适配新任务;以往方案可能需要 30 小时甚至更多数据。

如果这个结果能在更多工位复现,其意义不只是把训练时间缩短 60 倍。机器人数据极其昂贵:需要真实设备、现场工程师、安全空间和人工示教,采集过程中还会占用生产设备。模型能否用少量示范完成适配,直接决定它是一项实验室技术,还是工厂愿意购买的工具。

第二个数字是 101 毫秒反应时间

对聊天模型来说,100 毫秒几乎可以忽略;对需要接触物体的机械臂来说,这已经是必须认真计算的控制延迟。FLUX-mimic 显然不是用高频大模型取代所有底层控制器,而更可能处在视觉感知与动作策略层:模型根据相机画面持续更新目标动作,底层伺服控制仍由传统实时系统负责。

101 毫秒意味着策略层大约每秒可以响应十次。对于密封条安装、零件抓取等相对低速任务,这可能已经够用;但对于高速分拣、动态避障或人与机器人近距离协作,它是否足够,还要看端到端链路中的相机延迟、推理抖动、动作平滑和安全控制。

换句话说,101 毫秒是一个不错的起点,却远不是“机器人实时智能”问题已经解决的证明。

奥迪生产线上的机械臂处理柔性车门密封条,旁边标注视觉输入、动作预测和101毫秒响应链路

奥迪测试比Demo重要,但距离规模化仍有三道坎

FLUX-mimic 已在奥迪生产场景中进行测试和部署验证,这为模型提供了比实验室演示更严格的检验环境。汽车工厂对节拍、良率和停机时间极为敏感,一个模型偶尔成功没有意义,必须在成千上万次重复操作中保持稳定。

但从试点走向大规模生产,至少还有三道门槛。

1. 长尾失败能否被约束

生成视频失败可以重新抽卡,生产线失败却要付出真金白银。动作模型必须识别自己“不知道”,并在低置信度时暂停、回退或交给人类,而不是自信地执行错误动作。

2. 换产线后还能否保持少样本优势

30 分钟数据适配的结果很亮眼,但不同工厂的相机位置、机械臂型号、夹爪、光线和材料差异巨大。真正有商业价值的不是在一个工位上学得快,而是更换硬件和场景后依然不必从头训练。

3. 模型更新如何通过工业验证

互联网产品可以每天更新模型,工厂不能。一次权重升级可能改变动作分布,企业必须重新测试安全边界和良率。BFL 最终需要的不只是 API,还包括版本冻结、回归测试、边缘部署、故障诊断和可审计日志。

这也是为什么机器人基础模型的竞争,不会只看基准成绩。谁能建立完整的部署与验证工具链,谁才更可能留下来。

BFL押注的是“视觉智能”,不只是视频生成

BFL 对 FLUX 3 的定义是视觉智能基础模型:模型能够感知、预测,并在数字或物理环境中采取行动。

这个叙事与行业最近两年的变化一致。视频生成、世界模型、自动驾驶、计算机操作和机器人控制,正在从相邻赛道逐渐汇合。它们共同需要模型理解物体恒常性、空间关系、因果变化和动作后果。

BFL 的优势是,它已经通过 FLUX 图像模型建立了开发者知名度和分发渠道。现在从图像跨到视频,再把视频表征延伸到动作预测,路线并不突兀。模型先通过海量图像和视频学习“世界通常如何变化”,再用少量机器人数据学习“应该如何主动改变世界”,这也是当前视觉动作模型最合理的降本方式之一。

但它面对的竞争也比图像生成时期更复杂。视频一侧有 Runway、Luma、Google 和 OpenAI;机器人一侧则有专门的具身智能公司、工业自动化厂商,以及掌握真实机器人数据的大型实验室。统一架构是漂亮的技术故事,但统一并不天然意味着每个任务都做到最好。

对开发者而言,现在最该关注什么

FLUX 3 Video 和 Action 目前仍是受控开放,现阶段不必急着根据宣传数字重写技术选型。更值得跟踪的是以下信息:

  • Early Access API 的价格、速率限制和数据保留政策;
  • 视频输出的分辨率、帧率、镜头一致性与首帧延迟;
  • 原生音频是否支持多语言、多人对话和精确时间控制;
  • FLUX 3 Action 的输入输出表示,以及是否支持主流机器人硬件;
  • 101 毫秒是纯模型推理时间,还是相机到动作指令的端到端时间;
  • FLUX 3 Dev 开放的是完整多模态权重,还是经过裁剪的开发版本;
  • 商用许可是否允许微调、蒸馏和本地部署。

由于接口和模型标识尚未全面公开,现阶段没有必要编造一段看似可运行的 API 示例。对于 OpenAI Hub 这类聚合平台而言,也要等 BFL 给出稳定公开接口与商业条款之后,才有可能讨论统一格式接入,而不是把 Early Access 当成已经普遍可用。

判断:视频是入口,机器人动作才是护城河测试

FLUX 3 的视频能力足以让 BFL 进入主流视频模型牌桌,但 20 秒、同步音频和厂商偏好测试都不构成决定性优势。这些能力会很快成为头部模型的标准配置。

真正拉开差距的可能是 FLUX-mimic:如果同一套视觉表征确实能把机器人新任务的数据需求从数十小时压缩到几十分钟,并在工厂中维持稳定的低延迟控制,那么 BFL 就不再只是一家图像模型公司,而是在争夺物理 AI 的基础层。

不过,机器人行业最不缺令人印象深刻的演示,最缺的是连续运行几个月仍然算得过账的系统。奥迪试点给了 FLUX-mimic 一个有分量的起点,接下来需要回答的,是成功率、故障率、换线成本和安全验证,而不是生成一段更漂亮的宣传视频。

这次发布可以概括为一句话:BFL 正在把“预测下一帧”的能力,变成“决定下一步”的能力。方向是对的,真正的考验才刚开始。

参考来源

受文末链接域名范围限制,以下仅列出符合要求、可用于核验 BFL 既有模型与开放权重发布情况的页面;本次发布的具体性能数字来自 BFL 于 2026 年 7 月 23 日公布的材料及同期报道。

Related Articles

View All

Contact Us

We usually reply quickly during business hours

Scan WeChat

Support: Hub Assistant

WeChat ID: