Black Forest Labs 发布了 FLUX 3,这是一种多模式基础模型,该公司表示,该模型可以共同从图像、视频和音频中学习,以构建物理世界的单一表示。 FLUX 3 于 2026 年 7 月 23 日发布,现已提供抢先体验,它代表了与主导生成式 AI、折叠图像创建、带有原生声音的视频生成,甚至机器人控制到一个统一系统的逐模型方法的重大架构背离。
此次发布正值生成媒体领域竞争加剧之际,包括 Runway、OpenAI 的 Sora 和 Google 的 Veo 在内的玩家一直在竞相制作更高质量、更强大的视频模型。 FLUX 3 带着一个根本不同的前提进入这场竞赛:每种媒体类型的单独模型是人为的限制。作为我们对生成媒体领域持续的人工智能行业报道 的一部分,正在对其进展进行监控。
现实的统一模型
在发布的博客文章中,黑森林实验室阐述了跨多种模式训练单一模型的理论动机。该公司认为,没有任何一种单一形式——无论是图像、视频还是音频——可以提供对现实的完整描述。每一个都是同一底层物理世界的投影,由不同的传感器捕获,每个传感器都在此过程中丢失信息。
图像捕捉特定时间点的空间结构。视频还原了时间的维度,揭示了时间动态和物理定律。音频揭示了仅靠视觉无法检测到的机械现象和声学之间的因果关系。该公司写道,语言将这些感知与目标、抽象和指令联系起来。
通过同时学习所有这些,模型的相互约束提供了比任何单一模态更多的信息。声音必须与冲击相匹配,运动必须服从质量,未来必须遵循过去。这些模式不再是分离的,而是开始成为一个潜在现实的证据。
FLUX 3 是该公司第一个完全基于这一原则构建的模型,黑森林实验室将其称为 Self-Flow——一种在同一底层架构内有效协调多模式生成和理解的方法。
使用原生音频生成视频
FLUX 3 最引人注目的功能是它能够在一次生成过程中生成长度长达 20 秒的视频,并带有同步的本地音频。这与大多数现有视频模型不同,后者产生必须与单独生成的音频配对的无声镜头。
据该公司称,FLUX 3的视频输出在捕捉人类面部表情、将声音与物理事件相关联以及支持多语言功能方面尤其强大。这些功能可以组合起来创建持续几分钟的序列,其中视觉参考有助于确保角色在所有场景中保持一致。
在训练期间进行的初步人体评估中,FLUX 3 在 77% 的比较中优于 Runway Gen-4.5,在 93% 的比较中优于 Luma Ray 3.2。与较新的竞争对手相比,它在高达 69% 的比较中优于 Grok Imagine Video,在 60% 中优于 Kling v3 Pro,在 52% 中优于 Seedance 2.0 和 Gemini Omni Flash。
该公司警告说,这些结果是初步的,预计在早期访问阶段会有进一步的改进。
图像和文本渲染
除了视频之外,FLUX 3 还可以合成和编辑各种风格、长宽比和分辨率的图像。 Black Forest Labs 报告称,在处理复杂提示和在图像中生成准确文本方面,较早期的 FLUX 版本有了显着改进——这是生成图像模型面临的持续挑战。
该公司表示,FLUX 3 Image 功能的早期访问阶段将在视频发布后几周内开放。
通向物理人工智能的桥梁
也许 FLUX 3 最非传统的方面是它对机器人技术的扩展。该公司解释说,该模型的世界理解延伸到了动作预测,采取了两条通往物理人工智能的途径:将本机动作预测直接集成到 FLUX 3 中,并使用预训练的视频主干作为专门动作模型的基础,并使用有限的特定任务数据进行微调。
Black Forest Labs 与 Mimic Robotics 合作,该公司是最早获得 FLUX 3 早期使用权的公司之一。他们共同开发了 FLUX-mimic,这是一种视频动作模型,结合了 FLUX 3 的骨干和imit 在机器人学习方面的专业知识,以实现灵巧的操作。据该公司称,该系统已经在奥迪的实际生产任务中进行了测试。
这代表了一种显着的融合:用于生成娱乐内容的相同底层技术正在应用于控制制造环境中的物理机器人。该公司的论点是,物理人工智能和内容创建在相同的基础上运行,因为两者都需要一个能够理解物体如何结合在一起、物体如何移动以及物理事件如何产生声音的模型。
竞争和市场地位
Black Forest Labs 是一家总部位于柏林的初创公司,开发了广泛使用的 FLUX 图像生成模型,此次发布将 Black Forest Labs 定位为生成 AI 领域更具雄心的竞争对手。虽然 Runway 等公司主要专注于视频,OpenAI 专注于文本和多模式聊天机器人,但 Black Forest Labs 相信,跨视觉、听觉和物理领域的真正统一的模型将比专门的替代方案更强大。
该公司表示,它已经在研究下一代模型,目标是在同一模型中统一感知、动作和语言预测。在接下来的几周和几个月里,它将推出基于相同的底层多模式流量匹配架构构建的其他功能,每个功能都遵循反馈和安全测试的早期访问阶段。
FLUX 3 现已推出视频生成抢先体验版,图像和其他功能将逐步推出。
保持人工智能领先地位
FLUX 3 对图像、视频、音频和机器人技术的统一方法标志着生成式 AI 模型设计方式的显着转变。有关生成媒体竞赛和人工智能最新发展的更多信息,请关注我们的突发人工智能新闻 报道。
阅读更多人工智能新闻 →
