Black Forest Labs は、画像、ビデオ、オーディオから共同学習して物理世界の 1 つの表現を構築するマルチモーダル基盤モデルである FLUX 3 をリリースしました。 2026 年 7 月 23 日に発表され、現在早期アクセスが可能な FLUX 3 は、生成 AI を支配してきたモデルごとのアプローチからのアーキテクチャ上の大幅な脱却を示し、画像作成、ネイティブ サウンドによるビデオ生成、さらにはロボット制御を 1 つの統合システムに統合します。
この発表は、Runway、OpenAI の Sora、Google の Veo などのプレーヤーが、より高品質でより機能的なビデオ モデルを作成しようと競い合っている、ジェネレーティブ メディア スペースにおける競争が激化している時期に到来しました。 FLUX 3 は、メディア タイプごとに異なるモデルが人為的な制限であるという、根本的に異なる前提を持ってこのコンテストに参加しています。その進捗状況は、生成メディア環境に関する継続的な AI 業界報道 の一環として監視されています。
現実の統一モデル
Black Forest Labs は、リリースに伴うブログ投稿で、複数のモダリティにわたって単一のモデルをトレーニングする理論的な動機を説明しました。同社は、画像、ビデオ、オーディオなど、単一のモダリティでは現実を完全に説明できるものはないと主張しました。それぞれは、異なるセンサーによって捕捉された、同じ基礎となる物理世界の投影であり、それぞれのプロセスで情報が失われます。
画像は、特定の時点の空間構造をキャプチャします。ビデオは時間の次元を復元し、時間の力学と物理法則を明らかにします。音声は、視覚だけでは検出できない機械的現象と音響の間の因果関係を明らかにします。言語はこれらの認識を目標、抽象化、指示に結び付けると同社は書いている。
これらすべてから同時に学習することで、モデルの相互制約により、単一のモダリティだけよりも多くの情報が提供されます。音は衝撃に一致し、動きは質量に従わなければならず、未来は過去に従う必要があります。モダリティは個別であることをやめ、1 つの根底にある現実についての証拠になり始めます。
FLUX 3 は、Black Forest Labs が Self-Flow と呼ぶ、この原則に完全に基づいて構築された同社初のモデルです。これは、同じ基盤となるアーキテクチャ内でマルチモーダルな生成と理解を効率的に調整するためのアプローチです。
ネイティブ オーディオを使用したビデオ生成
FLUX 3 の最も印象的な機能は、単一世代パスで同期されたネイティブ オーディオを使用して長さ 20 秒までのビデオを生成できることです。これは、個別に生成されたオーディオと組み合わせる必要があるサイレント映像を生成するほとんどの既存のビデオ モデルとは異なります。
同社によれば、FLUX 3 のビデオ出力は、人間の表情のキャプチャ、音と物理的イベントの関連付け、および多言語機能のサポートに特に優れています。これらの機能を組み合わせて、数分間続くシーケンスを作成できます。視覚的な参照により、すべてのシーンでキャラクターの一貫性が保たれます。
トレーニング中に実施された人間による予備評価では、比較の 77% で Runway Gen-4.5 よりも FLUX 3 が、比較の 93% で Luma Ray 3.2 よりも FLUX 3 が好まれました。新しい競合他社と比較すると、比較の最大 69% で Grok Imagine Video、60% で Kling v3 Pro、52% で Seedance 2.0 と Gemini Omni Flash よりも好まれました。
同社は、これらの結果は暫定的なものであり、早期アクセス段階でさらなる改善が期待されると警告した。
画像とテキストのレンダリング
FLUX 3 はビデオだけでなく、さまざまなスタイル、アスペクト比、解像度の画像を合成および編集できます。 Black Forest Labs は、複雑なプロンプトの処理と画像内の正確なテキストの生成において、以前の FLUX バージョンに比べて大幅な改善が行われたと報告しました。これは、生成画像モデルにとって永続的な課題です。
同社によると、FLUX 3 Image 機能の早期アクセス段階は、ビデオのリリース後数週間以内に開始される予定だという。
物理 AI への架け橋
おそらく FLUX 3 の最も型破りな側面は、ロボット工学への拡張です。このモデルの世界理解はアクション予測にまで及び、物理 AI への 2 つのルートを取ると同社は説明しました。ネイティブ アクション予測を FLUX 3 に直接統合する方法と、事前トレーニングされたビデオ バックボーンを限られたタスク固有のデータで微調整された特殊なアクション モデルの基盤として使用する方法です。
Black Forest Labs は、FLUX 3 に早期アクセスした最初の企業の 1 つである mimic robotics と提携しました。共同で FLUX-mimic を開発しました。これは、FLUX 3 のバックボーンと、器用な操作のためのロボット学習における mimic の専門知識を組み合わせたビデオ アクション モデルです。同社によれば、このシステムはすでにアウディの実際の生産タスクでテストされているという。
これは注目すべき収束を表しています。エンターテインメント コンテンツの生成に使用されているのと同じ基盤テクノロジーが、製造環境での物理ロボットの制御に適用されています。同社の主張は、物理 AI とコンテンツ作成は同じ基盤で実行されるというもので、どちらも、物体がどのように結合し、どのように移動し、物理的なイベントがどのように音を生成するかを理解するモデルを必要とするためです。
競争と市場での地位
この発表により、広く使用されている FLUX 画像生成モデルを開発するベルリンに本拠を置く新興企業 Black Forest Labs が、生成 AI 分野におけるより野心的な競争相手として位置付けられます。 Runway のような企業は、ビデオとテキストおよびマルチモーダル チャットボットの OpenAI に限定的に焦点を当てていますが、Black Forest Labs は、視覚、聴覚、物理領域にわたる真に統合されたモデルが、特殊な代替モデルよりも優れていることが証明されると賭けています。
同社は、知覚、行動、言語予測を同じモデルに統合することを目標に、すでに次世代モデルに取り組んでいると述べた。今後数週間から数か月かけて、同じ基盤となるマルチモーダル フロー マッチング アーキテクチャから構築された追加機能を展開し、それぞれフィードバックと安全性テストのための早期アクセス フェーズを経ます。
FLUX 3 は現在、ビデオ生成用の早期アクセスで利用可能であり、画像および追加機能が段階的にロールアウトされます。
AI の先を行く
画像、ビデオ、オーディオ、ロボティクスに対する FLUX 3 の統合アプローチは、生成 AI モデルの設計方法に顕著な変化をもたらします。生成メディア競争と人工知能全体の最新の動向について詳しくは、AI ニュース速報 の記事をご覧ください。
AIニュースをもっと読む→
