Black Forest Labs는 물리적 세계에 대한 단일 표현을 구축하기 위해 이미지, 비디오 및 오디오를 공동으로 학습하는 다중 모드 기반 모델인 FLUX 3을 출시했습니다. 2026년 7월 23일에 발표되어 현재 초기 액세스로 제공되는 FLUX 3는 생성 AI, 축소 이미지 생성, 기본 사운드를 사용한 비디오 생성, 심지어 로봇 제어까지 지배했던 모델별 접근 방식에서 하나의 통합 시스템으로의 중요한 아키텍처적 출발을 나타냅니다.

이번 출시는 Runway, OpenAI의 Sora, Google의 Veo를 포함한 플레이어들이 더 높은 품질과 더 유능한 비디오 모델을 제작하기 위해 경쟁해 온 생성 미디어 공간에서 경쟁이 심화되는 순간에 이루어졌습니다. FLUX 3는 근본적으로 다른 전제를 가지고 이 콘테스트에 참가합니다. 즉, 각 미디어 유형에 대한 별도의 모델은 인위적인 한계라는 것입니다. 생성 미디어 환경에 대한 진행 중인 AI 산업 보도의 일환으로 그 진행 상황을 모니터링하고 있습니다.

현실의 통합 모델

출시와 함께 제공되는 블로그 게시물에서 Black Forest Labs는 여러 양식에 걸쳐 단일 모델을 훈련하기 위한 이론적 동기를 제시했습니다. 회사는 이미지, 비디오, 오디오 등 단일 양식이 현실에 대한 완전한 설명을 제공하지 않는다고 주장했습니다. 각각은 서로 다른 센서에 의해 캡처된 동일한 기본 물리적 세계의 투영이며, 그 과정에서 각각의 정보가 손실됩니다.

이미지는 특정 시점의 공간 구조를 포착합니다. 비디오는 시간의 차원을 복원하고 시간적 역학과 물리적 법칙을 드러냅니다. 오디오는 시각만으로는 감지할 수 없는 기계적 현상과 음향 사이의 인과 관계를 드러냅니다. 언어는 이러한 인식을 목표, 추상화 및 지침과 연결한다고 회사는 썼습니다.

이 모든 것으로부터 동시에 학습함으로써 모델의 상호 제약은 단일 양식보다 더 많은 정보를 제공합니다. 소리는 충격과 일치해야 하고, 동작은 질량에 복종해야 하며, 미래는 과거를 따라야 합니다. 양식은 더 이상 분리되지 않고 하나의 기본 현실에 대한 증거가 되기 시작합니다.

FLUX 3은 Black Forest Labs가 Self-Flow라고 부르는 이 원칙을 바탕으로 구축된 회사의 첫 번째 모델입니다. 이는 동일한 기본 아키텍처 내에서 멀티모달 생성 및 이해를 효율적으로 조정하기 위한 접근 방식입니다.

네이티브 오디오를 사용한 비디오 생성

FLUX 3의 가장 눈에 띄는 기능은 단일 세대 패스에서 동기화된 기본 오디오로 최대 20초 길이의 비디오를 생성하는 기능입니다. 이는 별도로 생성된 오디오와 짝을 이루어야 하는 무성 영상을 생성하는 대부분의 기존 비디오 모델과 구별됩니다.

회사에 따르면 FLUX 3의 비디오 출력은 인간의 표정을 포착하고, 소리를 물리적 이벤트와 연관시키고, 다국어 기능을 지원하는 데 특히 강력합니다. 이러한 기능을 결합하여 몇 분 동안 지속되는 시퀀스를 생성할 수 있으며, 여기서 시각적 참조는 캐릭터가 모든 장면에서 일관성을 유지하는 데 도움이 됩니다.

훈련 중에 수행된 예비 인간 평가에서 FLUX 3는 비교의 77%에서 Runway Gen-4.5보다 선호되었고 비교의 93%에서 Luma Ray 3.2보다 선호되었습니다. 새로운 경쟁업체에 비해 최대 69%의 비교에서 Grok Imagine Video보다 선호되었으며, Kling v3 Pro는 60%, Seedance 2.0 및 Gemini Omni Flash는 52%에서 선호되었습니다.

회사는 이러한 결과가 예비적이며 초기 액세스 단계에서 추가 개선이 예상된다고 경고했습니다.

이미지 및 텍스트 렌더링

비디오 외에도 FLUX 3은 다양한 스타일, 종횡비 및 해상도에 걸쳐 이미지를 합성하고 편집할 수 있습니다. Black Forest Labs는 복잡한 프롬프트를 처리하고 이미지 내에서 정확한 텍스트를 생성하는 측면에서 이전 FLUX 버전에 비해 상당한 개선이 이루어졌다고 보고했습니다. 이는 생성 이미지 모델의 지속적인 과제입니다.

FLUX 3 이미지 기능에 대한 초기 액세스 단계는 비디오 출시 후 몇 주 안에 시작될 것이라고 회사는 말했습니다.

물리적 AI로의 연결

아마도 FLUX 3의 가장 색다른 측면은 로봇 공학으로의 확장일 것입니다. 회사는 모델의 세계 이해가 행동 예측으로 확장되어 물리적 AI에 대한 두 가지 경로를 취한다고 설명했습니다. 즉, 기본 행동 예측을 FLUX 3에 직접 통합하는 것과 사전 훈련된 비디오 백본을 제한된 작업별 데이터로 미세 조정된 특수 동작 모델의 기반으로 사용하는 것입니다.

Black Forest Labs는 FLUX 3에 대한 초기 액세스 권한을 얻은 최초의 회사 중 하나인 Mimic Robotics와 파트너십을 맺었습니다. 그들은 함께 FLUX 3 백본과 민첩한 조작을 위한 로봇 학습에 대한 Mimic의 전문 지식을 결합한 비디오 액션 모델인 FLUX-mimic을 개발했습니다. 회사에 따르면 이 시스템은 이미 아우디의 실제 생산 작업에서 테스트되고 있습니다.

이는 주목할만한 융합을 나타냅니다. 엔터테인먼트 콘텐츠를 생성하는 데 사용되는 것과 동일한 기본 기술이 제조 환경에서 물리적 로봇을 제어하는 ​​데 적용되고 있습니다. 회사의 주제는 물리적 AI와 콘텐츠 제작이 동일한 기반에서 실행된다는 것입니다. 두 가지 모두 객체가 서로 결합하는 방식, 사물이 움직이는 방식, 물리적 이벤트가 소리를 생성하는 방식을 이해하는 모델이 필요하기 때문입니다.

경쟁 및 시장 위치

이번 출시로 널리 사용되는 FLUX 이미지 생성 모델을 개발한 베를린 기반 스타트업인 Black Forest Labs가 생성 AI 분야에서 더욱 야심찬 경쟁자로 자리매김하게 되었습니다. Runway와 같은 회사는 텍스트 및 다중 모달 챗봇의 비디오 및 OpenAI에만 집중하고 있는 반면, Black Forest Labs는 시각, 청각 및 물리적 영역 전반에 걸쳐 진정으로 통합된 모델이 전문적인 대안보다 더 많은 능력을 입증할 것이라고 확신하고 있습니다.

회사는 지각, 행동, 언어 예측을 동일한 모델에 통합하는 것을 목표로 이미 차세대 모델을 개발하고 있다고 밝혔습니다. 앞으로 몇 주, 몇 달에 걸쳐 동일한 기본 다중 모드 흐름 일치 아키텍처를 기반으로 구축된 추가 기능을 출시할 예정이며, 각 기능은 피드백 및 안전 테스트를 위한 초기 액세스 단계를 따릅니다.

FLUX 3는 현재 비디오 생성을 위한 초기 액세스 버전으로 제공되며, 이미지 및 추가 기능이 점진적으로 출시됩니다.

AI보다 앞서 나가세요

이미지, 비디오, 오디오 및 로봇 공학에 대한 FLUX 3의 통합 접근 방식은 생성 AI 모델이 설계되는 방식에 주목할 만한 변화를 가져옵니다. 생성적 미디어 경쟁과 인공 지능 분야의 최신 개발 상황에 대해 자세히 알아보려면 AI 속보 보도를 팔로우하세요.

AI 뉴스 자세히 보기 →