Black Forest Labs випустила FLUX 3, мультимодальну базову модель, яка, за словами компанії, спільно вивчає зображення, відео та аудіо для створення єдиного представлення фізичного світу. FLUX 3, анонсований 23 липня 2026 року та тепер доступний у ранньому доступі, представляє значний архітектурний відхід від підходу моделі за модальністю, який домінував у генеруючому штучному інтелекті, створенні згорнутих зображень, генерації відео з власним звуком і навіть у керуванні роботами в одній єдиній системі.
Запуск відбувається в момент загострення конкуренції в генеративному медіа-просторі, де такі гравці, як Runway, Sora від OpenAI і Veo від Google, змагаються за створення якісніших і потужніших відеомоделей. FLUX 3 вступає в цей конкурс із принципово іншою передумовою: що окремі моделі для кожного типу носія є штучним обмеженням. Його прогрес відстежується в рамках нашого постійного [висвітлення індустрії ШІ] (https://aibuzzwire.news) генеративного медіаландшафту.
Уніфікована модель реальності
У дописі в блозі, який супроводжував випуск, Black Forest Labs виклали теоретичну мотивацію для навчання однієї моделі в кількох модальностях. Компанія стверджувала, що жодна модальність — зображення, відео чи аудіо — не дає повного опису реальності. Кожна з них є проекцією того самого основного фізичного світу, що фіксується різними датчиками, при цьому кожна втрачає інформацію.
Зображення фіксують просторові структури в певний момент часу. Відео відновлює вимір часу та розкриває часову динаміку та фізичні закони. Аудіо розкриває причинно-наслідкові зв’язки між механічними явищами та акустикою, які лише зір не може виявити. Мова пов’язує ці уявлення з цілями, абстракціями та інструкціями, пише компанія.
Завдяки вивченню всього цього одночасно взаємні обмеження моделі надають більше інформації, ніж будь-яка окрема модальність. Звук має відповідати впливу, рух має підкорятися масі, майбутнє має випливати з минулого. Модальності перестають бути окремими і починають бути доказами однієї основної реальності.
FLUX 3 — це перша модель компанії, повністю побудована на цьому принципі, який Black Forest Labs називає Self-Flow — підхід до ефективного узгодження мультимодальної генерації та розуміння в межах однієї базової архітектури.
Генерація відео за допомогою рідного аудіо
Найбільш вражаючою можливістю FLUX 3 є його здатність генерувати відео тривалістю до 20 секунд із синхронізованим рідним звуком за один прохід генерації. Це відрізняє його від більшості існуючих відеомоделей, які створюють безшумний відеоматеріал, який потрібно поєднувати з окремо створеним аудіо.
За словами компанії, відеовихід FLUX 3 особливо сильний для захоплення виразів людських облич, асоціації звуків із фізичними подіями та підтримки багатомовних можливостей. Ці можливості можна комбінувати для створення послідовностей тривалістю кілька хвилин, де візуальні посилання допомагають гарантувати, що персонажі залишаються послідовними в усіх сценах.
Під час попередньої оцінки людиною, проведеної під час навчання, FLUX 3 віддано перевагу перед Runway Gen-4.5 у 77% порівнянь і перед Luma Ray 3.2 у 93% порівнянь. Порівняно з новішими конкурентами йому віддали перевагу перед Grok Imagine Video у 69% порівнянь, Kling v3 Pro у 60%, а Seedance 2.0 і Gemini Omni Flash у 52%.
Компанія попередила, що ці результати є попередніми, і що на етапі раннього доступу очікуються подальші покращення.
Візуалізація зображень і тексту
Крім відео, FLUX 3 може синтезувати та редагувати зображення в різних стилях, пропорціях і роздільній здатності. Black Forest Labs повідомили про значні покращення порівняно з попередніми версіями FLUX у обробці складних підказок і створенні точного тексту в зображеннях — постійна проблема для генеративних моделей зображень.
За словами компанії, фаза раннього доступу до можливостей FLUX 3 Image відкриється через кілька тижнів після випуску відео.
Міст до фізичного ШІ
Мабуть, найбільш нетрадиційним аспектом FLUX 3 є його поширення на робототехніку. Розуміння світу моделі поширюється на прогнозування дій, пояснила компанія, вибираючи два шляхи до фізичного штучного інтелекту: інтегруючи власне передбачення дій безпосередньо у FLUX 3 і використовуючи попередньо підготовлену магістраль відео як основу для спеціалізованих моделей дій, налаштованих з обмеженими даними для конкретних завдань.
Black Forest Labs співпрацювала з мімічною робототехнікою, яка була однією з перших компаній, яка отримала ранній доступ до FLUX 3. Разом вони розробили FLUX-mimic, відеоекшн-модель, яка поєднує основу FLUX 3 із досвідом імітатора у навчанні роботів для спритного маніпулювання. За словами компанії, система вже проходить тестування на реальних виробничих завданнях Audi.
Це являє собою помітну конвергенцію: та сама основна технологія, яка використовується для створення розважального контенту, застосовується для керування фізичними роботами у виробничих середовищах. Теза компанії полягає в тому, що фізичний штучний інтелект і створення контенту працюють на одній основі, оскільки для обох потрібна модель, яка розуміє, як об’єкти тримаються разом, як речі рухаються та як фізичні події створюють звук.
Конкуренція та ринкова позиція
Запуск позиціонує Black Forest Labs — берлінський стартап, який розробляє широко використовувані моделі генерації зображень FLUX — як більш амбітного конкурента в галузі генеративного штучного інтелекту. У той час як такі компанії, як Runway, зосередилися лише на відео та OpenAI на текстових і мультимодальних чат-ботах, Black Forest Labs робить ставку на те, що справді уніфікована модель у візуальних, звукових і фізичних сферах виявиться ефективнішою, ніж спеціалізовані альтернативи.
Компанія заявила, що вже працює над наступним поколінням моделей, щоб об’єднати в одній моделі передбачення сприйняття, дії та мови. Протягом найближчих тижнів і місяців він розгорне додаткові можливості, створені на основі тієї ж базової мультимодальної архітектури узгодження потоків, кожна після фази раннього доступу для зворотного зв’язку та тестування безпеки.
FLUX 3 уже доступний у ранньому доступі для створення відео, із поступовим розгортанням зображень і додаткових можливостей.
Будьте попереду ШІ
Уніфікований підхід FLUX 3 до зображень, відео, аудіо та робототехніки знаменує помітну зміну в тому, як розробляються генеративні моделі ШІ. Щоб дізнатися більше про генеративну медіа-гонку та останні розробки в галузі штучного інтелекту, слідкуйте за нашими найважливішими новинами AI.
Читати більше новин AI →
