Black Forest Labs выпустила FLUX 3, мультимодальную базовую модель, которая, по словам компании, совместно учится на изображениях, видео и аудио для создания единого представления физического мира. Анонсированный 23 июля 2026 года и теперь доступный в раннем доступе, FLUX 3 представляет собой значительный архитектурный отход от подхода «модель за модальностью», который доминировал в генеративном искусственном интеллекте, создании свертывающихся изображений, создании видео с собственным звуком и даже управлении роботами в одной единой системе.
Запуск происходит в момент обострения конкуренции в генеративном медиа-пространстве, где такие игроки, как Runway, Sora от OpenAI и Veo от Google, состязаются в создании более качественных и более функциональных видеомоделей. FLUX 3 вступает в это соревнование с принципиально иной предпосылкой: отдельные модели для каждого типа медиа являются искусственным ограничением. Его прогресс отслеживается в рамках нашего постоянного [освещения индустрии искусственного интеллекта] (https://aibuzzwire.news) генеративного медиа-ландшафта.
Единая модель реальности
В сообщении в блоге, сопровождающем релиз, Black Forest Labs изложила теоретическую мотивацию для обучения одной модели несколькими способами. Компания утверждает, что ни одна модальность — будь то изображение, видео или аудио — не дает полного описания реальности. Каждый из них представляет собой проекцию одного и того же основного физического мира, зафиксированную разными датчиками, каждый из которых при этом теряет информацию.
Изображения фиксируют пространственные структуры в определенный момент времени. Видео восстанавливают измерение времени и раскрывают временную динамику и физические законы. Аудио раскрывает причинно-следственные связи между механическими явлениями и акустикой, которые одно только зрение не может обнаружить. Язык связывает эти представления с целями, абстракциями и инструкциями, пишет компания.
Благодаря одновременному изучению всех этих факторов взаимные ограничения модели предоставляют больше информации, чем любая отдельная модальность. Звук должен соответствовать удару, движение должно подчиняться массе, будущее должно следовать из прошлого. Модальности перестают быть отдельными и начинают свидетельствовать об одной базовой реальности.
FLUX 3 — первая модель компании, полностью построенная на этом принципе, который Black Forest Labs называет Self-Flow — подходе для эффективного согласования мультимодальной генерации и понимания в рамках одной базовой архитектуры.
Генерация видео с собственным звуком
Наиболее поразительной особенностью FLUX 3 является его способность генерировать видео длиной до 20 секунд с синхронизированным собственным звуком за один проход. Это отличает его от большинства существующих видеомоделей, которые создают бесшумные кадры, которые необходимо сочетать с отдельно генерируемым звуком.
По заявлению компании, видеовыход FLUX 3 особенно эффективен в передаче выражений человеческого лица, сопоставлении звуков с физическими событиями и поддержке многоязычных возможностей. Эти возможности можно комбинировать для создания эпизодов продолжительностью несколько минут, где визуальные ссылки помогают гарантировать, что персонажи остаются одинаковыми во всех сценах.
В предварительной оценке людей, проведенной во время обучения, FLUX 3 был предпочтительнее Runway Gen-4.5 в 77% сравнений и Luma Ray 3.2 в 93% сравнений. По сравнению с более новыми конкурентами ему отдали предпочтение Grok Imagine Video в 69% сравнений, Kling v3 Pro в 60%, а также Seedance 2.0 и Gemini Omni Flash в 52%.
Компания предупредила, что эти результаты являются предварительными и что на этапе раннего доступа ожидаются дальнейшие улучшения.
Изображения и рендеринг текста
Помимо видео, FLUX 3 может синтезировать и редактировать изображения в самых разных стилях, соотношениях сторон и разрешениях. Лаборатории Black Forest Labs сообщили о значительных улучшениях по сравнению с более ранними версиями FLUX в обработке сложных подсказок и создании точного текста внутри изображений — постоянная проблема для генеративных моделей изображений.
По словам компании, этап раннего доступа к возможностям FLUX 3 Image откроется через несколько недель после выпуска видео.
Мост к физическому ИИ
Возможно, самым нетрадиционным аспектом FLUX 3 является его распространение на робототехнику. Понимание мира модели распространяется и на прогнозирование действий, пояснила компания, выбирая два пути к физическому ИИ: интеграцию встроенного прогнозирования действий непосредственно в FLUX 3 и использование предварительно обученной магистральной видеосети в качестве основы для специализированных моделей действий, точно настроенных с использованием ограниченных данных для конкретных задач.
Black Forest Labs стала партнером компании mimic robotics, которая была одной из первых компаний, получивших ранний доступ к FLUX 3. Вместе они разработали FLUX-mimic, модель видеодействий, сочетающую в себе основу FLUX 3 с опытом компании mimic в обучении роботов для ловких манипуляций. По данным компании, система уже тестируется на реальных производственных задачах Audi.
Это представляет собой заметную конвергенцию: та же самая базовая технология, которая используется для создания развлекательного контента, применяется для управления физическими роботами в производственных средах. Тезис компании заключается в том, что физический искусственный интеллект и создание контента работают на одной основе, поскольку оба требуют модели, которая понимает, как объекты держатся вместе, как предметы движутся и как физические события производят звук.
Конкуренция и положение на рынке
Запуск позиционирует Black Forest Labs — берлинский стартап, стоящий за широко используемыми моделями генерации изображений FLUX, — как более амбициозного конкурента в области генеративного искусственного интеллекта. В то время как такие компании, как Runway, сосредоточили свое внимание на видео, а OpenAI — на текстовых и мультимодальных чат-ботах, Black Forest Labs делает ставку на то, что по-настоящему унифицированная модель для визуальной, слуховой и физической областей окажется более эффективной, чем специализированные альтернативы.
Компания заявила, что уже работает над моделями следующего поколения с целью объединить прогнозирование восприятия, действий и языка в одной модели. В ближайшие недели и месяцы компания развернет дополнительные возможности, основанные на той же базовой архитектуре согласования мультимодальных потоков, каждая из которых будет следовать за этапом раннего доступа для обратной связи и тестирования безопасности.
FLUX 3 сейчас доступен в раннем доступе для создания видео, при этом изображения и дополнительные возможности будут внедряться постепенно.
Будьте впереди ИИ
Единый подход FLUX 3 к изображениям, видео, аудио и робототехнике знаменует собой заметный сдвиг в разработке генеративных моделей искусственного интеллекта. Чтобы узнать больше о гонке генеративных медиа и последних разработках в области искусственного интеллекта, следите за нашими [последними новостями об искусственном интеллекте] (https://aibuzzwire.news).
Читать больше новостей об искусственном интеллекте →
