Krea, стартап, создающий креативные инструменты искусственного интеллекта, выпустил Krea 2 (K2), семейство базовых моделей преобразования текста в изображение с открытым весом, которые, по словам компании, входят в десятку лучших генераторов изображений в таблице лидеров искусственного анализа и занимают второе место среди моделей независимых лабораторий. Релиз, подробно описанный в техническом отчете, опубликованном 23 июня 2026 года, поставляется с двумя контрольными точками модели и разрешительной лицензией, которая предлагает сообществу выполнить точную настройку и использовать ее.

В отличие от многих недавних моделей изображений, которые оптимизируются для единого вывода по умолчанию, Креа разработал Krea 2, опираясь на идею творческого исследования, открывая широкое визуальное распределение, по которому пользователи могут ориентироваться, а не навязывать одну узкую эстетику. Подробнее об этой истории — в нашем тенденции ИИ.

Две контрольно-пропускные точки для разных нужд

Релиз Krea 2 включает в себя две отдельные контрольные точки. Первая, K2 Raw, представляет собой неочищенную базовую модель, предназначенную для тонкой настройки и исследований после обучения, предоставляющую разработчикам чистую основу для адаптации. Вторая, K2 Turbo, представляет собой модель, основанную на указаниях и временных шагах, разработанную для быстрой генерации в несколько шагов, такого рода быстрой итерации, которая требуется для творческих рабочих процессов.

Предложение как удобной для исследований базы, так и варианта, оптимизированного по скорости, отражает прагматичный раскол. Исследователи и мастера получают необработанную модель для экспериментов, а пользователи промышленной версии получают более быструю контрольную точку, которая мало жертвует качеством ради скорости.

Сознательная позиция в отношении обучающих данных, генерируемых ИИ

Одно из самых ярких заявлений в техническом отчете Креа касается данных обучения. Команда заявляет, что она не использовала изображения, созданные ИИ, в своей предварительной тренировочной смеси. Хотя синтетические данные и их дистилляция стали популярными способами получения возможностей модели, Креа обнаружил, что даже небольшая часть изображений, сгенерированных ИИ, вносит искажения в выходное распределение модели.

Причина проста: синтетические изображения, как правило, легче обучаются модели, что фактически накладывает искусственный потолок на качество. Чтобы обеспечить соблюдение этой политики, Krea создала собственные классификаторы специально для фильтрации изображений, сгенерированных ИИ, из своего набора данных, а не полагалась на готовые фильтры.

Компания также придерживалась противоположной точки зрения на качество данных. Вместо агрессивной фильтрации по высоким эстетическим оценкам, которая может удалить намеренно размытые, зернистые или нетрадиционные изображения, которые представляют собой правильный художественный выбор, Креа выступал за разнообразие и широкий охват предметной области. Результатом, по его словам, является модель с более широким диапазоном выразительности, чем у систем, обученных только на традиционно красивых изображениях.

Архитектура и конвейер обучения

Krea 2 построен на основе трансформаторной архитектуры, окончательная конструкция которой была выбрана в результате обширных исследований абляции, описанных в отчете. После тестирования альтернатив команда остановилась на групповом запросе (GQA) с закрытым сигмовидным вниманием, SwiGLU MLP и Qwen 3 VL в качестве кодировщика текста. При позиционном кодировании используются трехмерные аксиально-вращательные внедрения, а автоэнкодер сочетает в себе Qwen Image VAE и FLUX 2 AE.

Обучение проходило по многоступенчатой ​​программе. Предварительное обучение проходило через этапы разрешения 256 пикселей, 512 пикселей и 1024 пикселей, при этом основная часть вычислений была посвящена работе с низким разрешением для эффективного создания основных возможностей перед отточкой высокоточной генерации при более высоких разрешениях. Затем этап промежуточного обучения соединил широкое распределение перед обучением и высококачественное контролируемое распределение точной настройки с использованием семантической кластеризации и стратегий на основе поиска, чтобы сохранить охват редких и длинных концепций.

Сделать поколение исследовательским и управляемым

Креа выявил постоянный разрыв между тем, как обучаются модели, и тем, как пользователи на самом деле выражают намерения. Во время обучения модели учатся на насыщенных и плотных подписях. Во время вывода пользователи часто печатают короткие, двусмысленные подсказки или жестикулируют в сторону настроения или эталонного изображения, вместо того чтобы точно описать сцену.

Чтобы закрыть этот пробел, Krea 2 поставляется с двумя системами. Первый — это расширитель подсказок, обученный с помощью двухэтапного контролируемого конвейера точной настройки и обучения с подкреплением на основе моделей большого языка с открытым исходным кодом, который отображает простые подсказки в более богатые визуальные направления, не переписывая намерения пользователя. Вторая — это система ссылок на стили, которая позволяет пользователям придавать стиль или настроение одному или нескольким эталонным изображениям с минимальной утечкой контента, предлагая детальный контроль над силой стиля и взвешенным смешиванием.

Вместе эти компоненты переопределяют Krea 2 как исследовательскую среду. Вместо того, чтобы возвращать один ответ, модель предназначена для того, чтобы раскрыть пространство возможностей и предоставить пользователям практические способы перемещения по нему, используя как текстовое, так и графическое управление.

Сохранение знаний о реальных объектах

Тонкая, но важная возможность любого генератора изображений — это способность точно представлять известные сущности, людей, места и объекты, на которые пользователи могут ссылаться просто по имени. Креа беспокоился, что стандартные методы выборки могут случайно упустить редкие или важные понятия во время обработки данных.

Чтобы предотвратить это, команда проанализировала PageRank по англоязычной Википедии, сохранила 90 процентов лучших статей по рейтингу, отфильтровала концепции, которые не могут быть осмысленно изображены, а затем проверила охват по всему набору данных подписей, отдавая приоритет изображениям, подписи которых ссылаются на редкие концепции. Впоследствии команда подтвердила, что ни одна концепция, присутствующая в исходном наборе данных, не была полностью исключена из окончательной обучающей выборки.

Конкурентоспособный открытый фронтир для искусственного интеллекта в изображениях

Появление Krea 2 усиливает ситуацию с созданием многолюдных изображений в открытом весе. Компания позиционирует свою модель как «входящую в десятку лучших» в таблице лидеров преобразования текста в изображения искусственного анализа и как «второе место среди моделей из независимых лабораторий». Это утверждение, если оно окажется под более широким контролем сообщества, сделает K2 одним из самых мощных общедоступных генераторов изображений.

Технический отчет, объем которого составляет почти 12 000 слов и подробно описывает все — от принципов обработки данных до инфраструктуры распределенного обучения, также служит стратегической цели. Публикуя методологию, лежащую в основе конкурентной модели, Креа призывает к изучению, воспроизведению и совершенствованию, что является валютой доверия в открытом исследовательском сообществе.

Для создателей и разработчиков результатом является эффективная модель изображений с открытой лицензией, которая отдает приоритет творческому диапазону над одним безопасным значением по умолчанию. Благодаря весам, доступным на Hugging Face, и коду на GitHub, Krea 2 снижает барьер для всех, кто хочет создать, настроить или просто поэкспериментировать с современным генератором изображений на своих собственных условиях.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →