Krea, стартап, що розробляє творчі інструменти штучного інтелекту, випустив Krea 2 (K2), сімейство базових моделей тексту в зображення з відкритою вагою, які, за словами компанії, входять до 10 найкращих генераторів зображень у таблиці лідерів штучного аналізу та другі серед моделей незалежних лабораторій. Випуск, детально описаний у технічному звіті, опублікованому 23 червня 2026 року, постачається з двома контрольними точками моделі та дозвільною ліцензією, яка запрошує спільноту до точного налаштування та надбудови.

На відміну від багатьох останніх моделей зображень, які оптимізуються для отримання єдиного відшліфованого виходу за замовчуванням, Krea розробила Krea 2 навколо ідеї творчого дослідження, демонструючи широкий візуальний розподіл, яким користувачі можуть орієнтуватися, а не нав’язувати одну вузьку естетику. For more context on this story, see our ongoing breaking AI news.

Два КПП для різних потреб

Випуск Krea 2 включає дві різні контрольні точки. Перша, K2 Raw, — це неперероблена базова модель, призначена для тонкого налаштування та дослідження після навчання, що дає розробникам чисту основу для адаптації. Друга модель, K2 Turbo, — це модель із настановами та часовими кроками, розроблена для швидкої генерації з кількома кроками, типу швидкої ітерації, якої вимагають творчі робочі процеси.

Пропонуючи як базу, зручну для дослідження, так і варіант, оптимізований за швидкістю, відображає прагматичний розкол. Дослідники та майстри отримують необроблену модель для експериментів, тоді як робочі користувачі отримують швидшу контрольну точку, яка мало що жертвує якістю заради швидкості.

Цілеспрямована позиція проти навчальних даних, створених ШІ

Одна з найяскравіших заяв у технічному звіті Krea стосується даних навчання. Команда стверджує, що не використовувала зображень, створених штучним інтелектом, у своїй суміші перед навчанням. У той час як синтетичні дані та дистиляція стали популярними ярликами для отримання можливостей моделі, Krea виявив, що навіть невелика частка зображень, створених штучним інтелектом, вносить упередження у вихідний розподіл моделі.

Аргументація проста: синтетичні зображення, як правило, легше вивчати моделлю, що фактично накладає штучну стелю на якість. Щоб забезпечити дотримання цієї політики, Krea створила власні класифікатори спеціально для фільтрації зображень, створених штучним інтелектом, зі свого набору даних, замість того, щоб покладатися на стандартні фільтри.

Компанія також дотримувалася протилежної думки щодо якості даних. Замість того, щоб агресивно фільтрувати високі естетичні оцінки, які можуть видаляти навмисно розмиті, зернисті або нетрадиційні зображення, які представляють дійсний художній вибір, Креа виступає за різноманітність і широке охоплення сфери. У результаті, зазначається, є модель із ширшим діапазоном виразності, ніж системи, навчені лише на традиційно красивих зображеннях.

Конвеєр архітектури та навчання

Krea 2 побудовано на основі трансформаторної архітектури, остаточний дизайн якої було обрано в результаті обширних досліджень абляції, задокументованих у звіті. Після тестування альтернатив команда зупинилася на згрупованому запиті (GQA) із стробованою сигмоподібною увагою, SwiGLU MLP і Qwen 3 VL як текстовий кодер. Позиційне кодування використовує тривимірні осьові поворотні вбудовування, а автокодер поєднує Qwen Image VAE і FLUX 2 AE.

Навчання проходило за багатоетапною програмою. Попереднє навчання проходило через етапи роздільної здатності 256 пікселів, 512 пікселів і 1024 пікселів, присвячуючи основну частину обчислень роботі з низькою роздільною здатністю для ефективного створення основних можливостей перед тим, як покращувати генерацію високої чіткості при вищій роздільній здатності. Потім проміжний етап навчання поєднав широке розподіл перед навчанням і розподіл високоякісного контрольованого тонкого налаштування з використанням семантичної кластеризації та стратегій на основі пошуку, щоб зберегти охоплення рідкісних і довготривалих концепцій.

Робимо покоління дослідницьким і керованим

Krea виявила постійний розрив між тим, як тренуються моделі, і тим, як користувачі насправді виражають наміри. Під час навчання моделі вчаться з насичених щільних титрів. Під час висновку користувачі часто вводять короткі, неоднозначні підказки або жестами вказують на настрій чи контрольне зображення, а не точно описують сцену.

Щоб закрити цю прогалину, Krea 2 поставляється з двома системами. Перший — це розширювач підказок, навчений за допомогою двоетапного контрольованого конвеєра тонкого налаштування та підкріплення навчання на основі великих мовних моделей із відкритим кодом, який відображає прості підказки в більш багаті візуальні напрямки, не перезаписуючи наміри користувача. Друга — система еталонного стилю, яка дозволяє користувачам вводити стиль або настрій одного чи кількох еталонних зображень із мінімальним витоком вмісту, пропонуючи точний контроль над силою стилю та зваженим змішуванням.

Разом ці компоненти переосмислюють Krea 2 як дослідницьке середовище. Замість того, щоб повертати єдину відповідь, модель розроблена, щоб відкрити простір можливостей і надати користувачам практичні способи пересування по ньому, використовуючи як текст, так і зображення.

Збереження знань про реальні сутності

Тонкою, але важливою можливістю будь-якого генератора зображень є здатність достовірно представляти відомі сутності, людей, місця та об’єкти, на які користувачі можуть посилатися просто за назвою. Krea хвилювався, що стандартні методи вибірки можуть випадково втратити рідкісні або важливі поняття під час курування даних.

Щоб запобігти цьому, команда провела PageRank для англійської Вікіпедії, зберегла 90 відсотків найкращих статей за рангом, відфільтрувала концепції, які не можуть бути змістовно зображені, а потім перевірила покриття в наборі даних підписів, віддаючи пріоритет зображенням, у підписах яких згадувалися рідкісні концепції. Пізніше команда підтвердила, що жодні концепції, присутні в початковому наборі даних, не були повністю виключені з остаточної навчальної вибірки.

Конкурентний відкритий кордон для Image AI

Поява Krea 2 посилює переповнений пейзаж створення зображень відкритого типу. Компанія позиціонує свою модель як «серед 10 найкращих» у таблиці лідерів штучного аналізу тексту в зображення та «друге місце серед моделей незалежних лабораторій», твердження, яке, якби воно витримало ширший огляд спільноти, зробило б K2 одним із найпотужніших відкрито доступних генераторів зображень.

Технічний звіт, який складається з майже 12 000 слів і деталізує все, від принципів обробки даних до розподіленої інфраструктури навчання, також служить стратегічній меті. Публікуючи методологію, що лежить в основі конкурентоспроможної моделі, Krea заохочує до ретельного вивчення, відтворення та вдосконалення, валюта довіри у спільноті відкритих дослідників.

Для творців і розробників кінцевим результатом є дієва модель зображення з відкритою ліцензією, яка надає пріоритет творчому діапазону над єдиним безпечним за замовчуванням. Завдяки ваговим коефіцієнтам, доступним на Hugging Face, і коду на GitHub, Krea 2 знижує бар’єр для тих, хто хоче створити, налаштувати або просто поекспериментувати з найсучаснішим генератором зображень на власних умовах.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →