Krea, startup tworzący kreatywne narzędzia AI, wypuścił Krea 2 (K2), rodzinę podstawowych modeli zamiany tekstu na obraz o otwartej wadze, które według firmy plasują się wśród 10 najlepszych generatorów obrazów w tabeli liderów sztucznej analizy i drugie wśród modeli z niezależnych laboratoriów. Wydanie, szczegółowo opisane w raporcie technicznym opublikowanym 23 czerwca 2026 r., jest dostarczane z dwoma modelowymi punktami kontrolnymi i liberalną licencją, która zachęca społeczność do dostrajania i rozwijania na jego podstawie.
W przeciwieństwie do wielu najnowszych modeli obrazów, które optymalizują się pod kątem pojedynczego, dopracowanego domyślnego wyjścia, Krea zaprojektowała Krea 2 w oparciu o ideę twórczych poszukiwań, eksponując szeroką dystrybucję wizualną, po której użytkownicy mogą się poruszać, zamiast narzucać jedną wąską estetykę. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.
Dwa punkty kontrolne dla różnych potrzeb
Wydanie Krea 2 zawiera dwa różne punkty kontrolne. Pierwszy, K2 Raw, to niedestylowany model podstawowy przeznaczony do dostrajania i badań po szkoleniu, dając programistom czystą podstawę do adaptacji. Drugi, K2 Turbo, to model oparty na wytycznych i krokach czasowych, zaprojektowany z myślą o szybkim, kilkuetapowym generowaniu, czyli rodzaju szybkiej iteracji, której wymagają kreatywne przepływy pracy.
Oferowanie zarówno bazy przyjaznej badaniom, jak i wariantu zoptymalizowanego pod kątem szybkości, odzwierciedla pragmatyczny podział. Badacze i majsterkowicze otrzymują surowy model do eksperymentowania, podczas gdy użytkownicy produkcyjni otrzymują szybszy punkt kontrolny, w którym niewiele poświęca się jakości na rzecz szybkości.
Świadome stanowisko wobec danych szkoleniowych generowanych przez sztuczną inteligencję
Jedno z najbardziej uderzających twierdzeń w raporcie technicznym Krea dotyczy danych treningowych. Zespół twierdzi, że w swoim miksie przedtreningowym nie wykorzystywał obrazów generowanych przez sztuczną inteligencję. Chociaż dane syntetyczne i destylacja stały się popularnymi skrótami w uzyskiwaniu możliwości modelu, Krea odkrył, że nawet niewielka część obrazów generowanych przez sztuczną inteligencję wprowadza błędy w dystrybucji wyjściowej modelu.
Rozumowanie jest proste: obrazy syntetyczne są zazwyczaj łatwiejsze do nauczenia się modelu, co skutecznie narzuca sztuczny pułap jakości. Aby egzekwować tę zasadę, Krea zbudowała wewnętrzne klasyfikatory specjalnie do filtrowania obrazów generowanych przez sztuczną inteligencję ze swojego zbioru danych, zamiast polegać na gotowych filtrach.
Firma przyjęła również odmienne stanowisko w sprawie jakości danych. Zamiast agresywnego filtrowania pod kątem wysokich wyników estetycznych, które mogą celowo usuwać rozmyte, ziarniste lub niekonwencjonalne obrazy reprezentujące ważne wybory artystyczne, Krea opowiadała się za różnorodnością i szerokim zasięgiem domen. Rezultatem, jak mówi, jest model o szerszym zakresie ekspresji niż systemy trenowane wyłącznie na konwencjonalnie pięknych obrazach.
Architektura i rurociąg szkoleniowy
Krea 2 opiera się na architekturze transformatora, którego ostateczny projekt został wybrany w drodze szeroko zakrojonych badań ablacyjnych udokumentowanych w raporcie. Po przetestowaniu alternatyw zespół zdecydował się na skupioną uwagę zapytań (GQA) z bramkowaną uwagą sigmoidalną, SwiGLU MLP i Qwen 3 VL jako koder tekstu. Kodowanie pozycyjne wykorzystuje osiowe osadzenie obrotowe 3D, a autoenkoder łączy Qwen Image VAE i FLUX 2 AE.
Szkolenie odbywało się według wieloetapowego programu nauczania. Wstępne uczenie przebiegało przez etapy rozdzielczości 256, 512 i 1024 pikseli, przeznaczając większość obliczeń na pracę w niskiej rozdzielczości w celu wydajnego budowania podstawowych funkcji przed wyostrzeniem generowania wysokiej jakości obrazu w wyższych rozdzielczościach. Następnie etap szkolenia w połowie połączył szeroką dystrybucję przedtreningową z wysokiej jakości nadzorowaną dystrybucją dostrajającą przy użyciu grupowania semantycznego i strategii opartych na wyszukiwaniu, aby zachować pokrycie rzadkich i długich koncepcji.
Sprawienie, że generowanie będzie eksploracyjne i sterowalne
Krea zidentyfikowała utrzymującą się lukę pomiędzy sposobem uczenia modeli a rzeczywistym sposobem wyrażania intencji przez użytkowników. Podczas szkolenia modele uczą się na podstawie bogatych, gęstych podpisów. W momencie wnioskowania użytkownicy często wpisują krótkie, niejednoznaczne podpowiedzi lub gestykulują w stronę nastroju lub obrazu referencyjnego, zamiast dokładnie opisywać scenę.
Aby wypełnić tę lukę, Krea 2 jest dostarczana z dwoma systemami. Pierwszy z nich to ekspander podpowiedzi, trenowany poprzez dwuetapowy nadzorowany proces dostrajania i uczenia się przez wzmacnianie w oparciu o duże modele językowe o otwartym kodzie źródłowym, który odwzorowuje proste podpowiedzi na bogatsze kierunki wizualne bez nadpisywania intencji użytkownika. Drugi to system odniesień do stylu, który pozwala użytkownikom nadawać styl lub nastrój jednego lub większej liczby obrazów referencyjnych przy minimalnym wycieku treści, oferując precyzyjną kontrolę nad siłą stylu i ważonym miksowaniem.
Razem te elementy na nowo definiują Krea 2 jako medium eksploracyjne. Zamiast zwracać pojedynczą odpowiedź, model zaprojektowano tak, aby ukazać przestrzeń możliwości i zapewnić użytkownikom praktyczne sposoby poruszania się po niej za pomocą kontroli opartej na tekście i obrazie.
Zachowanie wiedzy o bytach rzeczywistych
Subtelną, ale ważną funkcją każdego generatora obrazów jest zdolność do wiernego przedstawiania znanych bytów, ludzi, miejsc i obiektów, do których użytkownicy mogą się odwoływać po prostu poprzez nazwę. Krea martwił się, że standardowe metody próbkowania mogą przypadkowo pominąć rzadkie lub ważne koncepcje podczas sprawdzania danych.
Aby temu zapobiec, zespół przeprowadził ranking PageRank na angielskojęzycznej Wikipedii, zachował 90 procent najlepszych artykułów według rankingu, odfiltrował koncepcje, których nie można w sensowny sposób przedstawić, a następnie zweryfikował pokrycie w zbiorze danych podpisów, nadając priorytet obrazom, których podpisy odwołują się do rzadkich pojęć. Zespół potwierdził później, że żadne koncepcje obecne w początkowym zbiorze danych nie zostały całkowicie usunięte z ostatecznej próbki szkoleniowej.
Konkurencyjna otwarta granica dla sztucznej inteligencji obrazu
Pojawienie się Krea 2 intensyfikuje zatłoczony krajobraz generowania obrazów z otwartymi ciężarami. Firma umieszcza swój model jako „w pierwszej dziesiątce” w rankingu zamiany tekstu na obraz ze sztucznej analizy i „drugie miejsce wśród modeli z niezależnych laboratoriów”, co twierdzi, że jeśli zostanie poddany szerszej analizie społeczności, uczyni K2 jednym z najsilniejszych, ogólnodostępnych generatorów obrazów.
Raport techniczny, który zawiera prawie 12 000 słów i szczegółowo opisuje wszystko, od zasad przechowywania danych po rozproszoną infrastrukturę szkoleniową, również służy celowi strategicznemu. Publikując metodologię stojącą za modelem konkurencyjnym, Krea zaprasza do analizy, reprodukcji i doskonalenia, czyli waluty wiarygodności w otwartej społeczności badawczej.
Dla twórców i programistów efektem jest wydajny model obrazu na otwartej licencji, w którym priorytetem jest zakres kreacji, a nie jedna bezpieczna wartość domyślna. Dzięki wagom dostępnym na Hugging Face i kodowi na GitHub, Krea 2 obniża barierę dla każdego, kto chce budować, dostrajać lub po prostu eksperymentować z najnowocześniejszym generatorem obrazów na własnych warunkach.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →
