Krea, startup vytvářející kreativní nástroje umělé inteligence, vydala Krea 2 (K2), rodinu základních modelů text-to-image s otevřenou vahou, které podle společnosti patří mezi 10 nejlepších generátorů obrázků v žebříčku Artificial Analysis a na druhém místě mezi modely z nezávislých laboratoří. Vydání, podrobně popsané v technické zprávě zveřejněné 23. června 2026, se dodává se dvěma modelovými kontrolními body a povolenou licencí, která zve komunitu, aby na něm dolaďovala a stavěla.
Na rozdíl od mnoha nedávných obrazových modelů, které se optimalizují pro jeden leštěný výchozí výstup, Krea navrhla Krea 2 na myšlence kreativního průzkumu, odhaluje širokou vizuální distribuci, ve které se uživatelé mohou pohybovat, spíše než vynucovat si jednu úzkou estetiku. For more context on this story, see our ongoing artificial intelligence updates.
Dva kontrolní body pro různé potřeby
Vydání Krea 2 obsahuje dva odlišné kontrolní body. První, K2 Raw, je nedestilovaný základní model určený pro dolaďování a výzkum po školení, což vývojářům poskytuje čistý základ pro přizpůsobení. Druhý, K2 Turbo, je model s naváděním a časovými kroky navržený pro rychlou generaci v několika krocích, druh rychlé iterace, kterou kreativní pracovní postupy vyžadují.
Nabídka jak základny přátelské k výzkumu, tak varianty s optimalizovanou rychlostí odráží pragmatické rozdělení. Výzkumníci a kutilové získají surový model k experimentování, zatímco produkční uživatelé získají rychlejší kontrolní bod, který kvůli rychlosti obětuje jen málo na kvalitě.
Záměrný postoj proti tréninkovým datům generovaným umělou inteligencí
Jedno z nejvýraznějších tvrzení v technické zprávě Krea se týká tréninkových dat. Tým uvádí, že ve své předtréninkové směsi nepoužil žádné obrázky generované AI. Zatímco syntetická data a destilace se staly populárními zkratkami pro získávání schopností modelu, Krea zjistil, že i malá část obrázků generovaných umělou inteligencí vnesla zkreslení do distribuce výstupu modelu.
Zdůvodnění je jednoduché: syntetické obrázky mají tendenci se snáze naučit model, což účinně vytváří umělý strop kvality. Aby společnost Krea prosadila tuto politiku, vytvořila vlastní klasifikátory speciálně pro filtrování obrázků generovaných umělou inteligencí z datové sady, místo aby se spoléhala na běžné filtry.
Společnost také zaujala opačný názor na kvalitu dat. Spíše než agresivním filtrováním pro vysoké estetické skóre, které může odstranit záměrně rozmazané, zrnité nebo nekonvenční obrázky, které představují platné umělecké volby, Krea argumentoval pro rozmanitost a široké pokrytí domén. Výsledkem je podle ní model s širším výrazovým rozsahem než systémy trénované pouze na konvenčně krásných snímcích.
Pipeline architektury a školení
Krea 2 je postavena na transformátorové architektuře, jejíž konečný design byl vybrán na základě rozsáhlých ablačních studií dokumentovaných ve zprávě. Po testování alternativ se tým rozhodl pro pozornost seskupených dotazů (GQA) s hradlovou sigmoidní pozorností, SwiGLU MLP a Qwen 3 VL jako textový kodér. Polohové kódování využívá 3D axiální rotační vložení a autoenkodér kombinuje Qwen Image VAE a FLUX 2 AE.
Školení probíhalo podle vícestupňového kurikula. Předtrénování postupovalo přes fáze rozlišení 256, 512 a 1024 pixelů, přičemž většinu výpočetní práce věnovalo práci s nízkým rozlišením, aby bylo možné efektivně budovat základní funkce, než se zdokonalí generování s vysokou věrností při vyšších rozlišeních. Fáze středního tréninku pak překlenula širokou distribuci předtréninku a vysoce kvalitní distribuci doladění pod dohledem pomocí sémantického shlukování a strategií založených na vyhledávání, aby se zachovalo pokrytí vzácných a dlouhých konceptů.
Generace bude objevná a řiditelná
Krea identifikovala přetrvávající mezeru mezi tím, jak jsou modely trénovány, a tím, jak uživatelé skutečně vyjadřují záměr. Během tréninku se modelky učí z bohatých, hutných titulků. V době odvození uživatelé často píší krátké, nejednoznačné výzvy nebo gesta směrem k náladě nebo referenčnímu obrázku, místo aby přesně popsali scénu.
Aby se tato mezera uzavřela, Krea 2 se dodává se dvěma systémy. První je rychlý expandér, vyškolený prostřednictvím dvoustupňového kontrolovaného dolaďovacího a posilovacího učebního kanálu nad open source velkými jazykovými modely, který mapuje jednoduché výzvy do bohatších vizuálních směrů, aniž by přepisoval záměr uživatele. Druhým je systém odkazování na styl, který uživatelům umožňuje vnést styl nebo náladu jednoho nebo více referenčních obrázků s minimálním únikem obsahu a nabízí jemnou kontrolu nad silou stylu a vyvážené míchání.
Společně tyto komponenty redefinují Krea 2 jako průzkumné médium. Namísto vracení jediné odpovědi je model navržen tak, aby odhalil prostor možností a poskytl uživatelům praktické způsoby, jak se v něm pohybovat pomocí textového i obrazového ovládání.
Zachování znalostí skutečných entit
Jemnou, ale důležitou schopností každého generátoru obrázků je schopnost věrně reprezentovat známé entity, lidi, místa a objekty, na které se uživatelé mohou odkazovat jednoduše jménem. Krea se obával, že standardní metody vzorkování by mohly během zpracování dat náhodně vypustit vzácné nebo důležité koncepty.
Aby tomu tým zabránil, provedl hodnocení PageRank nad anglickou Wikipedií, ponechal nejlepších 90 procent článků podle hodnocení, odfiltroval pojmy, které nelze smysluplně znázornit, a poté ověřil pokrytí v celé své sadě titulků, přičemž upřednostnil obrázky, jejichž popisky odkazovaly na vzácné pojmy. Tým následně potvrdil, že žádné koncepty přítomné v počátečním datovém souboru nebyly zcela vypuštěny z konečného tréninkového vzorku.
Konkurenční otevřená hranice pro obrazovou umělou inteligenci
Příchod Krea 2 zintenzivňuje přeplněné prostředí generování obrázků s otevřenými váhami. Společnost umístila svůj model jako „mezi 10 nejlepšími“ v žebříčku Artificial Analysis pro převod textu na obrázek a „druhé místo mezi modely z nezávislých laboratoří“, což je tvrzení, že pokud bude pod širším dohledem komunity, bude K2 jedním z nejsilnějších volně dostupných generátorů obrázků.
Technická zpráva, která obsahuje téměř 12 000 slov a podrobně popisuje vše od principů správy dat po distribuovanou školicí infrastrukturu, také slouží strategickému účelu. Zveřejněním metodologie konkurenčního modelu Krea vyzývá ke kontrole, reprodukci a zlepšování, což je měna důvěryhodnosti v otevřené výzkumné komunitě.
Pro tvůrce a vývojáře je výsledkem schopný, otevřeně licencovaný obrazový model, který upřednostňuje kreativní rozsah před jediným bezpečným výchozím nastavením. S váhami dostupnými na Hugging Face a kódem na GitHubu snižuje Krea 2 bariéru pro každého, kdo chce sestavit, doladit nebo jednoduše experimentovat s nejmodernějším generátorem obrázků podle vlastních podmínek.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
