Krea, en startup som bygger kreativa AI-verktyg, har släppt Krea 2 (K2), en familj av text-till-bild-grundmodeller med öppen vikt som företaget säger rankas bland de 10 bästa bildgeneratorerna på topplistan för artificiell analys och tvåa bland modeller från oberoende labb. Utgåvan, som beskrivs i en teknisk rapport publicerad den 23 juni 2026, levereras med två modellkontrollpunkter och en tillåten licens som uppmanar samhället att finjustera och bygga ovanpå den.
Till skillnad från många nya bildmodeller som optimerar för en enda polerad standardutgång, designade Krea 2 kring idén om kreativ utforskning, och exponerade en bred visuell distribution som användare kan navigera i snarare än att tvinga fram en smal estetik. For more context on this story, see our ongoing breaking AI news.
Två kontrollpunkter för olika behov
Krea 2-versionen innehåller två distinkta kontrollpunkter. Den första, K2 Raw, är en odestillerad basmodell avsedd för finjustering och forskning efter utbildning, vilket ger utvecklare en ren grund att anpassa sig. Den andra, K2 Turbo, är en väglednings- och tidsstegsdestillerad modell konstruerad för snabb generering i få steg, den typ av snabb iteration som kreativa arbetsflöden kräver.
Att erbjuda både en forskningsvänlig bas och en hastighetsoptimerad variant återspeglar en pragmatisk splittring. Forskare och pysslare får den råa modellen att experimentera med, medan produktionsanvändare får en snabbare kontrollpunkt som inte offras mycket av kvalitet för snabbhetens skull.
En avsiktlig hållning mot AI-genererad träningsdata
Ett av de mest slående påståendena i Kreas tekniska rapport gäller träningsdata. Teamet uppger att de inte använde några AI-genererade bilder i sin förträningsmix. Medan syntetisk data och destillation har blivit populära genvägar för att skaffa modellfunktioner, fann Krea att även en liten del av AI-genererade bilder introducerade fördomar i modellens outputdistribution.
Resonemanget är enkelt: syntetiska bilder tenderar att vara lättare för en modell att lära sig, vilket effektivt sätter ett konstgjort tak på kvaliteten. För att upprätthålla policyn byggde Krea in-house klassificerare specifikt för att filtrera AI-genererade bilder från dess datauppsättning, snarare än att förlita sig på vanliga filter.
Företaget hade också en motsatt syn på datakvalitet. Istället för att aggressivt filtrera efter höga estetiska poäng, som kan ta bort medvetet suddiga, korniga eller okonventionella bilder som representerar giltiga konstnärliga val, argumenterade Krea för mångfald och bred domäntäckning. Resultatet, säger det, är en modell med ett bredare uttrycksfullt utbud än system som tränas endast på konventionellt vackra bilder.
Pipeline för arkitektur och utbildning
Krea 2 är byggd på en transformatorarkitektur vars slutliga design valdes genom omfattande ablationsstudier dokumenterade i rapporten. Efter att ha testat alternativ bestämde sig teamet för att fokusera på grupperad fråga (GQA) med gated sigmoid uppmärksamhet, en SwiGLU MLP och Qwen 3 VL som sin textkodare. Positionell kodning använder 3D axiella roterande inbäddningar, och autokodaren kombinerar Qwen Image VAE och FLUX 2 AE.
Utbildningen följde en läroplan i flera steg. Förträningen fortskred genom 256px, 512px och 1024px upplösningsstadier, och ägnade huvuddelen av beräkningen åt lågupplöst arbete för att bygga kärnfunktioner effektivt innan man skärpte högfientlighetsgenereringen vid högre upplösningar. Ett mellanträningsskede överbryggade sedan den breda förträningsfördelningen och den högkvalitativa övervakade finjusteringsdistributionen med hjälp av semantiska kluster- och hämtningsbaserade strategier för att bevara täckningen av sällsynta och långa begrepp.
Gör generationen utforskande och styrbar
Krea identifierade en ihållande klyfta mellan hur modeller tränas och hur användare faktiskt uttrycker avsikter. Under träningen lär sig modellerna av rika, täta bildtexter. Vid slutledningstid skriver användare ofta korta, tvetydiga uppmaningar eller gester mot en stämnings- eller referensbild istället för att beskriva en scen exakt.
För att stänga det gapet levereras Krea 2 med två system. Den första är en snabbexpanderare, tränad genom en tvåstegs övervakad finjustering och förstärkningsinlärningspipeline ovanpå stora språkmodeller med öppen källkod, som kartlägger enkla uppmaningar till rikare visuella riktningar utan att skriva över användarens avsikt. Det andra är ett stilreferenssystem som låter användare injicera stilen eller stämningen hos en eller flera referensbilder med minimalt innehållsläckage, vilket ger finkornig kontroll över stilstyrka och viktad blandning.
Tillsammans omdefinierar dessa komponenter Krea 2 som ett utforskande medium. Istället för att returnera ett enda svar är modellen utformad för att exponera ett utrymme av möjligheter och ge användarna praktiska sätt att förflytta sig genom det med både text- och bildbaserad kontroll.
Bevara kunskap om verkliga enheter
En subtil men viktig förmåga för alla bildgeneratorer är förmågan att troget representera kända enheter, personer, platser och objekt som användare kan referera till helt enkelt med namn. Krea oroade sig för att standardsamplingsmetoder av misstag skulle kunna tappa sällsynta eller viktiga begrepp under datakurering.
För att förhindra detta körde teamet PageRank över engelska Wikipedia, behöll de översta 90 procenten av artiklarna efter rangordning, filtrerade bort begrepp som inte kan avbildas på ett meningsfullt sätt och verifierade sedan täckningen över dess bildtextdataset, och prioriterade bilder vars bildtexter refererade till sällsynta begrepp. Teamet bekräftade efteråt att inga begrepp som fanns i den ursprungliga datamängden hade utelämnats helt från det slutliga träningsprovet.
En konkurrenskraftig öppen gräns för bild-AI
Krea 2:s ankomst intensifierar ett trångt bildskapande landskap med öppna vikter. Företaget positionerar sin modell som "bland de 10 bästa" på ledartavlan för artificiell analys av text-till-bild och "andra plats bland modeller från oberoende laboratorier", ett påstående som, om den håller sig under en bredare granskning av samhället, skulle göra K2 till en av de starkaste öppet tillgängliga bildgeneratorerna.
Den tekniska rapporten, som omfattar nästan 12 000 ord och beskriver allt från principer för datakurering till distribuerad utbildningsinfrastruktur, tjänar också ett strategiskt syfte. Genom att publicera metodiken bakom en konkurrenskraftig modell inbjuder Krea granskning, reproduktion och förbättring, trovärdighetens valuta i det öppna forskarsamhället.
För kreatörer och utvecklare är resultatet en kapabel, öppet licensierad bildmodell som prioriterar kreativt utbud framför en enda säker standard. Med vikterna tillgängliga på Hugging Face och koden på GitHub sänker Krea 2 barriären för alla som vill bygga, finjustera eller helt enkelt experimentera med en toppmodern bildgenerator på sina egna villkor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
