Krea, une startup qui crée des outils d'IA créatifs, a publié Krea 2 (K2), une famille de modèles de base de conversion texte-image à pondération ouverte qui, selon la société, se classe parmi les 10 meilleurs générateurs d'images du classement de l'analyse artificielle et au deuxième rang parmi les modèles de laboratoires indépendants. La version, détaillée dans un rapport technique publié le 23 juin 2026, est livrée avec deux modèles de points de contrôle et une licence permissive qui invite la communauté à l'affiner et à la développer.
Contrairement à de nombreux modèles d'images récents qui optimisent pour une seule sortie par défaut raffinée, Krea a conçu Krea 2 autour de l'idée d'exploration créative, exposant une large distribution visuelle dans laquelle les utilisateurs peuvent naviguer plutôt que de forcer une esthétique étroite. Pour plus de contexte sur cette histoire, consultez notre dernières avancées en IA.
Deux points de contrôle pour des besoins différents
La version Krea 2 comprend deux points de contrôle distincts. Le premier, K2 Raw, est un modèle de base non distillé destiné à la recherche de réglage fin et post-formation, offrant aux développeurs une base propre pour s'adapter. Le second, K2 Turbo, est un modèle distillé par guidage et pas de temps, conçu pour une génération rapide en quelques étapes, le genre d'itération rapide qu'exigent les flux de travail créatifs.
Proposer à la fois une base adaptée à la recherche et une variante optimisée pour la vitesse reflète une scission pragmatique. Les chercheurs et les bricoleurs disposent du modèle brut pour expérimenter, tandis que les utilisateurs de production bénéficient d'un point de contrôle plus rapide qui sacrifie peu la qualité au profit de la vitesse.
Une position délibérée contre les données de formation générées par l'IA
L'une des affirmations les plus frappantes du rapport technique de Krea concerne les données d'entraînement. L’équipe déclare n’avoir utilisé aucune image générée par l’IA dans son mix de pré-entraînement. Alors que les données synthétiques et la distillation sont devenues des raccourcis populaires pour acquérir les capacités du modèle, Krea a constaté que même une petite proportion d'images générées par l'IA introduisait des biais dans la distribution des résultats du modèle.
Le raisonnement est simple : les images synthétiques ont tendance à être plus faciles à apprendre pour un modèle, ce qui impose un plafond artificiel à la qualité. Pour appliquer cette politique, Krea a construit des classificateurs internes spécifiquement pour filtrer les images générées par l'IA de son ensemble de données, plutôt que de s'appuyer sur des filtres disponibles dans le commerce.
L’entreprise a également adopté une vision à contre-courant de la qualité des données. Plutôt que de filtrer de manière agressive des scores esthétiques élevés, ce qui peut supprimer les images délibérément floues, granuleuses ou non conventionnelles qui représentent des choix artistiques valables, Krea a plaidé en faveur de la diversité et d'une large couverture de domaine. Le résultat, dit-il, est un modèle avec une gamme d’expression plus large que les systèmes formés uniquement sur des images d’une beauté conventionnelle.
Architecture et pipeline de formation
Krea 2 est construit sur une architecture de transformateur dont la conception finale a été choisie grâce à des études d'ablation approfondies documentées dans le rapport. Après avoir testé des alternatives, l’équipe a opté pour une attention de requête groupée (GQA) avec une attention sigmoïde fermée, un SwiGLU MLP et Qwen 3 VL comme encodeur de texte. L'encodage positionnel utilise des intégrations rotatives axiales 3D et l'encodeur automatique combine Qwen Image VAE et FLUX 2 AE.
La formation suivait un programme en plusieurs étapes. Le pré-entraînement a progressé à travers les étapes de résolution de 256 px, 512 px et 1 024 px, consacrant l'essentiel du calcul au travail à basse résolution pour développer efficacement les fonctionnalités de base avant d'affiner la génération haute fidélité à des résolutions plus élevées. Une étape intermédiaire de formation a ensuite fait le lien entre la large distribution de pré-formation et la distribution de réglage fin supervisé de haute qualité à l'aide de stratégies basées sur le regroupement sémantique et la récupération pour préserver la couverture des concepts rares et à longue traîne.
Rendre la génération exploratoire et orientable
Krea a identifié un écart persistant entre la manière dont les modèles sont formés et la manière dont les utilisateurs expriment réellement leur intention. Pendant la formation, les modèles apprennent à partir de légendes riches et denses. Au moment de l'inférence, les utilisateurs tapent souvent des invites courtes et ambiguës, ou font des gestes vers une ambiance ou une image de référence plutôt que de décrire une scène avec précision.
Pour combler cet écart, Krea 2 est livré avec deux systèmes. Le premier est un expanseur d'invites, formé via un pipeline d'apprentissage de réglage fin et de renforcement supervisé en deux étapes au-dessus de grands modèles de langage open source, qui mappe des invites simples en directions visuelles plus riches sans écraser l'intention de l'utilisateur. Le second est un système de référence de style qui permet aux utilisateurs d'injecter le style ou l'ambiance d'une ou plusieurs images de référence avec une fuite de contenu minimale, offrant un contrôle précis sur la force du style et un mixage pondéré.
Ensemble, ces composants redéfinissent Krea 2 en tant que support exploratoire. Au lieu de renvoyer une réponse unique, le modèle est conçu pour exposer un espace de possibilités et donner aux utilisateurs des moyens pratiques de s'y déplacer en utilisant à la fois un contrôle basé sur le texte et l'image.
Préserver la connaissance des entités réelles
Une capacité subtile mais importante pour tout générateur d'images est la capacité de représenter fidèlement des entités, des personnes, des lieux et des objets connus auxquels les utilisateurs peuvent faire référence simplement par leur nom. Krea craignait que les méthodes d'échantillonnage standard puissent accidentellement abandonner des concepts rares ou importants lors de la conservation des données.
Pour éviter cela, l'équipe a exécuté le PageRank sur Wikipédia en anglais, a conservé les 90 % des articles les plus performants par classement, a filtré les concepts qui ne peuvent pas être représentés de manière significative, puis a vérifié la couverture de son ensemble de données de légendes, en donnant la priorité aux images dont les légendes faisaient référence à des concepts rares. L’équipe a confirmé par la suite qu’aucun concept présent dans l’ensemble de données initial n’avait été entièrement supprimé de l’échantillon de formation final.
Une frontière ouverte et compétitive pour l'IA d'image
L'arrivée de Krea 2 intensifie un paysage de génération d'images à poids ouverts encombré. La société positionne son modèle comme « parmi les 10 premiers » du classement texte-image de l'analyse artificielle et comme « deuxième place parmi les modèles issus de laboratoires indépendants », une affirmation qui, si elle est soumise à un examen plus large de la communauté, ferait de K2 l'un des générateurs d'images les plus puissants disponibles en libre accès.
Le rapport technique, qui compte près de 12 000 mots et détaille tout, des principes de conservation des données à l'infrastructure de formation distribuée, répond également à un objectif stratégique. En publiant la méthodologie derrière un modèle compétitif, Krea invite à l'examen, à la reproduction et à l'amélioration, monnaie de crédibilité dans la communauté de recherche ouverte.
Pour les créateurs et les développeurs, le résultat est un modèle d'image performant, sous licence ouverte, qui donne la priorité à la gamme de créations plutôt qu'à une seule valeur par défaut sûre. Avec les poids disponibles sur Hugging Face et le code sur GitHub, Krea 2 abaisse la barrière pour tous ceux qui souhaitent construire, affiner ou simplement expérimenter un générateur d'images de pointe selon leurs propres conditions.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →
