Η Krea, μια startup που δημιουργεί δημιουργικά εργαλεία τεχνητής νοημοσύνης, κυκλοφόρησε το Krea 2 (K2), μια οικογένεια ανοιχτών μοντέλων βάσης κειμένου σε εικόνα που η εταιρεία λέει ότι κατατάσσεται μεταξύ των 10 κορυφαίων δημιουργών εικόνας στον πίνακα κορυφαίων τεχνητών ανάλυσης και δεύτερη μεταξύ μοντέλων από ανεξάρτητα εργαστήρια. Η έκδοση, που περιγράφεται λεπτομερώς σε μια τεχνική έκθεση που δημοσιεύτηκε στις 23 Ιουνίου 2026, αποστέλλεται με δύο μοντέλα σημείων ελέγχου και μια επιτρεπτή άδεια που καλεί την κοινότητα να τελειοποιήσει και να χτίσει πάνω της.

Σε αντίθεση με πολλά πρόσφατα μοντέλα εικόνων που βελτιστοποιούν για μια μόνο γυαλισμένη προεπιλεγμένη έξοδο, η Krea σχεδίασε το Krea 2 γύρω από την ιδέα της δημιουργικής εξερεύνησης, εκθέτοντας μια ευρεία οπτική διανομή στην οποία οι χρήστες μπορούν να πλοηγηθούν αντί να επιβάλλουν μια στενή αισθητική. For more context on this story, see our ongoing more AI stories.

Δύο σημεία ελέγχου για διαφορετικές ανάγκες

Η κυκλοφορία του Krea 2 περιλαμβάνει δύο διαφορετικά σημεία ελέγχου. Το πρώτο, το K2 Raw, είναι ένα μη αποσταγμένο βασικό μοντέλο που προορίζεται για έρευνα με ακρίβεια και μετά την εκπαίδευση, δίνοντας στους προγραμματιστές μια καθαρή βάση προσαρμογής. Το δεύτερο, το K2 Turbo, είναι ένα μοντέλο με απόσταξη καθοδήγησης και χρόνου σχεδιασμένο για γρήγορη παραγωγή λίγων βημάτων, το είδος της γρήγορης επανάληψης που απαιτούν οι δημιουργικές ροές εργασίας.

Η προσφορά μιας βάσης φιλικής προς την έρευνα και μιας παραλλαγής βελτιστοποιημένης ταχύτητας αντικατοπτρίζει έναν ρεαλιστικό διαχωρισμό. Οι ερευνητές και οι τεχνίτες χρησιμοποιούν το ακατέργαστο μοντέλο για να πειραματιστούν, ενώ οι χρήστες παραγωγής έχουν ένα πιο γρήγορο σημείο ελέγχου που θυσιάζει ελάχιστα στην ποιότητα για χάρη της ταχύτητας.

Μια σκόπιμη στάση ενάντια στα δεδομένα εκπαίδευσης που δημιουργούνται από την τεχνητή νοημοσύνη

Ένας από τους πιο εντυπωσιακούς ισχυρισμούς στην τεχνική έκθεση της Krea αφορά τα δεδομένα προπόνησης. Η ομάδα δηλώνει ότι δεν χρησιμοποίησε εικόνες που δημιουργήθηκαν από AI στο μείγμα προπόνησης. Ενώ τα συνθετικά δεδομένα και η απόσταξη έχουν γίνει δημοφιλείς συντομεύσεις για την απόκτηση δυνατοτήτων μοντέλων, η Krea διαπίστωσε ότι ακόμη και ένα μικρό ποσοστό εικόνων που δημιουργούνται από AI εισήγαγε προκαταλήψεις στην κατανομή εξόδου του μοντέλου.

Ο συλλογισμός είναι απλός: οι συνθετικές εικόνες τείνουν να είναι πιο εύκολο να μάθει ένα μοντέλο, γεγονός που επιβάλλει αποτελεσματικά ένα τεχνητό ανώτατο όριο στην ποιότητα. Για να επιβάλει την πολιτική, η Krea κατασκεύασε εσωτερικούς ταξινομητές ειδικά για να φιλτράρει εικόνες που δημιουργούνται από τεχνητή νοημοσύνη από το σύνολο δεδομένων της, αντί να βασίζεται σε φίλτρα εκτός ραφιού.

Η εταιρεία είχε επίσης αντίθετη άποψη για την ποιότητα των δεδομένων. Αντί να φιλτράρει επιθετικά για υψηλές αισθητικές βαθμολογίες, οι οποίες μπορούν να αφαιρέσουν σκόπιμα θολές, κοκκώδεις ή αντισυμβατικές εικόνες που αντιπροσωπεύουν έγκυρες καλλιτεχνικές επιλογές, η Krea υποστήριξε την ποικιλομορφία και την ευρεία κάλυψη του τομέα. Το αποτέλεσμα, λέει, είναι ένα μοντέλο με ευρύτερο εκφραστικό εύρος από συστήματα εκπαιδευμένα μόνο σε συμβατικά όμορφες εικόνες.

Σωλήνας Αρχιτεκτονικής και Εκπαίδευσης

Το Krea 2 είναι χτισμένο σε μια αρχιτεκτονική μετασχηματιστή του οποίου ο τελικός σχεδιασμός επιλέχθηκε μέσω εκτεταμένων μελετών κατάλυσης που τεκμηριώνονται στην έκθεση. Αφού δοκίμασε εναλλακτικές λύσεις, η ομάδα ολοκλήρωσε την προσοχή ομαδοποιημένων ερωτημάτων (GQA) με περιφραγμένη προσοχή σιγμοειδούς, ένα SwiGLU MLP και το Qwen 3 VL ως κωδικοποιητή κειμένου. Η κωδικοποίηση θέσης χρησιμοποιεί τρισδιάστατες αξονικές περιστροφικές ενσωματώσεις και ο αυτόματος κωδικοποιητής συνδυάζει το Qwen Image VAE και το FLUX 2 AE.

Η εκπαίδευση ακολούθησε πρόγραμμα σπουδών πολλαπλών σταδίων. Η προεκπαίδευση προχώρησε σε στάδια ανάλυσης 256, 512 εικονοστοιχείων και 1024 εικονοστοιχείων, αφιερώνοντας το μεγαλύτερο μέρος του υπολογισμού σε εργασίες χαμηλής ανάλυσης για την αποτελεσματική δημιουργία βασικών δυνατοτήτων πριν από την όξυνση της παραγωγής υψηλής πιστότητας σε υψηλότερες αναλύσεις. Στη συνέχεια, ένα στάδιο ενδιάμεσης εκπαίδευσης γεφύρωσε την ευρεία διανομή προεκπαίδευσης και την υψηλής ποιότητας εποπτευόμενη διανομή λεπτομέρειας χρησιμοποιώντας στρατηγικές σημασιολογικής ομαδοποίησης και ανάκτησης για τη διατήρηση της κάλυψης σπάνιων και μακροχρόνιων εννοιών.

Κάνοντας τη γενιά εξερευνητική και κατευθυνόμενη

Η Krea εντόπισε ένα επίμονο χάσμα μεταξύ του τρόπου εκπαίδευσης των μοντέλων και του τρόπου με τον οποίο οι χρήστες εκφράζουν πραγματικά την πρόθεσή τους. Κατά τη διάρκεια της εκπαίδευσης, τα μοντέλα μαθαίνουν από πλούσιους, πυκνούς λεζάντες. Κατά το χρόνο συμπερασμάτων, οι χρήστες συχνά πληκτρολογούν σύντομες, διφορούμενες προτροπές ή χειρονομούν προς μια εικόνα διάθεσης ή αναφοράς αντί να περιγράφουν μια σκηνή με ακρίβεια.

Για να κλείσει αυτό το χάσμα, το Krea 2 αποστέλλεται με δύο συστήματα. Η πρώτη είναι μια άμεση επέκταση, εκπαιδευμένη μέσω μιας εποπτευόμενης διοχέτευσης λεπτομέρειας και ενίσχυσης εκμάθησης δύο σταδίων πάνω από μοντέλα μεγάλων γλωσσών ανοιχτού κώδικα, η οποία αντιστοιχίζει απλές προτροπές σε πλουσιότερες οπτικές κατευθύνσεις χωρίς να αντικαθιστά την πρόθεση του χρήστη. Το δεύτερο είναι ένα σύστημα αναφοράς στυλ που επιτρέπει στους χρήστες να εισάγουν το στυλ ή τη διάθεση μιας ή περισσότερων εικόνων αναφοράς με ελάχιστη διαρροή περιεχομένου, προσφέροντας λεπτό έλεγχο της αντοχής του στυλ και τη σταθμισμένη μίξη.

Μαζί, αυτά τα στοιχεία επαναπροσδιορίζουν το Krea 2 ως διερευνητικό μέσο. Αντί να επιστρέφει μία μόνο απάντηση, το μοντέλο έχει σχεδιαστεί για να εκθέτει έναν χώρο δυνατοτήτων και να παρέχει στους χρήστες πρακτικούς τρόπους για να το μετακινήσουν χρησιμοποιώντας έλεγχο που βασίζεται τόσο σε κείμενο όσο και σε εικόνα.

Διατήρηση της γνώσης των πραγματικών οντοτήτων

Μια λεπτή αλλά σημαντική ικανότητα για κάθε δημιουργία εικόνων είναι η ικανότητα να αναπαριστά πιστά γνωστές οντότητες, άτομα, μέρη και αντικείμενα στα οποία οι χρήστες ενδέχεται να αναφέρουν απλώς ονομαστικά. Ο Krea ανησυχούσε ότι οι τυπικές μέθοδοι δειγματοληψίας θα μπορούσαν να ρίξουν κατά λάθος σπάνιες ή σημαντικές έννοιες κατά την επιμέλεια δεδομένων.

Για να αποφευχθεί αυτό, η ομάδα έτρεξε το PageRank μέσω της Αγγλικής Wikipedia, διατήρησε το κορυφαίο 90 τοις εκατό των άρθρων ανά κατάταξη, φιλτράρισε έννοιες που δεν μπορούν να απεικονιστούν με νόημα και, στη συνέχεια, επαλήθευσε την κάλυψη σε όλο το σύνολο των υποτίτλων της, δίνοντας προτεραιότητα στις εικόνες των οποίων οι λεζάντες παρέπεμπαν σε σπάνιες έννοιες. Η ομάδα επιβεβαίωσε εκ των υστέρων ότι καμία έννοια που υπήρχε στο αρχικό σύνολο δεδομένων δεν είχε αφαιρεθεί εντελώς από το τελικό δείγμα εκπαίδευσης.

Ένα ανταγωνιστικό ανοιχτό σύνορο για τεχνητή νοημοσύνη εικόνας

Η άφιξη του Krea 2 εντείνει ένα πολυσύχναστο τοπίο δημιουργίας εικόνων ανοιχτού βάρους. Η εταιρεία τοποθετεί το μοντέλο της ως "μεταξύ των κορυφαίων 10" στο leaderboard της Τεχνητής Ανάλυσης κειμένου σε εικόνα και "τη δεύτερη θέση μεταξύ μοντέλων από ανεξάρτητα εργαστήρια", ένας ισχυρισμός που, εάν ελέγχεται από την ευρύτερη κοινότητα, θα έκανε το K2 μία από τις ισχυρότερες ανοιχτά διαθέσιμες γεννήτριες εικόνας.

Η τεχνική έκθεση, η οποία περιλαμβάνει σχεδόν 12.000 λέξεις και περιγράφει τα πάντα, από τις αρχές επιμέλειας δεδομένων έως την κατανεμημένη υποδομή εκπαίδευσης, εξυπηρετεί επίσης έναν στρατηγικό σκοπό. Δημοσιεύοντας τη μεθοδολογία πίσω από ένα ανταγωνιστικό μοντέλο, η Krea προσκαλεί τον έλεγχο, την αναπαραγωγή και τη βελτίωση, το νόμισμα της αξιοπιστίας στην ανοιχτή ερευνητική κοινότητα.

Για τους δημιουργούς και τους προγραμματιστές, το αποτέλεσμα είναι ένα ικανό, ανοιχτά αδειοδοτημένο μοντέλο εικόνας που δίνει προτεραιότητα στο εύρος των δημιουργικών έναντι μιας μόνο ασφαλούς προεπιλογής. Με τα βάρη που είναι διαθέσιμα στο Hugging Face και τον κωδικό στο GitHub, το Krea 2 μειώνει το εμπόδιο για όποιον θέλει να δημιουργήσει, να βελτιώσει ή απλά να πειραματιστεί με μια υπερσύγχρονη συσκευή δημιουργίας εικόνας με τους δικούς του όρους.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →