Krea, sebuah permulaan membina alatan AI kreatif, telah mengeluarkan Krea 2 (K2), sebuah keluarga model asas teks-ke-imej berwajaran terbuka yang menurut syarikat itu berada dalam kedudukan antara 10 penjana imej teratas pada papan pendahulu Analisis Buatan dan kedua dalam kalangan model daripada makmal bebas. Keluaran itu, diperincikan dalam laporan teknikal yang diterbitkan pada 23 Jun 2026, dihantar dengan dua pusat pemeriksaan model dan lesen permisif yang menjemput komuniti untuk memperhalusi dan membina di atasnya.

Tidak seperti kebanyakan model imej terbaharu yang mengoptimumkan untuk keluaran lalai tunggal yang digilap, Krea mereka bentuk Krea 2 berdasarkan idea penerokaan kreatif, mendedahkan pengedaran visual yang luas yang boleh dinavigasi pengguna dan bukannya memaksa satu estetika sempit. For more context on this story, see our ongoing more AI stories.

Dua Pusat Pemeriksaan untuk Keperluan Berbeza

Keluaran Krea 2 termasuk dua pusat pemeriksaan yang berbeza. Yang pertama, K2 Raw, ialah model asas yang tidak didiamkan bertujuan untuk menyempurnakan dan penyelidikan selepas latihan, memberikan pemaju asas yang bersih untuk menyesuaikan diri. Yang kedua, K2 Turbo, ialah model suling panduan dan langkah masa yang direka bentuk untuk penjanaan pantas, beberapa langkah, jenis lelaran pantas yang dituntut oleh aliran kerja kreatif.

Menawarkan kedua-dua asas mesra penyelidikan dan varian yang dioptimumkan kelajuan mencerminkan perpecahan pragmatik. Penyelidik dan pemerhati mendapat model mentah untuk bereksperimen, manakala pengguna pengeluaran mendapat pusat pemeriksaan yang lebih pantas yang tidak mengorbankan kualiti demi kelajuan.

Sikap Sengaja Terhadap Data Latihan Dijana AI

Salah satu dakwaan paling ketara dalam laporan teknikal Krea berkenaan data latihan. Pasukan itu menyatakan bahawa ia tidak menggunakan imej yang dijana AI dalam campuran pralatihannya. Walaupun data sintetik dan penyulingan telah menjadi jalan pintas popular untuk memperoleh keupayaan model, Krea mendapati bahawa walaupun sebahagian kecil imej yang dijana AI memperkenalkan bias ke dalam pengedaran output model.

Alasannya adalah mudah: imej sintetik cenderung lebih mudah untuk dipelajari oleh model, yang secara berkesan mengenakan siling tiruan pada kualiti. Untuk menguatkuasakan dasar, Krea membina pengelas dalaman khusus untuk menapis imej yang dijana AI daripada set datanya, dan bukannya bergantung pada penapis luar biasa.

Syarikat itu juga mengambil pandangan yang bertentangan tentang kualiti data. Daripada menapis secara agresif untuk skor estetik yang tinggi, yang boleh mengalih keluar imej yang kabur, berbintik atau tidak konvensional yang mewakili pilihan artistik yang sah, Krea berhujah untuk kepelbagaian dan liputan domain yang luas. Hasilnya, katanya, adalah model dengan julat ekspresif yang lebih luas daripada sistem yang dilatih hanya pada imej yang cantik secara konvensional.

Senibina dan Saluran Paip Latihan

Krea 2 dibina di atas seni bina transformer yang reka bentuk terakhirnya dipilih melalui kajian ablasi meluas yang didokumenkan dalam laporan. Selepas menguji alternatif, pasukan menyelesaikan perhatian pertanyaan berkumpulan (GQA) dengan perhatian sigmoid berpagar, SwiGLU MLP dan Qwen 3 VL sebagai pengekod teksnya. Pengekodan kedudukan menggunakan benam putar paksi 3D, dan pengekod automatik menggabungkan Qwen Image VAE dan FLUX 2 AE.

Latihan mengikut kurikulum pelbagai peringkat. Pralatihan berjalan melalui peringkat resolusi 256px, 512px dan 1024px, menumpukan sebahagian besar pengiraan kepada kerja resolusi rendah untuk membina keupayaan teras dengan cekap sebelum menajamkan penjanaan kesetiaan tinggi pada peleraian yang lebih tinggi. Peringkat pertengahan latihan kemudian merapatkan pengedaran pralatihan yang luas dan pengedaran penalaan halus terkawal berkualiti tinggi menggunakan pengelompokan semantik dan strategi berasaskan perolehan untuk mengekalkan liputan konsep jarang dan panjang.

Menjadikan Generasi Penerokaan dan Boleh Dikendali

Krea mengenal pasti jurang yang berterusan antara cara model dilatih dan cara pengguna sebenarnya menyatakan niat. Semasa latihan, model belajar daripada kapsyen yang kaya dan padat. Pada masa inferens, pengguna sering menaip gesaan pendek, samar-samar, atau gerak isyarat ke arah mood atau imej rujukan daripada menerangkan adegan dengan tepat.

Untuk menutup jurang itu, Krea 2 dihantar dengan dua sistem. Yang pertama ialah pengembang segera, dilatih melalui saluran pembelajaran penalaan halus dan pengukuhan yang diselia dua peringkat di atas model bahasa besar sumber terbuka, yang memetakan gesaan mudah ke arah visual yang lebih kaya tanpa menimpa niat pengguna. Yang kedua ialah sistem rujukan gaya yang membolehkan pengguna menyuntik gaya atau mood satu atau lebih imej rujukan dengan kebocoran kandungan minimum, menawarkan kawalan terperinci ke atas kekuatan gaya dan percampuran berwajaran.

Bersama-sama, komponen ini mentakrifkan semula Krea 2 sebagai medium penerokaan. Daripada mengembalikan satu jawapan, model ini direka bentuk untuk mendedahkan ruang kemungkinan dan memberi pengguna cara praktikal untuk bergerak melaluinya menggunakan kedua-dua kawalan berasaskan teks dan imej.

Memelihara Pengetahuan Entiti Sebenar

Keupayaan halus tetapi penting untuk mana-mana penjana imej ialah keupayaan untuk mewakili entiti, orang, tempat dan objek yang diketahui dengan tepat yang mungkin dirujuk oleh pengguna hanya dengan nama. Krea bimbang kaedah pensampelan standard secara tidak sengaja boleh menjatuhkan konsep yang jarang berlaku atau penting semasa penyusunan data.

Untuk mengelakkan ini, pasukan menjalankan PageRank di atas Wikipedia Bahasa Inggeris, mengekalkan 90 peratus artikel teratas mengikut kedudukan, menapis konsep yang tidak dapat digambarkan dengan bermakna, dan kemudian mengesahkan liputan merentas set data kapsyennya, mengutamakan imej yang kapsyennya merujuk kepada konsep yang jarang ditemui. Pasukan mengesahkan selepas itu bahawa tiada konsep yang terdapat dalam set data awal telah digugurkan sepenuhnya daripada sampel latihan akhir.

Sempadan Terbuka Berdaya saing untuk AI Imej

Ketibaan Krea 2 memperhebatkan landskap penjanaan imej berat terbuka yang sesak. Syarikat itu meletakkan modelnya sebagai "antara 10 teratas" pada papan pendahulu teks-ke-imej Analisis Buatan dan "tempat kedua dalam kalangan model daripada makmal bebas," dakwaan bahawa, jika ia berada di bawah pengawasan komuniti yang lebih luas, akan menjadikan K2 sebagai salah satu penjana imej yang tersedia secara terbuka yang paling kuat.

Laporan teknikal itu, yang mengandungi hampir 12,000 perkataan dan memperincikan segala-galanya daripada prinsip penyusunan data kepada infrastruktur latihan teragih, juga berfungsi untuk tujuan strategik. Dengan menerbitkan metodologi di sebalik model kompetitif, Krea mengundang penelitian, pengeluaran semula dan penambahbaikan, mata wang kredibiliti dalam komuniti penyelidikan terbuka.

Bagi pencipta dan pembangun, hasilnya ialah model imej berlesen yang berkebolehan secara terbuka yang mengutamakan julat kreatif berbanding lalai selamat tunggal. Dengan pemberat yang tersedia pada Wajah Memeluk dan kod pada GitHub, Krea 2 mengurangkan halangan untuk sesiapa sahaja yang ingin membina, memperhalusi atau sekadar bereksperimen dengan penjana imej tercanggih mengikut syarat mereka sendiri.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →