Pasukan Qwen Alibaba telah mengeluarkan Qwen-Image-2.1, model berat terbuka baharu untuk penjanaan dan penyuntingan imej yang dikatakan syarikat itu melebihi saiznya. Menurut pasukan Qwen, komponen penjanaan visual model mengandungi hanya 7 bilion parameter, namun ia mengalahkan kebanyakan model tertutup pada penanda aras dalaman Qwen sendiri — dakwaan bahawa, jika ia bertahan di bawah penilaian bebas, akan menandakan perubahan ketara dalam keseimbangan antara penjanaan imej terbuka dan proprietari.

Model Parameter 7 Bilion Dengan Cita-cita Utama

Tuntutan tajuk dari Alibaba sangat menarik: komponen penjanaan visual hanya 7 bilion parameter mengatasi kebanyakan model tertutup. Perlu ditekankan kaveat yang mengiringinya — perbandingan datang daripada penanda aras Qwen sendiri, dan keputusan penanda aras bebas masih belum selesai. Penerbitan teknologi The Decoder, yang meliputi keluaran, menyatakan perbezaan ini secara langsung, dan komuniti sumber terbuka di Hacker News, di mana pelancaran itu menarik ratusan undian naik dalam beberapa jam, telah diukur dengan sama dalam reaksi awalnya.

Apa yang tidak dipertikaikan ialah kecekapan sistem. Qwen-Image-2.1 direka bentuk untuk dijalankan pada perkakasan pengguna yang berkebolehan, termasuk GPU yang boleh diakses seperti NVIDIA RTX 3090. Bagi pencipta dan pembangun yang telah melihat model imej sempadan hanyut di belakang API dan infrastruktur pusat data, model yang boleh menjana dan mengedit imej secara setempat pada kad pengguna berusia tiga tahun merupakan perkembangan yang bermakna dengan sendirinya.

Imej Lutsinar dan Komposisi Berbilang Rujukan

Di luar kualiti penjanaan mentah, Qwen-Image-2.1 memperkenalkan keupayaan yang dikatakan oleh pasukan Qwen adalah asli kepada model itu dan bukannya disambungkan selepas itu. Yang paling menarik perhatian ini ialah sokongan asli untuk RGBA — imej dengan latar belakang telus — dalam kedua-dua penjanaan dan penyuntingan. Pengguna boleh mengasingkan objek daripada latar belakang mereka atau menukar teks pada lapisan lutsinar tanpa pergi balik melalui alat penyingkiran latar belakang yang berasingan.

Model ini juga mengendalikan sehingga sepuluh imej rujukan dalam satu kerja. Menurut Qwen, ini membolehkan aliran kerja seperti memasang potret kumpulan daripada foto individu setiap orang, menghidupkan pengalaman mencuba maya atau mereka bentuk semula bilik dengan menggabungkan berbilang foto dalaman sebagai rujukan.

Untuk suntingan setempat, pasukan telah melaksanakan kawalan berpandukan wilayah: pengguna boleh melukis bulatan, topeng atau tanda yang dilukis di atas kawasan imej untuk menunjukkan tempat perubahan harus digunakan. Ini meletakkan arahan pengeditan dalam bentuk visual dan bukannya bergantung semata-mata pada gesaan teks untuk menerangkan perubahan spatial.

Perubahan Seni Bina dan Inferens Lebih Pantas

Peningkatan prestasi dalam Qwen-Image-2.1 datang daripada perubahan seni bina dan daripada penggunaan semula cache KV, menurut pasukan Qwen. Pendekatan caching dikatakan mempercepatkan inferens dengan ketara, terutamanya dalam aliran kerja yang melibatkan berbilang imej rujukan, di mana pendekatan sebelumnya akan mengira semula sejumlah besar kerja pada setiap generasi.

Bagi pengguna praktikal, inferens yang lebih pantas pada perkakasan pengguna menggabungkan cerita kebolehaksesan: kitaran lelaran yang lebih cepat menjadikan penjanaan imej tempatan berdaya maju untuk kerja pengeluaran sebenar dan bukannya percubaan sekali-sekala.

Tempat Mendapatkannya — dan Tangkapan Pelesenan

Qwen-Image-2.1 tersedia untuk dimuat turun pada Muka Memeluk, GitHub dan Skop Model, dan pasukan itu telah menerbitkan demo pada Wajah Memeluk untuk pengguna yang ingin mencuba model sebelum memuat turunnya.

Walau bagaimanapun, terdapat tangkapan penting untuk pengguna komersial. Model ini dihantar di bawah lesen penyelidikan yang secara eksplisit menghalang penggunaan komersial. Perniagaan yang ingin membina Qwen-Image-2.1 mesti memohon kepada Qwen untuk mendapatkan lesen berasingan. Ini mencerminkan pendekatan yang diambil Alibaba dengan beberapa keluaran Qwen sebelum ini, di mana pemberat tersedia secara bebas untuk penyelidikan dan penilaian, tetapi penggunaan yang menjana hasil memerlukan pengaturan terus dengan syarikat.

Bagi pencipta, penyelidik dan penggemar individu, kesan praktikal adalah mudah: muat turun, jalankan secara tempatan, percubaan secara bebas. Bagi pemula yang berharap untuk membina produk di atas model, syarat lesen bermakna perbualan dengan Alibaba diutamakan.

Maksudnya untuk Perlumbaan Berat Terbuka

Keluaran itu tiba pada masa apabila makmal AI China secara agresif bersaing dalam kecekapan berat terbuka, mengeluarkan model yang menuntut kualiti berhampiran sempadan pada sebahagian kecil daripada kiraan parameter dan kos perkakasan pesaing tertutup mereka. Model imej yang mendakwa menyaingi sistem tertutup semasa dipasang pada GPU pengguna ialah rakan penjanaan visual kepada strategi yang lebih luas itu.

Sama ada Qwen-Image-2.1 benar-benar sepadan dengan pemimpin tertutup akan bergantung pada penanda aras bebas, yang masih belum diterbitkan. Ujian komuniti awal, penilaian pihak ketiga dan perbandingan pada platform seperti Hugging Face akan menyelesaikan persoalan dalam beberapa minggu akan datang. Sehingga itu, tuntutan itu kekal milik pasukan — tetapi model itu sendiri tersedia hari ini untuk sesiapa sahaja yang mempunyai perkakasan dan rasa ingin tahu untuk mengujinya.

Bagi pembaca yang menjejaki persaingan yang lebih luas antara sistem AI terbuka dan tertutup, keluaran ini merupakan satu lagi titik data dalam medan yang bergerak pantas, diliputi bersama berita AI terkini semasa ia berkembang.

Kekal Mendahului AI

Landskap AI bergerak pantas, dan penjanaan imej adalah salah satu sudut yang paling kompetitif. Ikuti bersama di AI Buzz Wire untuk liputan berterusan keluaran model, penanda aras dan keputusan perniagaan di belakangnya.

Baca lebih banyak berita AI →