Tim Qwen Alibaba telah merilis Qwen-Image-2.1, model open-weight baru untuk pembuatan dan pengeditan gambar yang menurut perusahaan jauh melebihi ukurannya. Menurut tim Qwen, komponen pembuatan visual model ini hanya berisi 7 miliar parameter, namun komponen ini mengalahkan sebagian besar model tertutup pada tolok ukur internal Qwen sendiri — sebuah klaim yang, jika dievaluasi secara independen, akan menandai perubahan besar dalam keseimbangan antara pembuatan gambar terbuka dan kepemilikan.
Model 7 Miliar Parameter Dengan Ambisi Unggulan
Klaim utama dari Alibaba sangat mengejutkan: komponen generasi visual yang hanya memiliki 7 miliar parameter mengungguli sebagian besar model tertutup. Perlu ditekankan peringatan yang menyertainya — perbandingan tersebut berasal dari tolok ukur Qwen sendiri, dan hasil tolok ukur independen masih menunggu keputusan. Publikasi teknologi The Decoder, yang meliput rilis ini, mencatat perbedaan ini secara langsung, dan komunitas sumber terbuka di Hacker News, tempat peluncuran tersebut menarik ratusan suara positif dalam beberapa jam, juga diukur dengan cara yang sama dalam reaksi awalnya.
Yang tidak perlu dipersoalkan adalah efisiensi sistem. Qwen-Image-2.1 dirancang untuk berjalan pada perangkat keras konsumen yang mumpuni, termasuk GPU yang dapat diakses seperti NVIDIA RTX 3090. Bagi pembuat dan pengembang yang telah menyaksikan model gambar terdepan tertinggal di belakang API dan infrastruktur pusat data, model yang dapat menghasilkan dan mengedit gambar secara lokal pada kartu konsumen berusia tiga tahun merupakan pengembangan yang berarti.
Gambar Transparan dan Komposisi Multi Referensi
Di luar kualitas generasi mentah, Qwen-Image-2.1 memperkenalkan kemampuan yang menurut tim Qwen merupakan kemampuan asli model tersebut dan tidak langsung diterapkan setelahnya. Yang paling menarik perhatian adalah dukungan asli untuk RGBA — gambar dengan latar belakang transparan — baik dalam pembuatan maupun pengeditan. Pengguna dapat mengisolasi objek dari latar belakangnya atau mengubah teks pada lapisan transparan tanpa harus bolak-balik menggunakan alat penghapus latar belakang yang terpisah.
Model ini juga menangani hingga sepuluh gambar referensi dalam satu pekerjaan. Menurut Qwen, hal ini memungkinkan alur kerja seperti menyusun potret grup dari foto individu setiap orang, mendukung pengalaman uji coba virtual, atau mendesain ulang ruangan dengan menggabungkan beberapa foto interior sebagai referensi.
Untuk pengeditan lokal, tim telah menerapkan kontrol yang dipandu wilayah: pengguna dapat menggambar lingkaran, topeng, atau tanda cat di area gambar untuk menunjukkan di mana perubahan harus diterapkan. Hal ini menempatkan instruksi pengeditan dalam bentuk visual daripada hanya mengandalkan petunjuk teks untuk menggambarkan perubahan spasial.
Perubahan Arsitektur dan Inferensi Lebih Cepat
Peningkatan kinerja di Qwen-Image-2.1 berasal dari perubahan arsitektur dan penggunaan kembali cache KV, menurut tim Qwen. Pendekatan caching dikatakan mempercepat inferensi secara nyata, khususnya dalam alur kerja yang melibatkan banyak gambar referensi, dimana pendekatan sebelumnya akan menghitung ulang sejumlah besar pekerjaan pada setiap generasi.
Bagi pengguna praktis, inferensi yang lebih cepat pada perangkat keras konsumen menambah cerita aksesibilitas: siklus iterasi yang lebih cepat membuat pembuatan gambar lokal dapat dilakukan untuk pekerjaan produksi nyata dibandingkan eksperimen sesekali.
Dimana Mendapatkannya — dan Hasil Lisensinya
Qwen-Image-2.1 tersedia untuk diunduh di Hugging Face, GitHub, dan Model Scope, dan tim telah menerbitkan demo di Hugging Face untuk pengguna yang ingin mencoba model tersebut sebelum mengunduhnya.
Namun, ada keuntungan penting bagi pengguna komersial. Model ini dikirimkan di bawah lisensi penelitian yang secara eksplisit melarang penggunaan komersial. Bisnis yang ingin membangun Qwen-Image-2.1 harus mengajukan permohonan ke Qwen untuk mendapatkan lisensi terpisah. Hal ini mencerminkan pendekatan yang diambil Alibaba dengan beberapa rilis Qwen sebelumnya, di mana bobot tersedia secara gratis untuk penelitian dan evaluasi, namun penerapan yang menghasilkan pendapatan memerlukan pengaturan langsung dengan perusahaan.
Bagi pencipta individu, peneliti, dan penghobi, efek praktisnya sederhana: unduh, jalankan secara lokal, bereksperimen dengan bebas. Bagi startup yang ingin membangun produk berdasarkan model tersebut, persyaratan lisensi berarti pembicaraan dengan Alibaba adalah prioritas utama.
Apa Artinya bagi Balapan Kelas Terbuka
Peluncuran ini dilakukan pada saat laboratorium AI di Tiongkok bersaing secara agresif dalam hal efisiensi open-weight, dengan merilis model-model yang mengklaim kualitas mendekati batas dengan jumlah parameter dan biaya perangkat keras yang lebih rendah dibandingkan kompetitor tertutup mereka. Model gambar yang diklaim dapat menyaingi sistem tertutup sekaligus cocok dengan GPU konsumen adalah generasi visual yang setara dengan strategi yang lebih luas tersebut.
Apakah Qwen-Image-2.1 benar-benar cocok dengan pemimpin tertutup akan bergantung pada tolok ukur independen, yang belum dipublikasikan. Pengujian awal komunitas, evaluasi pihak ketiga, dan perbandingan pada platform seperti Hugging Face akan menyelesaikan pertanyaan ini dalam beberapa minggu mendatang. Sampai saat itu, klaim tersebut tetap menjadi milik tim – tetapi modelnya sendiri saat ini tersedia bagi siapa saja yang memiliki perangkat keras dan rasa ingin tahu untuk mengujinya.
Bagi pembaca yang menelusuri persaingan yang lebih luas antara sistem AI terbuka dan tertutup, rilis ini merupakan satu lagi titik data dalam bidang yang bergerak cepat, yang diliput bersamaan dengan berita AI terkini seiring perkembangannya.
Tetap Terdepan dalam AI
Lanskap AI bergerak cepat, dan pembuatan gambar adalah salah satu aspek yang paling kompetitif. Ikuti terus di AI Buzz Wire untuk liputan berkelanjutan mengenai rilis model, tolok ukur, dan keputusan bisnis di baliknya.
Baca berita AI selengkapnya →