Tim Qwen Alibaba merilis Qwen3.8-Flash-Next pada hari Rabu, model gabungan multimodal yang berfungsi ganda sebagai pratinjau arsitektur Qwen4 yang akan datang — dan memberikan hasil yang menurut perusahaan mengalahkan Qwen3.7-Plus yang jauh lebih besar dengan biaya sekitar sepersembilan biaya pelatihan. Reuters, Bloomberg, dan The Decoder semuanya meliput peluncuran tersebut, yang memberikan bobot terbuka pada Hugging Face dan ModelScope pada hari yang sama ketika Z.ai mengirimkan model terbukanya yang berdekatan dengan perbatasan. Ikuti berita AI terkini seiring dengan semakin cepatnya perlombaan kelas terbuka.

Arsitektur baru dalam bentuk mini

Spesifikasi utamanya adalah efisiensi. Qwen3.8-Flash-Next memiliki total 125 miliar parameter tetapi hanya mengaktifkan 6 miliar per token. Sebagai perbandingan, Qwen3.7-Plus – model yang kinerjanya lebih unggul dalam benchmark yang dipublikasikan Alibaba – memiliki total 397 miliar parameter dengan 17 miliar yang diaktifkan per token, hampir tiga kali lipat jumlah aktif Flash-Next.

Bagian yang paling menarik secara teknis adalah lapisan penyematan N-gram baru yang membawa 51 miliar parameter. Lapisan ini menyimpan kelompok kata umum sebagai entri yang berdiri sendiri dalam apa yang digambarkan oleh Matthias Bastian dari The Decoder sebagai semacam "kamus frasa", yang memasukkan informasi tingkat frasa ke dalam awal jaringan. Yang terpenting, ia ditempatkan pada RAM sistem biasa, bukan pada memori GPU yang mahal, yang oleh tim Qwen disebut sebagai biaya tambahan yang relatif rendah — sebuah inovasi arsitektur yang dijadwalkan untuk diterapkan pada Qwen4.

Model ini secara asli mendukung jendela konteks 262.144 token dan menskalakan hingga satu juta token menggunakan ekstensi konteks panjang YaRN. Laporan teknis dipublikasikan di GitHub.

Tolok ukur: coding dan pekerjaan kantor

Tolok ukur Alibaba mengadu Flash-Next dengan DeepSeek-V4-Flash (284 miliar parameter, 13 miliar aktif) dan Claude Opus 4.6 (Max) dari Anthropic. Meskipun kedua pesaingnya jauh lebih besar dan lebih mahal, Flash-Next memimpin sebagian besar tugas yang diuji, dengan peningkatan terbesar dalam pengkodean dan produktivitas kantor.

Pada pengkodean agen, Flash-Next mencetak skor 58,7 pada DeepSWE 1.1 dan 62,5 pada SWE-bench Pro, mengalahkan DeepSeek-V4-Flash dan Claude Opus 4.6. Kesenjangan dalam tugas kantor masih lebih besar: 73,9 pada CoWorkBench dibandingkan 45,1 pada DeepSeek-V4-Flash, dan 55,7 pada JobBench — hampir dua kali lipat dibandingkan Qwen3.7-Plus yaitu 27,6. Penalaran ilmiah sangat cocok di seluruh bidang, dengan Flash-Next pada 91,7 pada GPQA Diamond dan 91,9 pada LiveCodeBench v6. Claude Opus 4.6 hanya unggul pada Ujian Terakhir Kemanusiaan, 40,0 hingga 35,9, dan merupakan model Antropik lama mulai Februari 2026. Seperti biasa, skor benchmark yang dipublikasikan dan performa di dunia nyata dapat berbeda.

Tekanan harga pada setiap pesaing

Versi produksi dikirimkan sebagai Qwen3.8-Flash melalui QwenCloud, dengan harga $0,16 per juta token masukan dan $0,47 per juta token keluaran. Hal ini bahkan melemahkan GLM-5.3-Flash milik Z.ai, yang dirilis pada hari yang sama dengan harga masing-masing $0,15 dan $0,50 — secara efektif setara di bagian bawah pasar.

Kesenjangan dengan produk andalan Alibaba sangat mencolok. Qwen3.8-Max, diperkenalkan pada awal Agustus untuk bersaing dengan Claude Opus 4.8, Gemini 3.1 Pro, dan GPT-5.6 Sol, berharga $2,00 per juta token masukan dan $6,00 per juta token keluaran. Flash-Next berkinerja tepat di bawah produk andalan, menurut angka Alibaba sendiri, dengan harga sekitar seperdua belas dari harga input dan output.

Konteks yang panjang menambah nilai praktis di luar lembar spesifikasi. Dengan 262.144 token asli, satu permintaan dapat menampung beberapa repositori kode besar, satu set kontrak lengkap, atau jam pertemuan yang ditranskripsikan; diperluas hingga satu juta token dengan YaRN, analisis seluruh korpus menjadi mungkin dilakukan tanpa perancah pengambilan. Untuk beban kerja pengkodean agen di mana Flash-Next memposting skor terkuatnya — secara mandiri menemukan dan memperbaiki bug dalam proyek perangkat lunak nyata — jendela besar berarti lebih sedikit kegagalan manajemen konteks di tengah tugas. Tim Qwen juga telah menerbitkan laporan teknis di GitHub, mengundang jenis pengawasan arsitektur independen yang dihindari oleh laboratorium berpemilik.

Mengapa rilis ini penting

Qwen3.8-Flash-Next paling baik dipahami sebagai gladi bersih publik untuk Qwen4. Lapisan penyematan N-gram, rasio parameter aktif yang agresif, dan pembongkaran RAM dari parameter besar namun jarang dibutuhkan menggambarkan filosofi desain: gerakkan kecerdasan per dolar, bukan kecerdasan per GPU. Melatih model yang mengalahkan Qwen3.7-Plus dengan biaya sepersembilan adalah kemampuan yang membuat siklus iterasi cepat menjadi terjangkau — dan kecepatan iterasi, lebih dari tolok ukur apa pun, adalah hal yang menentukan siapa yang akan berdiri di garis depan dalam satu tahun dari sekarang.

Kedatangan dua model open-weight yang berdekatan di hari yang sama dari laboratorium Tiongkok – GLM-5.3-Flash dari Z.ai dan Flash-Next dari Alibaba – juga menandai perubahan irama, seperti yang diamati oleh FourWeekMBA. Laboratorium di negara-negara Barat masih mempertahankan nilai tertinggi dalam benchmark, namun tingkat bobot terbuka kini menghasilkan kualitas mendekati batas tertinggi setiap minggunya, dengan harga yang jauh lebih rendah.

Bagi para pengembang, hal praktis yang dapat diambil sangatlah sederhana: biaya model multimoda yang mumpuni dan memiliki konteks yang panjang kembali turun, dengan bobot yang dapat diunduh sebagai jaminan terhadap penyedia tunggal mana pun. Bagi para pesaing, pesan yang disampaikan kurang mengenakkan – batas efisiensi kini bergerak lebih cepat dibandingkan dengan harga produk unggulan, dan Alibaba tidak menunjukkan tanda-tanda akan melambat.

---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →