Pasukan Qwen Alibaba mengeluarkan Qwen3.8-Flash-Next pada hari Rabu, model gabungan multimodal pakar yang berfungsi sebagai pratonton seni bina bagi Qwen4 yang akan datang — dan itu memberikan hasil yang dikatakan syarikat mengalahkan Qwen3.7-Plus yang lebih besar pada kira-kira satu per sembilan kos latihan. Reuters, Bloomberg dan The Decoder semuanya meliputi pelancaran, yang meletakkan pemberat terbuka pada Wajah Memeluk dan ModelScope pada hari yang sama Z.ai menghantar model terbuka bersebelahan sempadannya sendiri. Ikuti berita AI terbaharu semasa perlumbaan berat terbuka semakin pantas.
Seni bina baharu dalam bentuk mini
Spesifikasi tajuk adalah kecekapan. Qwen3.8-Flash-Next mempunyai 125 bilion jumlah parameter tetapi mengaktifkan hanya 6 bilion setiap token. Sebagai perbandingan, Qwen3.7-Plus — model yang mengatasi prestasi dalam penanda aras yang diterbitkan Alibaba — mempunyai 397 bilion jumlah parameter dengan 17 bilion diaktifkan setiap token, hampir tiga kali kiraan aktif Flash-Next.
Sekeping yang paling menarik dari segi teknikal ialah lapisan pembenaman N-gram novel yang membawa 51 bilion parameter. Lapisan ini menyimpan kumpulan perkataan biasa sebagai entri kendiri dalam apa yang diterangkan oleh The Decoder's Matthias Bastian sebagai sejenis "kamus frasa", menyuap maklumat peringkat frasa ke dalam permulaan rangkaian. Yang penting, ia terletak dalam RAM sistem biasa dan bukannya dalam memori GPU yang mahal, pada apa yang pasukan Qwen panggil sebagai kos tambahan yang agak rendah — satu inovasi seni bina yang dijadualkan untuk dibawa ke dalam Qwen4.
Model ini secara asli menyokong tetingkap konteks 262,144 token dan menskalakan kepada satu juta token menggunakan sambungan konteks panjang YaRN. Laporan teknikal diterbitkan di GitHub.
Penanda aras: pengekodan dan kerja pejabat
Penanda aras Alibaba menyaingi Flash-Next dengan DeepSeek-V4-Flash (284 bilion parameter, 13 bilion aktif) dan Anthropic's Claude Opus 4.6 (Max). Walaupun kedua-dua saingan itu jauh lebih besar atau lebih mahal, Flash-Next mendahului dalam kebanyakan tugasan yang diuji, dengan keuntungan terbesar dalam pengekodan dan produktiviti pejabat.
Mengenai pengekodan agen, Flash-Next mendapat 58.7 pada DeepSWE 1.1 dan 62.5 pada SWE-bench Pro, mengatasi kedua-dua DeepSeek-V4-Flash dan Claude Opus 4.6. Jurang pada tugas pejabat masih lebih luas: 73.9 pada CoWorkBench berbanding 45.1 untuk DeepSeek-V4-Flash, dan 55.7 pada JobBench — hampir dua kali ganda Qwen3.7-Plus 27.6. Penaakulan saintifik dipadankan rapat di seluruh bidang, dengan Flash-Next pada 91.7 pada GPQA Diamond dan 91.9 pada LiveCodeBench v6. Claude Opus 4.6 hanya muncul lebih awal pada Peperiksaan Terakhir Kemanusiaan, 40.0 hingga 35.9, dan ia adalah model Anthropic yang lebih lama dari Februari 2026. Seperti biasa, skor penanda aras yang diterbitkan dan prestasi dunia sebenar mungkin berbeza.
Tekanan harga pada setiap saingan
Versi pengeluaran dihantar sebagai Qwen3.8-Flash melalui QwenCloud, berharga $0.16 setiap juta token input dan $0.47 setiap juta token keluaran. Itu mengurangkan walaupun GLM-5.3-Flash Z.ai, dikeluarkan pada hari yang sama masing-masing pada $0.15 dan $0.50 — secara berkesan pariti di bahagian bawah pasaran.
Jurang kepada perdana Alibaba sendiri adalah ketara. Qwen3.8-Max, yang diperkenalkan pada awal Ogos untuk bersaing dengan Claude Opus 4.8, Gemini 3.1 Pro, dan GPT-5.6 Sol, berharga $2.00 setiap juta token input dan $6.00 setiap juta token output. Flash-Next berprestasi tepat di bawah perdana, mengikut nombor Alibaba sendiri, pada kira-kira satu perdua belas harga pada kedua-dua input dan output.
Konteks yang panjang menambah nilai praktikal di luar helaian spesifikasi. Pada 262,144 token asli, satu permintaan boleh menyimpan beberapa repositori kod besar, set kontrak penuh atau jam mesyuarat yang ditranskripsikan; diperluaskan kepada satu juta token dengan YaRN, analisis seluruh korpus menjadi boleh dilaksanakan tanpa perancah mendapatkan semula. Untuk beban kerja pengekodan ejen di mana Flash-Next menyiarkan skor terkuatnya — mencari dan membetulkan pepijat secara bebas dalam projek perisian sebenar — tetingkap besar bermakna lebih sedikit kegagalan pengurusan konteks pada pertengahan tugas. Pasukan Qwen juga telah menerbitkan laporan teknikal di GitHub, mengundang jenis penelitian seni bina bebas yang dielakkan oleh makmal proprietari.
Mengapa keluaran ini penting
Qwen3.8-Flash-Next paling baik difahami sebagai latihan pakaian awam untuk Qwen4. Lapisan pembenaman N-gram, nisbah parameter aktif yang agresif dan pemuatan RAM bagi parameter besar-tetapi-jarang-diperlukan melakar falsafah reka bentuk: gerakkan kecerdasan setiap dolar, bukan kecerdasan setiap GPU. Melatih model Qwen3.7-Plus-beating untuk satu per sembilan kos adalah tepat keupayaan yang menjadikan kitaran lelaran pantas mampu milik — dan kelajuan lelaran, lebih daripada mana-mana penanda aras tunggal, adalah yang menentukan siapa yang berdiri di sempadan setahun dari sekarang.
Ketibaan pada hari yang sama dua model berat terbuka bersebelahan sempadan dari makmal China — GLM-5.3-Flash Z.ai dan Flash-Next Alibaba — juga menandakan anjakan irama, seperti yang diperhatikan oleh FourWeekMBA. Makmal Barat masih memegang puncak penanda aras, tetapi peringkat berat terbuka kini menghantar kualiti hampir sempadan setiap minggu, pada harga yang lebih rendah.
Bagi pembangun, pengambilan praktikal adalah mudah: kos model multimodal yang berkebolehan, konteks panjang, jatuh semula, dengan pemberat boleh dimuat turun sebagai insurans terhadap mana-mana pembekal tunggal. Bagi pesaing, mesejnya kurang selesa — sempadan kecekapan kini bergerak lebih pantas daripada harga perdana yang boleh diikuti secara realistik, dan Alibaba tidak menunjukkan tanda-tanda akan perlahan.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →