Tim Qwen Alibaba dirilis Qwen3.8-Flash-Next ana, model campuran multimodal-of-ahli sing ganda minangka pratinjau arsitektur saka Qwen4 mbesuk - lan sing ngirim asil perusahaan ngandika ngalahake Qwen3.7-Plus sing luwih gedhe ing kira-kira sanga saka biaya latihan. Reuters, Bloomberg, lan The Decoder kabeh nutupi peluncuran kasebut, sing menehi bobot mbukak ing Hugging Face lan ModelScope ing dina sing padha Z.ai ngirim model terbuka sing cedhak karo perbatasan. Tindakake breaking AI news amarga balapan bobot mbukak nyepetake.
Arsitektur anyar ing miniatur
Spesifikasi judhul yaiku efisiensi. Qwen3.8-Flash-Next nduweni 125 milyar parameter total nanging mung ngaktifake 6 milyar saben token. Kanggo comparison, Qwen3.7-Plus - model kang outperforms ing benchmarks diterbitake Alibaba - wis 397 milyar paramèter total karo 17 milyar diaktifake saben token, meh kaping telu Flash-Next count aktif.
Potongan sing paling menarik kanthi teknis yaiku lapisan semat N-gram sing ngemot 51 milyar parameter. Lapisan kasebut nyimpen klompok tembung umum minangka entri mandiri ing apa sing diterangake dening The Decoder's Matthias Bastian minangka "kamus frase," menehi informasi tingkat frase menyang wiwitan jaringan. Sing penting, ana ing RAM sistem reguler tinimbang ing memori GPU sing larang, sing diarani tim Qwen kanthi biaya tambahan sing relatif murah - inovasi arsitektur sing bakal ditindakake ing Qwen4.
Model asli ndhukung jendhela konteks 262.144-token lan timbangan dadi siji yuta token nggunakake ekstensi konteks dawa YaRN. Laporan teknis diterbitake ing GitHub.
Tolok ukur: coding lan karya kantor
Tolok ukur Alibaba pit Flash-Next nglawan DeepSeek-V4-Flash (284 milyar parameter, 13 milyar aktif) lan Anthropic's Claude Opus 4.6 (Max). Sanajan saingan loro kasebut luwih gedhe utawa luwih larang, Flash-Next mimpin ing mayoritas tugas sing diuji, kanthi asil paling gedhe ing coding lan produktivitas kantor.
Ing coding agen, Flash-Next ngetung 58.7 ing DeepSWE 1.1 lan 62.5 ing SWE-bench Pro, ngalahake DeepSeek-V4-Flash lan Claude Opus 4.6. Longkangan ing tugas kantor isih luwih akeh: 73,9 ing CoWorkBench nglawan 45,1 kanggo DeepSeek-V4-Flash, lan 55,7 ing JobBench - meh pindho Qwen3.7-Plus kang 27.6. Penalaran ilmiah cocog banget ing lapangan, kanthi Flash-Next ing 91.7 ing GPQA Diamond lan 91.9 ing LiveCodeBench v6. Claude Opus 4.6 mung metu ing Ujian Terakhir Kemanusiaan, 40.0 nganti 35.9, lan minangka model Anthropic sing luwih lawas wiwit Februari 2026. Kaya biasane, skor benchmark sing diterbitake lan kinerja ing donya nyata bisa beda-beda.
Tekanan rega ing saben saingan
Versi produksi dikirim minangka Qwen3.8-Flash liwat QwenCloud, regane $ 0,16 saben yuta token input lan $ 0,47 saben yuta token output. Sing undercuts malah Z.ai kang GLM-5.3-Flash, dirilis dina padha ing $0,15 lan $0,50 mungguh - èfèktif paritas ing ngisor pasar.
Jurang kanggo kapal penggedhe Alibaba dhewe banget. Qwen3.8-Max, ngenalaken ing awal Agustus kanggo saingan karo Claude Opus 4.8, Gemini 3.1 Pro, lan GPT-5.6 Sol, biaya $2,00 saben yuta token input lan $6,00 saben yuta output token. Flash-Next performs mung ngisor kapal penggedhe, miturut nomer Alibaba dhewe, ing kira-kira siji-rolas rega ing loro input lan output.
Konteks dawa nambahake nilai praktis ngluwihi lembar spek. Ing 262.144 token asli, siji panjalukan bisa nyimpen sawetara repositori kode gedhe, set kontrak lengkap, utawa jam rapat sing ditranskripsi; ditambahi kanggo siji yuta token karo YaRN, analisis kabèh-korpus dadi layak tanpa scaffolding retrieval. Kanggo beban kerja pengkodean agen ing ngendi Flash-Next ngirim skor paling kuat - nemokake lan ndandani bug kanthi mandiri ing proyek piranti lunak nyata - jendhela gedhe tegese kurang gagal manajemen konteks ing tengah-tengah tugas. Tim Qwen uga wis nerbitake laporan teknis ing GitHub, ngundang persis jenis pengawasan arsitektur independen sing dihindari dening laboratorium proprietary.
Napa rilis iki penting
Qwen3.8-Flash-Next paling mangertos minangka gladhen umum kanggo Qwen4. Lapisan embedding N-gram, rasio parameter aktif agresif, lan RAM-offloading paramèter gedhe-nanging-jarang-dibutuhake sketsa filosofi desain: mindhah intelijen saben dolar, dudu intelijen saben GPU. Nglatih model Qwen3.7-Plus-beating kanthi biaya siji sanga yaiku kemampuan sing ndadekake siklus pengulangan kanthi cepet bisa terjangkau - lan kacepetan pengulangan, luwih saka pathokan siji, yaiku sing nemtokake sapa sing bakal ngadeg ing wates setaun wiwit saiki.
Tekan dina sing padha karo rong model bobot mbukak sing cedhak karo lab Cina - Z.ai's GLM-5.3-Flash lan Alibaba's Flash-Next - uga menehi tandha owah-owahan irama, kaya sing diamati FourWeekMBA. Laboratorium Barat isih duwe puncak pathokan, nanging tingkat bobot mbukak saiki dikirim kanthi kualitas saben minggu, kanthi rega sing luwih murah.
Kanggo pangembang, takeaway praktis prasaja: biaya model multimodal sing bisa, konteks dawa, mung mudhun maneh, kanthi bobot sing bisa didownload minangka asuransi marang panyedhiya siji. Kanggo saingan, pesen kasebut kurang nyaman - wates efisiensi saiki luwih cepet tinimbang rega unggulan sing bisa ditindakake kanthi nyata, lan Alibaba ora nuduhake tandha-tandha bakal mudhun.
---
Tetep Ahead of AIEntuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.
Waca liyane AI warta →