Alibaba'nın Qwen ekibi, çarşamba günü Qwen3.8-Flash-Next'i piyasaya sürdü; çok modlu bir uzman karışımı modeli, yaklaşmakta olan Qwen4'ün mimari önizlemesi olarak ikiye katlanıyor ve şirketin, eğitim maliyetinin kabaca dokuzda biri kadar bir maliyetle çok daha büyük olan Qwen3.7-Plus'ı geride bıraktığını söylediği sonuçları sağlıyor. Reuters, Bloomberg ve The Decoder, Z.ai'nin kendi sınıra bitişik açık modelini gönderdiği gün Hugging Face ve ModelScope'a açık ağırlıklar veren lansmanı haber yaptı. Açık siklet yarışı hızlandıkça son dakika yapay zeka haberlerini takip edin.
Minyatürde yeni bir mimari
Başlık spesifikasyonu verimliliktir. Qwen3.8-Flash-Next'in toplam 125 milyar parametresi vardır ancak jeton başına yalnızca 6 milyarı etkinleştirir. Karşılaştırma için, Alibaba'nın yayınlanmış kriterlerinde daha iyi performans gösterdiği Qwen3.7-Plus modeli, token başına 17 milyar etkinleştirilmiş toplam 397 milyar parametreye sahiptir; bu, Flash-Next'in aktif sayısının neredeyse üç katıdır.
Teknik açıdan en ilginç parça, 51 milyar parametre taşıyan yeni bir N-gram gömme katmanıdır. Katman, The Decoder'dan Matthias Bastian'ın bir tür "kelime öbeği sözlüğü" olarak tanımladığı şeyde, ortak sözcük gruplarını bağımsız girişler olarak saklıyor ve ağın başlangıcına öbek düzeyindeki bilgileri besliyor. En önemlisi, Qwen ekibinin nispeten düşük ek maliyet olarak adlandırdığı pahalı GPU belleği yerine normal sistem RAM'inde bulunuyor; bu, Qwen4'e taşınması planlanan bir mimari yenilik.
Model, doğal olarak 262.144 jetonluk bir bağlam penceresini destekler ve YaRN uzun bağlam uzantısını kullanarak bir milyon jetona ölçeklenir. GitHub'da teknik bir rapor yayınlandı.
Karşılaştırmalar: kodlama ve ofis işleri
Alibaba'nın kıyaslamaları Flash-Next'i DeepSeek-V4-Flash (284 milyar parametre, 13 milyar aktif) ve Anthropic'in Claude Opus 4.6 (Max) ile karşı karşıya getiriyor. Her iki rakibin de çok daha büyük ve daha pahalı olmasına rağmen Flash-Next, test edilen görevlerin çoğunda lider konumdadır ve en büyük kazanımları kodlama ve ofis üretkenliğinde elde eder.
Ajansal kodlamada Flash-Next, DeepSWE 1.1'de 58,7 ve SWE-bench Pro'da 62,5 puan alarak hem DeepSeek-V4-Flash'ı hem de Claude Opus 4.6'yı geride bıraktı. Ofis görevlerindeki fark daha da geniş: CoWorkBench'te 73,9, DeepSeek-V4-Flash'ta 45,1 ve JobBench'te 55,7; Qwen3,7-Plus'ın 27,6'sının neredeyse iki katı. Bilimsel akıl yürütme, Flash-Next'in GPQA Diamond'da 91,7 ve LiveCodeBench v6'da 91,9 ile saha genelinde yakından eşleşiyor. Claude Opus 4.6, yalnızca Humanity's Last Exam'de (40,0 ila 35,9) önde çıkıyor ve Şubat 2026'dan itibaren daha eski bir Antropik modeldir. Her zaman olduğu gibi, yayınlanan kıyaslama puanları ve gerçek dünya performansı farklılık gösterebilir.
Her rakip üzerinde fiyat baskısı
Üretim sürümü, QwenCloud aracılığıyla Qwen3.8-Flash olarak gönderilir ve fiyatı bir milyon giriş tokenı başına 0,16 ABD Doları ve bir milyon çıkış tokenı başına 0,47 ABD Dolarıdır. Bu, Z.ai'nin aynı gün sırasıyla 0,15 ve 0,50 dolardan piyasaya sürülen GLM-5.3-Flash'ının bile altını çiziyor; bu da piyasanın en altında etkili bir eşitlik sağlıyor.
Alibaba'nın kendi amiral gemisiyle aradaki fark çok büyük. Claude Opus 4.8, Gemini 3.1 Pro ve GPT-5.6 Sol ile rekabet etmek üzere Ağustos başında tanıtılan Qwen3.8-Max'in maliyeti bir milyon girdi tokenı başına 2,00 dolar ve bir milyon çıkış tokenı başına 6,00 dolardır. Flash-Next, Alibaba'nın kendi rakamlarına göre amiral gemisinin hemen altında, hem girdi hem de çıktı fiyatının kabaca on ikide biri kadar bir performans sergiliyor.
Uzun bağlam, teknik özellikler sayfasının ötesinde pratik değer katar. 262.144 yerel token ile tek bir istek, birkaç büyük kod deposunu, tam bir sözleşme setini veya saatlerce kopyalanmış toplantıları barındırabilir; YaRN ile bir milyon jetona genişletildiğinde, tüm derlem analizi, erişim iskelesi olmadan mümkün hale geliyor. Flash-Next'in en güçlü puanları yayınladığı (gerçek yazılım projelerindeki hataları bağımsız olarak bulup düzelttiği) aracılı kodlama iş yükleri için büyük bir pencere, görevin ortasında daha az bağlam yönetimi hatası anlamına gelir. Qwen ekibi aynı zamanda GitHub'da teknik raporu da yayınladı ve özel laboratuvarların kaçındığı türden bağımsız mimari incelemesine davet etti.
Bu sürüm neden önemli?
Qwen3.8-Flash-Next en iyi şekilde Qwen4 için halka açık bir kostümlü prova olarak anlaşılır. N-gram yerleştirme katmanı, agresif aktif parametre oranı ve büyük ancak nadiren ihtiyaç duyulan parametrelerin RAM boşaltması bir tasarım felsefesinin taslağını çiziyor: GPU başına zekayı değil, dolar başına zekayı hareket ettirin. Maliyetin dokuzda biri oranında Qwen3.7-Plus'ı yenen bir modeli eğitmek, hızlı yineleme döngülerini uygun fiyatlı hale getiren yetenektir ve bundan bir yıl sonra kimin sınırda duracağına herhangi bir kıyaslamadan daha fazla yineleme hızı karar verir.
FourWeekMBA'nın gözlemlediği gibi, Çin laboratuvarlarından iki sınıra bitişik açık ağırlık modelinin (Z.ai'nin GLM-5.3-Flash ve Alibaba'nın Flash-Next'i) aynı gün gelmesi de bir ritim değişimine işaret ediyor. Batılı laboratuvarlar hala kıyaslama zirvelerini elinde tutuyor, ancak açık ağırlık kademesi artık sınıra yakın kaliteyi haftalık olarak çok daha düşük fiyatlara gönderiyor.
Geliştiriciler için pratik çıkarım basit: Yetenekli, uzun bağlamlı, çok modlu bir modelin maliyeti, tek bir sağlayıcıya karşı sigorta olarak indirilebilir ağırlıklarla yeniden düştü. Rakipler için mesaj pek de rahatlatıcı değil; verimlilik sınırı artık amiral gemisi fiyatlandırmasının gerçekçi bir şekilde takip edebileceğinden daha hızlı ilerliyor ve Alibaba herhangi bir yavaşlama belirtisi göstermiyor.
---
Yapay Zekanın Önünde OlunEn son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →