Çin yapay zeka laboratuvarı DeepSeek, 552 milyar parametreli omurgayı şimdiye kadar öncü sınıf bir sistemde sunulan en agresif bellek sıkıştırmasıyla eşleştiren çok modlu, açık ağırlıklı bir model olan V4.1-Flash'ı piyasaya sürdü. Reuters'in bildirdiğine göre, model, Hangzhou merkezli laboratuvar için bir dizi manşeti kapatan, Hugging Face'e ilişkin bir MIT lisansı ve beraberindeki bir teknik raporla Çarşamba günü yayına girdi.
Sürüm, rutin bir sürüm artışından daha fazlasıdır. DeepSeek eş zamanlı olarak amiral gemisi V4 Pro katmanını kullanımdan kaldırdı ve TechNode, V4 Pro'ya yönelik isteklerin artık V4.1-Flash'a yönlendirildiğini bildirdi; bu, "Flash" adını taşıyan ancak yerine geçtiği modelde veya bunun üzerinde kıyaslama rakamları yayınlayan bir modele duyulan güvenin çarpıcı bir ifadesidir. For more context on this story, see our ongoing artificial intelligence updates.
Daha Küçük Bellek Faturasıyla Daha Büyük Bir "Flaş"
Resmi model kartına göre DeepSeek-V4.1-Flash, 552 milyar omurga parametresine ek olarak jeton tabanlı arama yoluyla seyrek olarak erişilen 196 milyar parametreli "Engram" koşullu bellek bileşenine sahip bir Uzmanlar Karması (MoE) modelidir. Büyük boyutuna rağmen model, ön doldurma sırasında jeton başına yalnızca 8 milyar parametreyi ve kod çözme sırasında 16 milyar parametreyi etkinleştirir; bu, sabit 13 milyar çalıştıran 284B parametreli önceki modele göre daha az aktif parametredir.
Mimarinin en önemli parçası, DeepSeek'in Nedensel Kodlayıcı-Kod Çözücü (CED) tasarımı olarak adlandırdığı şeydir: 40 katmanlı bir Transformer, 20 katmanlı bir nedensel kodlayıcıya ve ardından 20 katmanlı bir kod çözücüye bölünmüştür. Kod çözücünün global KV önbelleği, katman katman biriktirilmek yerine son kodlayıcının gizli durumlarından yansıtıldığından, uzun konuşmaları sürdürmek için gereken bellek önemli ölçüde küçülür.
Sıkıştırma sayıları manşettir. E2M1 formatında FP4 ana KV önbelleğe alma özelliğiyle, küresel KV önbellek alanı token başına 890 bayta, yani DeepSeek-V4-Flash'ın kabaca dörtte birine düşer. SWA Sınırlı Yeniden Oynatma adı verilen bir teknik, yalnızca en yeni belirteç penceresini yeniden oynatarak eksik dikkat durumlarını yeniden yapılandırır ve kalıcı KV önbelleğini önceki Flash modelinin yaklaşık sekizde birine indirir. Model kartına göre azalma, V4-Flash'a göre kabaca dört kat, DeepSeek-V1'e göre ise 437 kattır. Ek bileşenler arasında, her bir dikkat katmanına üç statik moddan birini atayan Sıkıştırılmış Seyrek Dikkat 2 (CSA2) ve daha hızlı üretim için DSpark spekülatif kod çözme bulunur.
Kaputun altında, her MoE katmanı, paylaşılan bir uzmanı 384 yönlendirilmiş uzmanla birleştirerek, jeton başına altı yönlendirilmiş uzmanı etkinleştirir.
Karşılaştırmalar: Emekli Amiral Gemisinin Önünde
Teknik rapordaki temel model değerlendirmelerinde V4.1-Flash, çok daha büyük olan V4 Pro'yu bazı önemli testlerde geride bırakıyor: MMLU-Pro'da 73,5'e karşı 74,1, HumanEval'de 79,4'e karşı 76,8, BigCodeBench'te 60,6 ve GSM8K'da 93,0. South China Morning Post, DeepSeek'in yeni modelin siber ve kodlama kriterlerinde Kimi K3'ü geride bıraktığını söylediğini bildirdi; bu, Z.ai'nin GLM-5.3 ve Alibaba'nın Qwen serisini de içeren Çin açık model alanında kayda değer bir iddia.
Maksimum muhakeme çabasıyla talimat modeli GPQA Diamond'da 90,9 puan alıyor; etkileyici, ancak yine de DeepSeek'in kendi karşılaştırma tablosunda referans verilen önde gelen sınır sistemlerinin (94,1 puanla GPT-5,6 Sol ve 93,4 puanla Claude Opus 5,0) gerisinde. Kimi K3 92.9'da oturuyor. Dürüst okuma: Bu, kapalı laboratuvarların temiz bir taraması değil, açık ağırlık fiyatlarında sınıra bitişik bir modeldir.
V4.1-Flash aynı zamanda gerçekten çok modludur. Sıfırdan eğitilmiş bir DeepSeek-ViT görüntü kodlayıcı, görüntüleri iki katmanlı bir projektör aracılığıyla besliyor ve model, ön eğitimin başından itibaren metin ve görüntüler üzerinde ortaklaşa eğitiliyor. MMMU-Pro'da 56,5 ve DocVQA'da 95,6 puan alıyor.
Temsilciler için Geliştirildi, Hacme Göre Fiyatlandırıldı
Tasarım seçimleri hedef kitleyi açıkça ortaya koyuyor: modellerin çok büyük bağlamları okuduğu ve uzun ufuklar boyunca hareket ettiği ajans iş yükleri. Model, bir milyon jetona kadar bağlam pencerelerini destekler, 45 trilyon jetonluk çok modlu bir veri kümesi üzerinde eğitilmiştir ve çıkarım maliyetini doğrulukla takas eden 1'den 100'e kadar sürekli olarak kontrol edilebilen bir muhakeme-çaba kadranı sunar. Kod Çözücünün kapsamı, bellek tasarruflarının özellikle yapay zeka aracılarını (çıktı oluşturmaktan çok girdiyi okumaya zaman harcayan iş yükleri) çalıştırma maliyetini azalttığını vurguladı.
Toplumun tepkisi oldukça güçlü oldu. Hacker News'teki lansman başlığı 650'den fazla puan aldı ve "DeepSeek v4.1 flash'ı v4 pro'dan daha ucuz ve daha yetenekli başlatıyor" başlıklı daha önceki bir başlık yaklaşık 400 puan daha topladı. Modelleri yerel olarak çalıştıran yorumcular, Engram parametrelerinin hızlı SSD'lere bile aktarılabileceğini ve bunun tüketici donanımında sınıra yakın çıkarımlara yol açabileceğini belirtti.
Seeking Alpha, ticari riskleri açık bir şekilde çerçeveledi ve onu ABD sınır laboratuvarları için zorluklar yaratan ultra düşük maliyetli bir model olarak nitelendirdi; bu, yapay zeka çıkarımlarındaki fiyat savaşının hiçbir soğuma belirtisi göstermediğini hatırlattı.
Duyuru İçin Kasıtlı Bir An
Zamanlama bunu gösteriyor. Lansmandan bir gün önce Reuters, laboratuvarın gelirinin olası bir listelenmeden önce on kat arttığını bildiren daha önceki raporların ardından DeepSeek'in Şanghay STAR Market'te bir halka arz düzenlemek için CITIC Securities'e başvurduğunu bildirdi. Manşetlere konu olan açık bir modelin günler sonra piyasaya sürülmesi bu ivmenin devam etmesini sağlıyor.
Açıklama aynı zamanda Çinli yapay zeka firmalarının yoğun şekilde incelendiği bir dönemde gerçekleşti. Bu haftanın başlarında, aralarında NSA, CISA ve FBI'ın da bulunduğu ABD kurumları, endüstriyel ölçekli model damıtmayla ilgili bir danışma belgesinde altı Çinli AI şirketinin adını verdi; bu, DeepSeek'in teknik kazanımlarının artık jeopolitik bagajla birlikte geldiğini hatırlatıyor.
Bunların hiçbiri mühendislik hikayesini karartmıyor. V4 Pro'nun kullanımdan kaldırılması ve trafiğinin daha ucuz, daha güçlü bir modele yönlendirilmesiyle DeepSeek, 2026'da yapay zekanın ilgi çekici sınırının yalnızca en büyük modeli kimin oluşturduğunun değil, aynı zamanda gigabayt başına en fazla yeteneği sunanın da olabileceği yönünde mümkün olan en net argümanı ortaya koydu.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →