DeepSeek, şirketin büyük dil modeli (LLM) çıkarımını canlı trafik altında çıktı kalitesinde herhangi bir kayıp olmadan %85'e kadar hızlandırdığını söylediği açık kaynaklı spekülatif kod çözme çerçevesi olan DSpark'ı piyasaya sürdü. DeepSeek-AI ve Pekin Üniversitesi'nin yeni bir makalesinde açıklanan sistem, halihazırda gerçek kullanıcı isteklerini karşılayan DeepSeek-V4 hizmet altyapısında çalışıyor.

Çalışma, yapay zeka üretimindeki en inatçı sorunlardan birini ele alıyor: çıkarım yavaş çünkü modeller her seferinde bir jetonla metin üretiyor ve her biri ağ üzerinden tam geçiş gerektiriyor. Spekülatif kod çözme, küçük, hızlı bir "taslak" modelin, tam boyutlu modelin daha sonra tek geçişte doğruladığı ve en uzun doğru öneki kabul ettiği bir jeton bloğu önerdiği popüler bir çözümdür. Doğrulama paralel ve matematiksel olarak kesin olduğundan, orijinal modelin dağılımını korurken işleri hızlandırır. GitHub'daki DeepSpec eğitim deposuyla birlikte yayınlanan DSpark, kısa sürede Hacker News'te en çok tartışılan yapay zeka mühendisliği hikayelerinden biri haline geldi. For more context on this story, see our ongoing breaking AI news.

Mevcut Spekülatif Kod Çözme Neden Duvara Çarpıyor?

Son zamanlardaki spekülatif kod çözme araştırması, tek bir ileri geçişte aday tokenlardan oluşan bir bloğun tamamını oluşturan ve taslak gecikmesini blok boyutundan neredeyse bağımsız hale getiren "paralel taslak oluşturuculara" doğru ilerledi. DSpark belgesi, bu yöntemlerin geniş ölçekte vaatlerini yerine getirmesini engelleyen iki darboğaz tespit ediyor.

Birincisi kalite sorunudur. Paralel taslak hazırlayıcılar her konumu bağımsız olarak tahmin ettiğinden, bir blok içindeki tokenlerin birbirlerine nasıl bağlı olduğunu modelleyemezler. Araştırmacılar bunun "çok modlu çarpışmalara" yol açtığını ve taslak blokta daha sonraki konumlarda hızlı kabul azalmasına yol açtığını gösteriyor; bu duruma sonek bozulması adını veriyorlar. Paralel blok ne kadar uzun olursa kuyruğunun hatalı olma ihtimali de o kadar artar.

İkincisi sistem düzeyinde bir sorundur. Uzun taslak bloklar oluşturmak ucuz olsa da, önerilen her tokenın körü körüne doğrulanması, reddedilmesi muhtemel tokenlar üzerindeki sınırlı toplu kapasiteyi boşa harcıyor. Gerçek bir hizmet sisteminin yüksek eşzamanlılığı altında, ideal doğrulama uzunluğu iki eksen boyunca değişiklik gösterir: Kod gibi yapılandırılmış istekler, açık uçlu sohbete göre daha yüksek kabul oranları sağlar ve ekstra belirteçlerin doğrulanması hafif yük altında neredeyse ücretsizdir ancak sistem doygunluğa ulaştığında pahalıdır.

Yarı Otoregresif Bir Taslak Model

Son ek bozulmasını düzeltmek için DSpark, yazarların yarı otoregresif mimari dediği şeyi benimser. Aynı anda birçok token önerebilen, hesaplama açısından ağır bir paralel omurgayı, blok içi bağımlılık modellemeyi sunan hafif bir sıralı modülle birleştirir. Tasarım, erken konumlardaki paralel modellerin yüksek kapasitesini, birbiri ardına belirteçler üreten ve doğal olarak bağımlılıklara saygı duyan geleneksel otoregresif taslak hazırlayıcıların son ek tutarlılığıyla birleştirmeyi amaçlamaktadır.

Ekip, matematiksel muhakeme, kod oluşturma ve günlük sohbeti kapsayan kontrollü çevrimdışı kıyaslamalarda, DSpark'ın, güçlü temellere göre doğrulama döngüsü başına kabul edilen uzunluğu önemli ölçüde iyileştirdiğini bildirmektedir. Özellikle, makale, DSpark'ın kabul edilen uzunluğu, otoregresif Eagle3 drafter'a göre üç ayarda %30,9, %26,7 ve %30,0 ​​oranında ve paralel DFlash drafter'a göre %16,3, %18,4 ve %18,3 oranında iyileştirdiğini belirtiyor.

Güvene Göre Planlanmış, Yüke Duyarlı Doğrulama

DSpark'ın daha yeni yarısı doğrulama yaklaşımıdır. DSpark, her istek için sabit sayıda taslak jetonu doğrulamak yerine, doğrulama uzunluğu seçimini küresel bir üretim maksimizasyon problemi olarak formüle eder. Bir taslağın önekinin ne kadar süreyle hayatta kalacağına dair kalibre edilmiş tahminleri, yani gazetenin hayatta kalma olasılıkları dediği şeyi, gerçek zamanlı motor yükünü okuyan, donanıma duyarlı bir zamanlayıcıyla eşleştirir.

Sonuç, güven planlı doğrulamadır: Sistem, hem isteğin içeriğine hem de hizmet veren motorun mevcut durumuna bağlı olarak her istek için kaç jetonu doğrulayacağını dinamik olarak ayarlar. Hafif yükler altında cömertçe doğrulamayı karşılayabilirken, yoğun eşzamanlılık altında hedef modelin doğrulama bütçesini yalnızca beklenen en yüksek getiriye sahip tokenlara yönlendirerek, toplu kapasitenin düşük olasılıklı tokenlara harcanmasından kaynaklanan verim çöküşünü önler.

Canlı Kullanıcı Trafiği Altındaki Sonuçlar

En önemli rakamlar üretimden geliyor. Ekip, DSpark'ı canlı kullanıcı trafiğine hizmet veren DeepSeek-V4 hizmet sisteminin içine yerleştirdi ve bunu, MTP-1 olarak bilinen çok tokenli bir tahmin yöntemi olan şirketin önceki üretim temeli ile karşılaştırdı.

Makaleye göre DSpark, eşleşen toplu üretimde kullanıcı başına üretim hızlarını DeepSeek-V4-Flash için %60 ila %85 ve DeepSeek-V4-Pro için %57 ila %78 oranında sürekli olarak hızlandırıyor. Temel kapasitenin ciddi şekilde bozulduğu (Flash için saniyede 120 jetona ve Pro için saniyede 50 jetona eşdeğer) katı hizmet seviyesi anlaşmaları kapsamında, DSpark, güçlü verimi korumak için doğrulama yükünü azaltır. Yazarlar, bu performans uçurumunun üstesinden gelinerek, daha önce ulaşılamayan katı etkileşim katmanlarının kilidinin açıldığını ve LLM'nin Pareto sınırını etkili bir şekilde dışa doğru kaydırdığını savunuyorlar.

Bu ayrım operatörler için önemlidir. Aynı toplam işlem hacminde kullanıcı başına daha hızlı bir hız, daha fazla donanım satın almadan daha duyarlı asistanlar ve aracılı iş akışları anlamına gelirken, yük altında katı gecikmeli SLA'lara dayanmak, bir araştırma demosunu trafik artışları sırasında dayanabilen bir sistemden ayıran şeydir.

Topluluk için Açık Kaynaklı

DeepSeek, hem DeepSeek-V4-Flash hem de DeepSeek-V4-Pro önizleme modelleri için eğitimli DSpark kontrol noktalarını kullanıma sunuyor. İzin verilen MIT lisansı altında yayınlanan eşlik eden DeepSpec deposu, spekülatif kod çözme için tam kapsamlı, algoritma odaklı bir eğitim ve değerlendirme kod tabanı olarak tanımlanıyor. Veri hazırlama yardımcı programlarını, taslak model uygulamalarını, eğitim komut dosyalarını ve değerlendirme donanımlarını içerir ve üç taslak model algoritmasıyla birlikte gelir: DSpark, DFlash ve Eagle3.

Bu sürüm, diğer laboratuvarların ve altyapı ekiplerinin kendi taslak modellerini standart bir üretim hattına göre eğitme ve karşılaştırma yapma engelini azaltıyor. DeepSpec'in değerlendirme paketi GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval ve Arena-Hard-v2 gibi yerleşik kriterleri kapsar.

Neden Önemlidir

Çıkarım maliyeti ve gecikme artık yapay zeka endüstrisinin belirleyici kısıtlamaları arasında yer alıyor ve şirketlerin yapay zeka aracılarını ne kadar agresif bir şekilde dağıttıklarından küçük sağlayıcıların birim ekonomi konusunda hiper ölçekleyicilerle rekabet edip edemeyeceğine kadar her şeyi şekillendiriyor. DSpark'ın katkısı, tek bir yeni algoritmadan çok, taslak model ile doğrulama planlayıcısının dikkatli bir şekilde birlikte tasarlanması ve doğrulama uzunluğunun canlı sistem durumunun bir fonksiyonu olarak ele alınmasının, gerçek dağıtımlarda iğneyi anlamlı bir şekilde hareket ettirebileceğinin bir gösterimidir.

Ününü verimli, açık olarak yayınlanmış sistemler üzerine inşa eden DeepSeek için DSpark, laboratuvarın bir yılı aşkın süredir öne sürdüğü argümandaki bir başka veri noktasıdır: Sınır düzeyinde hizmet performansına yalnızca ham bilgi işlem yerine daha akıllı mühendislik yoluyla ulaşılabilir. Kazanımların sentetik bir kıyaslama yerine canlı trafik altında ölçülmüş olması, açık kaynak topluluğu makaleyi sindirip rakamları yeniden üretmeye başladığında, diğer operatörlerin sonucu ciddiye almasını kolaylaştırıyor.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →