Cerebras, şirketin model katalog belgelerine göre açık ağırlık modelinin saniyede yaklaşık 1.500 token hızla çalıştığı Cerebras Inference platformunun halka açık uç noktalarına Qwen 3.8 27B'yi ekledi. Listeleme, Alibaba'nın en yaygın kullanılan açık model ailelerinden birini, tipik GPU tarafından barındırılan hizmetin gölgesinde kalan hızlarda kullanılabilir hale getiriyor.
Duyuru, geliştiricilerin hemen dikkatini çekti: Hikaye, Hacker News'te bir gün içinde 600'den fazla puan topladı; bu, hızlı, ucuz çıkarıma yönelik sıcak talebin ne kadar arttığını yansıtan bir ilgi düzeyi. Çıkarım pazarına daha geniş bir bakış açısı sağlamak için, son dakika yapay zeka haberleri masası, her önemli platform güncellemesini geldikçe takip ediyor.
Katalogdaki Özellikler
Cerebras'ın belgelerine göre Qwen 3.8 27B, 27 milyar parametre taşıyor ve ücretsiz katmanda 64K bağlam tokenını ve ücretli katmanlarda 128K token'ı destekliyor ve saniyede yaklaşık 1.500 token ile çalışıyor. OpenAI'nin açık ağırlıklı GPT-OSS 120B modelinin yanında yer alıyor; aynı katalog, ücretsiz katmanda 65K bağlam ve ücretli katmanlarda 131K bağlam ile saniyede yaklaşık 3.000 token listeliyor.
Her iki model de Cerebras'ın ücretsiz deneme sürümünde ve oran sınırlarına tabi olarak kullandıkça öde katmanlarında mevcuttur. Ayrılmış kapasiteye, daha yüksek verim veya üretim SLA'larına ihtiyaç duyan müşteriler, şirketin Tahsis Edilmiş Uç Noktalar teklifine yönlendiriliyor; belgelerde bu, genel uç noktalarda iki modelin ötesinde ek model ailelerine giden yol olarak da listeleniyor.
Hız rakamlarının yanı sıra bağlam pencereleri de dikkati hak ediyor. Ücretsiz katmanda 64.000 jeton (ve ücretlide 128.000 jeton), büyük kod tabanlarını, uzun belgeleri veya genişletilmiş aracı transkriptlerini aynı anda bellekte tutmak için yeterlidir; bu, hızlı kod çözmenin işe yaradığı tam iş yükleri için önemlidir. Cerebras'ın belgeleri ayrıca, mevcut kodları zaten OpenAI SDK'yı hedefleyen ekiplerin geçiş maliyetini azaltan bir OpenAI uyumluluk kılavuzunu da içeriyor: prensip olarak, mevcut bir istemciyi Cerebras uç noktasına yönlendirmek, yeniden yazmaktan ziyade bir yapılandırma değişikliğidir.
Budanmamış Modeller, Şeffaf Sıkıştırma
Belgelerde dikkat edilmesi gereken bir ayrıntı da Cerebras'ın model sıkıştırmasını nasıl ele aldığını açıklamasıdır. Şirket, halka açık uç noktalarındaki tüm modellerin orijinal, budanmamış versiyonlar olduğunu ve kaliteyi korumak için yalnızca depolama sırasında seçici yalnızca ağırlık nicelemesi kullandığını belirtiyor. Hassas katmanlar tam hassasiyette kalır, aktivasyonlar, dikkat ve KV önbelleği nicelenmemiş halde kalır ve dekuantizasyon anında gerçekleşir.
Cerebras ayrıca REAP (Yönlendirici Ağırlıklı Uzman Aktivasyon Budaması) gibi budama tekniklerine ilişkin araştırmasını da açıklıyor: budanmış varyantlar Hugging Face'teki araştırma topluluğuyla paylaşılıyor ancak genel API aracılığıyla sunulmuyor. Açık modellerin nerede çalıştırılacağını seçen geliştiriciler için tam olarak neyin sunulduğuna ilişkin şeffaflık alışılmadık derecede açıktır.
Token Hızı Neden Önemlidir
Bunun gibi üretim rakamları en çok aracılık ve kodlama iş yükleri için önemlidir. Yüzlerce model çağrısını (kodlama aracıları, otonom iş akışları, gerçek zamanlı asistanlar) zincirleyen uygulamalar, her adımda token başına gecikmeyi artırır, böylece saniyede 50 ila 1.500 token arasındaki fark, niteliksel olarak farklı bir deneyime dönüşür. Uzun tamamlamaları aktaran etkileşimli uygulamalar en gözle görülür faydayı sağlar.
Takas kapsamdır. 27 milyar parametreli bir model, en zorlu muhakeme görevlerinde sınır sistemleriyle eşleşmeyecektir ve Cerebras'ın kendi dokümanları, ağır üretim iş yüklerini özel kapasiteye yönlendirmektedir. Ancak orta ölçekli açık modellerin zaten yeterince iyi olduğu geniş orta düzey görevler için (özetleme, sınıflandırma, araç kullanımı, kod düzenleme) hız, farklılaştırıcı unsur haline gelir.
Geliştiricilerin tartacağı bir fiyat boyutu da var. Genel uç nokta modelleri, herhangi bir taahhütten önce ücretsiz denemede kullanılabilir; bu, bir ekibin kendi iş yüküne göre kıyaslamayı esasen sürtünmesiz hale getirir; ilk token sunulmadan önce satış görüşmeleri gerektiren kurumsal sözleşmelerle çelişen kasıtlı bir artış. Belgelenen hız sınırları izlenmesi gereken kısıtlamalardır: ücretsiz katman erişimi, üretim trafiğini çalıştırmak için değil, hızı kanıtlamak için mevcuttur.
Açık Modeller İçin Yoğun Bir Esneme
Ekleme, açık ağırlık yapay zekası için kalabalık bir dönemde gerçekleşir. BAE merkezli laboratuvar IFM, altı tamamen açık modelden oluşan bağlantılı bir filo olan K2 Horizon'u kısa süre önce tanıttı ve Meta, kodlama ve aracılı kullanım için Muse ailesini yinelemeye devam ediyor. Bu arada, Çin'deki açık model ekosistemler, sektördeki sürüm döngülerini sıkıştıran bir hızda nakliyeyi sürdürüyor.
Geliştiriciler için pratik çıkarım, açık model yığınının aynı anda iki cephede olgunlaşmasıdır: orta ölçekli modeller, günlük görevlerde amiral gemileriyle aradaki farkları kapatırken yetenek ve uzman çıkarım sağlayıcıları ham hız üzerinde rekabet ederken ekonomiye hizmet eder. Cerebras'taki Qwen 3.8 27B, her iki trend için de bir veri noktasıdır; bir yıl önce egzotik olan hızlarda, iş için özel olarak tasarlanmış donanımla hizmet veren mevcut nesil açık bir model.
Platformu değerlendiren geliştiricilerin kendi iş yüklerini karşılaştırması gerekir: yayınlanan hızlar katalog rakamlarıdır, gerçek dünyadaki aktarım hızı bilgi istemi uzunluklarına, eşzamanlılığa ve yapılandırmaya bağlıdır ve ücretsiz katmanın hız sınırları, hızdan önce bağlanacaktır.
Yapay Zekanın Önünde Kalın
Her model sürümü, çıkarım platformu güncellemesi ve geliştirici aracının başlatılması, gerçekleştiği anda takip edilir — daha fazla AI haberini okuyun →
