Strata adında az bilinen bir açık kaynaklı proje bir an yaşıyor. Alibaba'nın 125 milyar parametreli uzman karışımı modeli olan Qwen3.8-Flash-Next'i sıradan oyun bilgisayarlarında çalıştıran MIT lisanslı motor, 4 Ekim'de 640'tan fazla puanla Hacker News'in ön sayfasına çıktı ve GitHub deposu, 24 Eylül'de oluşturulduğundan bu yana 11.000'den fazla yıldız topladı.

İşin özü basit: Normalde bir sunucuda yaşayan 125 milyar parametreli bir model, makineden hiçbir şey çıkmadan tamamen tüketici grafik kartı üzerinde sohbet edebilir, kod yazabilir, resim okuyabilir ve kodlama aracılarını çalıştırabilir.

Strata Aslında Ne Yapıyor?

Strata, Windows ve Linux için hem bir çıkarım motoru hem de tek tıklamayla yükleyicidir. Belgelerine göre, gereksinimler sınır modeli standartlarına göre mütevazı: NVIDIA'nın RTX 20, 30, 40 veya 50 serisinden veya AMD'nin Radeon RX 6000, 7000 veya 9000 serisinden en az 12 GB VRAM'e sahip bir GPU, en az 32 GB sistem RAM'i ve yaklaşık 80 GB boş SSD alanı.

Motor, Qwen3.8-Flash-Next'in nicelenmiş versiyonlarını, Q2_0'dan IQ3_S'ye kadar çeşitli sıkıştırma seviyelerinde ve ayrıca koda özel bir varyantla birlikte gönderir. Localhost'ta OpenAI ve Anthropic uyumlu API'leri ortaya çıkarır; bu, ChatGPT veya Claude için oluşturulmuş araçların (Claude Code, Cursor ve Codex gibi kodlama aracıları dahil) minimum değişiklikle yerel sunucuya yönlendirilebileceği anlamına gelir. İsteğe bağlı görüntü girişi ve çoklu GPU desteği dahildir ve yükleyici, kodlama asistanının yapıştırılan tek bir komut isteminden makineyi yapılandırmasına olanak tanıyan yapay zeka destekli bir kurulum modu bile sunar.

Hız Numaraları

Projenin iki tüketici masaüstünde ölçülen yayınlanmış kıyaslamaları, sürümün yayılmasının nedenidir. Strata, Ryzen 5 7600 ve 64 GB RAM ile eşleştirilmiş 12 GB VRAM'li bir NVIDIA RTX 5070 üzerinde şunları bildiriyor:

  • Q2_0 nicemleme: Oluşturma için saniyede 94 jeton ve 32K jetonlu bir belgede hızlı işlem için saniyede 2.650 jeton
  • IQ3_S: İkinci nesil başına 53 jeton, saniyede 1.620 jeton hızlı işlem
  • Kodlayıcı çeşidi: İkinci nesil başına 55 jeton

AMD tarafında, 16 GB VRAM'e sahip RX 9070 XT, Q2_0'da saniyede 60 token yönetti. Belgeler, 24 GB VRAM'e sahip bir RTX 3090'ın saniyede 100 ila 140 jetona ulaşması gerektiğini tahmin ediyor; bu, çoğu insanın okuyabileceğinden daha hızlı.

Karşılaştırma için, altı ay önce, 70 milyar parametreli yoğun bir modeli bile kullanılabilir hızlarda yerel olarak çalıştırmak, yüzlerce gigabaytlık birleştirilmiş belleğe veya agresif spekülatif kod çözme hilelerine sahip bir iş istasyonu gerektiriyordu.

125B Modeli Neden Oyun Kartına Uyuyor?

İki teknoloji bunu mümkün kılıyor. Birincisi modelin kendisidir. AI Buzz Wire'ın piyasaya sürüldüğünde anlatıldığı gibi, Qwen3.8-Flash-Next, yaklaşık 125 milyar toplam parametreye sahip ancak jeton başına yalnızca yaklaşık 6 milyar aktif parametreye sahip bir uzman karışımı mimarisidir; dolayısıyla oluşturulan her kelime, ağın küçük bir dilimine dokunarak jeton başına hesaplamayı önemli ölçüde azaltır.

İkincisi kuantizasyondur. Strata'nın en hızlı ön ayarları, modelin ağırlıklarını parametre başına iki veya üç bit'e sıkıştırarak, 12 GB GPU ve sistem RAM'ine sığacak bir ayak izi için bir miktar doğruluğu değiştirir. Bu ödünleşim ana uyarıdır: Q2 sınıfı ve IQ2 sınıfı nicelikler, muhakeme ağırlıklı görevlerde kaliteyi ölçülebilir şekilde düşürür ve alıcılar, manşet hız rakamlarını her iş yükü için bir garanti yerine bir başlangıç ​​noktası olarak ele almalıdır. Depodaki topluluk karşılaştırma sayfaları, boyutlara göre kalite sonuçlarını izler.

Daha Büyük Bir Yerel Yapay Zeka Dalgasının Parçası

Strata, yerel çıkarım için ivmenin arttığı bir dönemde geliyor. Alibaba'nın Qwen ailesi en çok indirilen açık ağırlıklı model serisi haline geldi; Meta ve Google'ın kendilerine ait açık kaynaklı rekabetçi modelleri var ve bir dizi araç artık tüketicilerin yetenekli asistanları abonelik veya cihazlarından ayrılmadan çalıştırmalarına olanak tanıyor.

Proje aynı zamanda "tüketici donanımı" tanımının nasıl değiştiğini de yansıtıyor. Öncelikle oyun için gönderilen, 12 GB VRAM'e sahip orta sınıf 2026 grafik kartı, yalnızca iki yıl önce sınır sistemlerini tanımlayan boyut sınıfındaki bir model için artık geçerli bir çıkarım hızlandırıcıdır.

Strata ilk yazılım olmaya devam ediyor - veri havuzunun sorun takip cihazı eski GPU'lar ve AVX2 olmayan işlemcilerdeki pürüzleri belgeliyor - ancak proje MIT lisanslı, ücretsiz ve Intel Arc, eski Tesla ve Radeon kartları ve topluluk üyeleri tarafından belgelenen çoklu GPU donanımları için deneysel destekle açık olarak geliştirildi.

Geliştiriciler için en pratik çıkarım, localhost API uyumluluğu olabilir: OpenAI veya Anthropic SDK'ya karşı yazılan herhangi bir komut dosyası veya aracı, bir temel URL değiştirilerek yerel bir Qwen dağıtımına yönlendirilebilir, bu da Strata'yı gizliliğe duyarlı prototip oluşturma, çevrimdışı kullanım veya yalnızca API harcamasını sınırlamak için düşük sürtünmeli bir seçenek haline getirir.

Nasıl Denenir?

Başlamak, kılavuz içeren bir terminal oturumu gerektirmez. Yükleyici, sürücüleri, model ağırlıklarını ve yerel sunucuyu tek geçişte hazırlar ve depo, doğrudan bir AI kodlama asistanına yapıştırılmak üzere tasarlanmış bir kurulum dosyası içerir ve bu dosya daha sonra makineyi bağımsız olarak yapılandırır. Ağırlıklar diskten yüklenirken ilk başlatmalar daha yavaştır; belgeler bir SSD öneriyor ve uzun konuşmaların sistem RAM'ine daha fazla iş yüklediği konusunda uyarıyor.

Yapay Zekanın Önünde Olun

Açık kaynaklı modeller, yerel yapay zeka araçları ve çıkarım donanımıyla ilgili en son gelişmeler için AI Buzz Wire adresini takip edin.

Daha fazla AI haberini okuyun →