Küçük Ama Geniş Uzmanlardan oluşan Karma Tasarım
MarkTechPost'taki ayrıntılı bir analize göre Instella-MoE-16B-A3B, token başına yalnızca 2,8 milyarı etkinleştiren 16 milyar toplam parametreye sahip, yalnızca kod çözücüye yönelik bir MoE modelidir. 27 katmanının her biri 2 paylaşılan uzman artı 64 kişilik bir havuzdan seçilen 6 yönlendirilmiş uzman, gizli boyutu 2048, 16 dikkat kafası ve 128.896 jetonluk kelime dağarcığını kullanır. Çok Belirteçli Tahmin** hedefi hem eğitim öncesi hem de eğitim ortasında kullanılır.Her token için ağın küçük bir bölümünün "uyandığı" bu seyrek mimari, geçen yıl piyasayı yeniden şekillendiren, çalıştırması ucuz açık modellerin arkasındaki aynı verimlilik mantığıdır. AMD, modeli Nemotron-CC-v2, MegaMath, FineMath, RefineCode ve TxT360 dahil olmak üzere açık korporalardan alınan 7,1 trilyon token üzerinde eğitti ve ardından Dolma3 Dolmino 100B üzerinde ağırlık ortalamasına göre birleştirilen üç veri varyantı üzerinde bir orta eğitim aşaması yürüttü. Uzun bağlamlı bir aşama, YaRN kullanarak pencereyi 4K'dan 64K tokenlara kadar genişletir.
Sistem Düzeyinde İki Yenilik
Sürüm, AMD'nin anlamlı mühendislik zaferleri olarak vurguladığı iki yapısal seçeneği içeriyor. Bunlardan ilki, Çok Kafalı Gizli Dikkate hafif bir öğrenilmiş çıkış kapısı ekleyen Geçitli Çok Kafalı Gizli Dikkat (Geçitli MLA)'dir. Özel bir doğrusal projeksiyon, çıkış projeksiyonundan önce çarpımsal olarak uygulanan giriş koşullu bir geçit türetir.
İkincisi, FarSkip-Collective, güncelliğini kaybetmiş ve kısmi aktivasyonları MoE ve dikkat katmanlarına aktaran ve uzman-paralel iletişimi hesaplamayla örtüştüren bir bağlantı şemasıdır. AMD, uzman paralelliğiyle hizmet verirken eğitim öncesi %12,7'lik bir hızlanma ve ilk jetona ulaşma süresinde %39,2'ye varan bir azalma bildirdi. Donanımını fiyat-performans oranına göre sunan bir şirket için bunlar tam olarak bir alıcının görmek istediği rakamlardır.
Tamamen Açık Bir Model İçin Güçlü Karşılaştırmalar
Temel kontrol noktasında Instella-MoE, değerlendirmelerde ortalama 76,7 alıyor ve AMD bunu tamamen açık modeller arasında en güçlü sonuç olarak adlandırıyor. Bu onu Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) ve OLMoE-1B-7B'nin (61.9) önüne koyuyor, ancak hala Qwen3.5-4B-Base'in (79.5) gerisinde. WinoGrande'de 86,5 puanla önde, HumanEval+'da ise 65,7 puanla yer alıyor. Uzun bağlamlı görevler için, HELMET'te ortalama 41,5 ve RULER'da 79,4'tür.
Eğitim sonrası model daha da keskinleştirilir. Ortalama puanlar, denetimli ince ayar sonrasında 71,58'den DPO sonrasında 72,67'ye ve "Think" konfigürasyonunda 73,22'ye yükselerek Olmo3-7B-Think'i (71,97), Gemma-4-E4B Think'i (70,47) ve Qwen3,5-4B'yi (69,73) geride bırakıyor. Talimat takibinde IFEval 77,08'den 83,70'e yükselir.
Eğitim sonrası tarifin kendisi dikkate değerdir. Dolci-Think-SFT-7B ve Nemotron karışımlarında SFT'den sonra AMD, bozulmayı önlemek için DPO'yu yönlendirici önyargı güncellemeleri ve yardımcı yük dengeleme kaybı devre dışı bırakılarak çalıştırır. Takviyeli öğrenme daha sonra AMD'nin Miles çerçevesinde ilerler: 1.400 adımlık talimat takip eden RLVR ve ardından matematik veya kod performansından ödün vermeden kazancı tekrar katlayan Çoklu Öğretmen Politikaya Dayalı Damıtma gelir.
Lisans Yakalama
Ticari kullanıcılar için önemli bir uyarı var. Model ağırlıkları, kullanımı yalnızca akademik ve araştırma amaçlarıyla sınırlayan ResearchRAIL lisansı kapsamında gönderilir; bu nedenle Instella-MoE, üretim dağıtımları için kolay bir model değildir. Bununla birlikte, eğitim kod tabanı MIT lisanslıdır ve bu muhtemelen daha fazla yeniden kullanılabilen varlıktır; diğer laboratuvarlara AMD silikonu üzerine eğitim için somut bir plan sağlar.
AMD, Hugging Face koleksiyonu, GitHub deposu ve ROCm blogunda her eğitim aşamasının tam ağırlıklarını, veri karışımlarını, eğitim yapılandırmalarını ve çıkarım kodunu yayınladı. Bu açıklık seviyesi (yalnızca son bir kontrol noktası değil, adım adım eğitim) "tamamen açık" bir sürümü tipik bir açık ağırlık sürümünden ayıran şeydir.
Bu Neden Kriterlerin Ötesinde Önemlidir
Sürümün alt metni donanım rekabetidir. Nvidia'nın CUDA ekosistemi ve H100 sınıfı GPU'lar, ileri düzey model eğitimi için varsayılan alt tabaka olmuştur ve rakipler, hızlandırıcılarının tüm eğitim yığınını idare edebileceğini kanıtlamak için yıllarını harcamışlardır. Instella-MoE, halihazırda hiper ölçekleyiciler ve ulusal laboratuvarlar tarafından geniş ölçekte dağıtılan AMD'nin Instinct serisinin iş yüklerinden daha fazlasını yapabileceğine dair güvenilir bir eserdir. AMD, kendi donanımıyla eğitilmiş rekabetçi açık modeller üretmeye devam edebilirse, bu, Nvidia'nın yapay zeka bilgi işlem pazarındaki hakimiyetini kırmak isteyen alıcılar için durumu güçlendirir.
Araştırmacılar için çekicilik şeffaflıktır. Veri karışımını, eğitim ortası karışımını, damıtma stratejisini ve RL müfredatını belgeleyen tamamen açık yayınlar nadir olmaya devam ediyor ve bir laboratuvarın sözüne güvenmek yerine topluluğun iddiaları denetlemesine ve yeniden üretmesine olanak tanıyor. Instella-MoE, AMD'nin daha önceki Instella yoğun modelleri de dahil olmak üzere küçük ama büyüyen bir kadroya katılarak bu standardı ileriye taşıyor.
Yapay Zekanın Önünde Kalın
Bu tür derin teknik kapsamı anında ister misiniz? En son yapay zeka gelişmeleri için merkezimize yer işareti koyun ve hiçbir yayını kaçırmayın.
Daha fazla AI haberini okuyun →

