Reka Bentuk Campuran Pakar yang Kecil Tetapi Luas
Menurut pecahan terperinci dalam MarkTechPost, Instella-MoE-16B-A3B ialah model MoE penyahkod sahaja dengan 16 bilion jumlah parameter yang mengaktifkan hanya 2.8 bilion setiap token. Setiap daripada 27 lapisannya menggunakan 2 pakar kongsi ditambah 6 pakar dihalakan yang dipilih daripada kumpulan 64, dengan saiz tersembunyi 2048, 16 kepala perhatian dan perbendaharaan kata 128,896 token. Objektif Ramalan Berbilang Token digunakan semasa latihan pra dan pertengahan latihan.
Seni bina yang jarang - di mana sebahagian kecil rangkaian "bangun" untuk setiap token - adalah logik kecekapan yang sama di sebalik model terbuka yang murah untuk dijalankan yang telah membentuk semula pasaran sepanjang tahun lalu. AMD melatih model pada 7.1 trilion token yang diambil daripada korpora terbuka termasuk Nemotron-CC-v2, MegaMath, FineMath, RefineCode dan TxT360, kemudian menjalankan peringkat latihan pertengahan pada Dolma3 Dolmino 100B merentas tiga varian data yang digabungkan mengikut purata berat. Tahap konteks panjang memanjangkan tetingkap daripada 4K kepada 64K token menggunakan YaRN.
Dua Inovasi Peringkat Sistem
Keluaran ini membawa dua pilihan struktur yang ditonjolkan oleh AMD sebagai kemenangan kejuruteraan yang bermakna. Yang pertama ialah Gated Multi-head Latent Attention (MLA Berpagar), yang menambah gerbang keluaran yang dipelajari ringan kepada Multi-head Latent Attention. Unjuran linear khusus memperoleh get bersyarat input yang digunakan secara berganda sebelum unjuran output.
Yang kedua, FarSkip-Collective, ialah skim ketersambungan yang meneruskan pengaktifan lapuk dan separa ke dalam KPM dan lapisan perhatian, yang bertindih komunikasi selari pakar dengan pengiraan. AMD melaporkan 12.7% kelajuan pra-latihan dan sehingga 39.2% pengurangan masa kepada token pertama apabila berkhidmat dengan paralelisme pakar. Bagi syarikat yang memaparkan perkakasannya pada prestasi harga, itu betul-betul nombor yang pembeli mahu lihat.
Penanda Aras Teguh untuk Model Terbuka Sepenuhnya
Di pusat pemeriksaan asas, Instella-MoE purata 76.7 merentas penilaian, yang AMD panggil hasil terkuat dalam kalangan model terbuka sepenuhnya. Itu meletakkannya di hadapan Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) dan OLMoE-1B-7B (61.9), walaupun ia masih mengekori Qwen3.5-4B-Base (79.5). Ia mendahului WinoGrande dengan skor 86.5 dan menyiarkan 65.7 pada HumanEval+. Untuk tugasan konteks panjang, purata 41.5 pada HELMET dan 79.4 pada RULER.
Selepas latihan menajamkan lagi model. Purata markah meningkat daripada 71.58 selepas diselia penalaan halus kepada 72.67 selepas DPO dan 73.22 dalam konfigurasi "Think", mengalahkan Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47) dan Qwen3.5-4B (69.73). Selepas arahan, IFEval meningkat daripada 77.08 kepada 83.70.
Resipi selepas latihan itu sendiri terkenal. Selepas SFT pada campuran Dolci-Think-SFT-7B dan Nemotron, AMD menjalankan DPO dengan kemas kini bias penghala dan kehilangan pengimbangan beban tambahan dilumpuhkan untuk mengelakkan degradasi. Pembelajaran pengukuhan kemudian diteruskan dalam Rangka Kerja Batu AMD: 1,400 langkah RLVR mengikut arahan, diikuti dengan Penyulingan Berbilang Guru Atas Dasar yang melipat gandakan keuntungan tanpa mengorbankan prestasi matematik atau kod.
Tangkapan Pelesenan
Terdapat kaveat yang penting untuk pengguna komersial. Berat model ini dihantar di bawah lesen ResearchRAIL, yang mengehadkan penggunaan kepada tujuan akademik dan penyelidikan sahaja, jadi Instella-MoE bukanlah model drop-in untuk penggunaan pengeluaran. Pangkalan kod latihan, bagaimanapun, adalah MIT berlesen, dan itu boleh dikatakan aset yang lebih boleh digunakan semula — ia memberikan makmal lain pelan tindakan konkrit untuk latihan mengenai silikon AMD.
AMD telah menerbitkan pemberat penuh dari setiap peringkat latihan, campuran data, konfigurasi latihan dan kod inferens merentas koleksi Hugging Face, repositori GitHub dan blog ROCmnya. Tahap keterbukaan itu — peringkat latihan demi peringkat latihan, bukan hanya pusat pemeriksaan terakhir — itulah yang membezakan pelepasan "terbuka sepenuhnya" daripada pelepasan berat terbuka biasa.
Mengapa Ini Penting Melangkaui Penanda Aras
Subteks keluaran ialah persaingan perkakasan. Ekosistem CUDA Nvidia dan GPU kelas H100 telah menjadi substrat lalai untuk latihan model sempadan, dan pencabar telah menghabiskan masa bertahun-tahun mencuba untuk membuktikan pemecut mereka boleh mengendalikan timbunan latihan penuh. Instella-MoE ialah artifak yang boleh dipercayai yang barisan Instinct AMD — telah digunakan secara berskala oleh hyperscaler dan makmal kebangsaan — boleh melakukan lebih daripada beban kerja inferens. Jika AMD boleh terus menghasilkan model terbuka yang kompetitif yang dilatih pada perkakasannya sendiri, ia mengukuhkan keadaan untuk pembeli yang ingin memecahkan cengkaman Nvidia pada pasaran pengiraan AI.
Bagi penyelidik, rayuan adalah ketelusan. Keluaran terbuka sepenuhnya yang mendokumentasikan campuran data, gabungan latihan pertengahan, strategi penyulingan dan kurikulum RL kekal jarang berlaku, dan mereka membenarkan komuniti mengaudit dan menghasilkan semula tuntutan daripada mengambil kata-kata makmal untuknya. Instella-MoE menyertai senarai kecil tetapi semakin berkembang — termasuk model padat Instella AMD yang terdahulu — mendorong standard itu ke hadapan.
Kekal Mendahului AI
Mahukan liputan teknikal yang mendalam seperti ini seperti yang berlaku? Tandai halaman hab kami untuk perkembangan AI terkini dan jangan terlepas keluaran.
Baca lebih banyak berita AI →

