Desain Campuran Pakar yang Kecil Namun Luas
Menurut perincian mendetail di MarkTechPost, Instella-MoE-16B-A3B adalah model MoE khusus dekoder dengan 16 miliar total parameter yang hanya mengaktifkan 2,8 miliar per token. Masing-masing dari 27 lapisannya menggunakan 2 pakar bersama ditambah 6 pakar yang diarahkan yang dipilih dari kumpulan 64, dengan ukuran tersembunyi 2048, 16 kepala perhatian, dan 128.896 token kosakata. Tujuan Prediksi Multi-Token digunakan selama pra-pelatihan dan pertengahan pelatihan.
Arsitektur yang jarang tersebut – di mana sepotong kecil jaringan “terbangun” untuk setiap token – adalah logika efisiensi yang sama di balik model terbuka yang murah untuk dijalankan yang telah mengubah bentuk pasar selama setahun terakhir. AMD melatih model tersebut pada 7,1 triliun token yang diambil dari corpora terbuka termasuk Nemotron-CC-v2, MegaMath, FineMath, RefineCode, dan TxT360, lalu menjalankan tahap pertengahan pelatihan pada Dolma3 Dolmino 100B di tiga varian data yang digabungkan berdasarkan rata-rata bobot. Tahap konteks panjang memperluas jendela dari 4K menjadi 64K token menggunakan YaRN.
Dua Inovasi Tingkat Sistem
Rilisan ini membawa dua pilihan struktural yang disorot AMD sebagai kemenangan teknis yang berarti. Yang pertama adalah Gated Multi-head Latent Attention (Gated MLA), yang menambahkan gerbang keluaran pembelajaran ringan ke Multi-head Latent Attention. Proyeksi linier khusus memperoleh gerbang pengkondisian masukan yang diterapkan secara multiplikatif sebelum proyeksi keluaran.
Yang kedua, FarSkip-Collective, adalah skema konektivitas yang meneruskan aktivasi parsial dan usang ke dalam lapisan MoE dan perhatian, yang tumpang tindih dengan komunikasi paralel pakar dengan komputasi. AMD melaporkan 12,7% percepatan pra-pelatihan dan pengurangan waktu hingga token pertama hingga 39,2%** saat melayani dengan paralelisme ahli. Bagi perusahaan yang memasarkan perangkat kerasnya berdasarkan harga-kinerja, angka-angka tersebut adalah angka-angka yang ingin dilihat oleh pembeli.
Tolok Ukur Kuat untuk Model Terbuka Sepenuhnya
Pada titik pemeriksaan dasar, rata-rata Intella-MoE adalah 76,7 di seluruh evaluasi, yang oleh AMD disebut sebagai hasil terkuat di antara model yang sepenuhnya terbuka. Itu menempatkannya di depan Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1), dan OLMoE-1B-7B (61.9), meskipun masih tertinggal dari Qwen3.5-4B-Base (79.5). Ini memimpin di WinoGrande dengan skor 86,5 dan memposting 65,7 di HumanEval+. Untuk tugas konteks panjang, rata-ratanya adalah 41,5 pada HELMET dan 79,4 pada RULER.
Pasca pelatihan semakin mempertajam model tersebut. Skor rata-rata naik dari 71,58 setelah penyempurnaan yang diawasi menjadi 72,67 setelah DPO dan 73,22 dalam konfigurasi "Think", mengalahkan Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47), dan Qwen3.5-4B (69,73). Jika mengikuti instruksi, IFEval meningkat dari 77,08 menjadi 83,70.
Resep pasca-pelatihan itu sendiri terkenal. Setelah SFT pada campuran Dolci-Think-SFT-7B dan Nemotron, AMD menjalankan DPO dengan pembaruan bias router dan kehilangan penyeimbangan beban tambahan dinonaktifkan untuk menghindari degradasi. Pembelajaran penguatan kemudian dilanjutkan dalam kerangka kerja Miles AMD: 1.400 langkah RLVR yang mengikuti instruksi, diikuti dengan Distilasi Kebijakan Multi-Guru yang melipatgandakan keuntungan tanpa mengorbankan kinerja matematika atau kode.
Tangkapan Lisensi
Ada peringatan yang penting bagi pengguna komersial. Model bobot ini dikirimkan di bawah lisensi ResearchRAIL, yang membatasi penggunaan hanya untuk tujuan akademis dan penelitian, sehingga Intella-MoE bukan model drop-in untuk penerapan produksi. Namun, basis kode pelatihannya adalah berlisensi MIT, dan bisa dibilang ini merupakan aset yang lebih dapat digunakan kembali — ini memberikan cetak biru konkrit bagi laboratorium lain untuk pelatihan tentang silikon AMD.
AMD telah mempublikasikan bobot lengkap dari setiap tahap pelatihan, campuran data, konfigurasi pelatihan, dan kode inferensi di seluruh koleksi Hugging Face, repositori GitHub, dan blog ROCm-nya. Tingkat keterbukaan tersebut — tahap pelatihan demi tahap pelatihan, bukan sekadar titik pemeriksaan akhir — adalah apa yang membedakan rilisan "terbuka penuh" dari rilisan open-weight pada umumnya.
Mengapa Hal Ini Penting Di Luar Tolok Ukur
Subteks dari rilis ini adalah persaingan perangkat keras. Ekosistem CUDA Nvidia dan GPU kelas H100 telah menjadi substrat default untuk pelatihan model frontier, dan para penantang telah menghabiskan waktu bertahun-tahun untuk mencoba membuktikan akselerator mereka dapat menangani tumpukan pelatihan penuh. Instella-MoE adalah artefak yang kredibel bahwa lini Instinct AMD — yang telah diterapkan dalam skala besar oleh hyperscaler dan laboratorium nasional — dapat melakukan lebih dari sekadar beban kerja inferensi. Jika AMD dapat terus memproduksi model terbuka kompetitif yang dilatih pada perangkat kerasnya sendiri, hal ini akan memperkuat argumen bagi pembeli yang ingin mematahkan cengkeraman Nvidia di pasar komputasi AI.
Bagi peneliti, daya tariknya adalah transparansi. Rilisan terbuka yang mendokumentasikan campuran data, campuran di tengah-tengah pelatihan, strategi distilasi, dan kurikulum RL masih jarang terjadi, dan membiarkan komunitas mengaudit dan mereproduksi klaim daripada hanya mempercayai kata-kata laboratorium. Instella-MoE bergabung dengan grup kecil namun terus berkembang — termasuk model padat Instella milik AMD sebelumnya — yang mendorong standar tersebut ke depan.
Tetap Terdepan dalam AI
Ingin liputan teknis mendalam seperti ini yang terjadi? Tandai hub kami untuk perkembangan AI terbaru dan jangan pernah melewatkan rilisnya.
Baca berita AI selengkapnya →

