AMD は、独自の Instinct MI300X および MI325X GPU でゼロからトレーニングされた完全にオープンな Mixture-of-Experts (MoE) 言語モデルである Instella-MoE-16B-A3B をリリースしました。このリリースは、ソフトウェアに関するものであると同時に、シリコンに関する声明でもあります。AMD は、すべてのトレーニング ステージ、データ混合、構成を公開することで、自社のデータセンター アクセラレータがフロンティア クラスのオープン モデルをエンドツーエンドで構築できることを実証しています。この領域は Nvidia が長い間支配してきた領域です。これは、AI ニュース速報 で追跡している無差別級レースにおける最も鋭い動きの 1 つです。

小規模だが広範な専門家の混合デザイン

MarkTechPost の詳細な内訳によると、Instella-MoE-16B-A3B は、合計 160 億のパラメータを備えたデコーダ専用の MoE モデルで、トークンごとに 28 億のみをアクティブにします。その 27 レイヤーのそれぞれは、2 人の共有エキスパートと 64 人のプールから選択された 6 人のルーティングされたエキスパートを使用し、隠れサイズは 2048、16 のアテンション ヘッド、および 128,896 トークンの語彙を持ちます。 マルチトークン予測 目標は、トレーニング前とトレーニング中の両方で使用されます。

この疎なアーキテクチャ (ネットワークのごく一部がトークンごとに「ウェイクアップ」する) は、過去 1 年間に市場を再形成した低コストのオープン モデルの背後にある効率ロジックと同じです。 AMD は、Nemotron-CC-v2、MegaMath、FineMath、RefineCode、TxT360 などのオープン コーパスから抽出された 7.1 兆トークンでモデルをトレーニングし、その後、重み付け平均によってマージされた 3 つのデータ バリアントにわたって Dolma3 Dolmino 100B で中間トレーニング ステージを実行しました。ロングコンテキストのステージでは、YaRN を使用してウィンドウを 4K から 64K トークンに拡張します。

2 つのシステムレベルのイノベーション

このリリースには、AMD が重要なエンジニアリングの勝利として強調している 2 つの構造上の選択肢があります。 1 つ目は ゲート型マルチヘッド潜在的注意 (ゲート型 MLA) で、軽量の学習済み出力ゲートをマルチヘッド潜在的注意に追加します。専用の線形投影は、出力投影の前に乗算的に適用される入力条件付きゲートを導出します。

2 つ目の FarSkip-Collective は、時代遅れの部分的なアクティベーションを MoE 層とアテンション層に渡し、エキスパートと並列通信を計算とオーバーラップさせる接続スキームです。 AMD は、エキスパート並列処理を使用した場合、事前トレーニングの速度が 12.7% 向上し、最初のトークンまでの時間が最大で 39.2% 短縮**されたと報告しています。価格パフォーマンスを重視してハードウェアを売り込む企業にとって、これらはまさに購入者が見たい数字です。

フルオープンモデルの強力なベンチマーク

基本チェックポイントでは、Instella-MoE は評価全体で平均 76.7 を達成しており、AMD はこれを完全オープン モデルの中で最も強い結果と呼んでいます。これにより、Moonlight-16B-A3B (76.2)、SmolLM3-3B-Base (70.5)、OLMo-3-7B (70.1)、OLMoE-1B-7B (61.9) よりも上位になりますが、それでも Qwen3.5-4B-Base (79.5) には及ばないことになります。 WinoGrande では 86.5 のスコアでリードし、HumanEval+ では 65.7 を記録しています。長いコンテキストのタスクの場合、HELMET では平均 41.5、RULER では 79.4 です。

トレーニング後のモデルはさらにシャープになります。平均スコアは、監視付き微調整後の 71.58 から、DPO 後の 72.67、「Think」構成では 73.22 に上昇し、Olmo3-7B-Think (71.97)、Gemma-4-E4B Think (70.47)、および Qwen3.5-4B (69.73) を上回りました。指示に従うと、IFEval は 77.08 から 83.70 に上昇します。

トレーニング後のレシピ自体が注目に値します。 Dolci-Think-SFT-7B と Nemotron の混合物で SFT を実行した後、AMD はルーター バイアスの更新と、劣化を避けるために補助負荷分散損失を無効にして DPO を実行します。その後、AMD の マイル フレームワーク内で強化学習が進行します。つまり、命令に従う RLVR の 1,400 ステップに続いて、数学やコードのパフォーマンスを犠牲にすることなくゲインを折り返す 複数教師によるポリシー蒸留 が続きます。

ライセンスの落とし穴

商用ユーザーにとって重要な注意事項があります。モデルの重みは ResearchRAIL ライセンスに基づいて出荷され、学術および研究目的のみに使用が制限されます。そのため、Instella-MoE は運用環境へのドロップイン モデルではありません。ただし、トレーニング コードベースは MIT ライセンスであり、おそらくそれがより再利用可能な資産であり、他のラボに AMD シリコンでのトレーニングのための具体的な青写真を提供します。

AMD は、Hugging Face コレクション、GitHub リポジトリ、ROCm ブログ全体で、すべてのトレーニング ステージからの完全な重み、データ混合、トレーニング構成、推論コードを公開しています。最終チェックポイントだけでなく、トレーニング段階ごとのオープン性のレベルが、「完全にオープン」なリリースと典型的な無差別級リリースを区別するものです。

これがベンチマークを超えて重要である理由

このリリースの主旨はハードウェア競争です。 Nvidia の CUDA エコシステムと H100 クラスの GPU は、フロンティア モデル トレーニングのデフォルトの基板となっており、挑戦者たちは、自社のアクセラレータがトレーニング スタック全体を処理できることを証明するために何年も費やしてきました。 Instella-MoE は、AMD の Instinct ライン (すでにハイパースケーラーや国立研究所によって大規模に導入されている) が推論ワークロード以上のことを実行できる、信頼できる成果物です。 AMDが自社のハードウェアでトレーニングされた競争力のあるオープンモデルを生産し続けることができれば、AIコンピューティング市場におけるNvidiaの支配を打破したいと考えているバイヤーにとっての主張が強化されることになる。

研究者にとっての魅力はその透明性です。データミックス、中間トレーニングブレンド、蒸留戦略、RLカリキュラムを文書化した完全にオープンなリリースは依然として稀であり、研究室の言葉を鵜呑みにするのではなく、コミュニティが主張を監査して再現できるようにしています。 Instella-MoE は、AMD 独自の初期の Instella 高密度モデルを含む小規模ながら成長を続ける企業に加わり、その標準を推進します。

AI の一歩先を行く

このような詳細な技術的な内容を随時知りたいですか? 最新の AI 開発 のハブをブックマークして、リリースを見逃すことはありません。

AIニュースをもっと読む→