작지만 폭넓은 전문가 조합의 디자인
MarkTechPost의 세부 분석에 따르면 Instella-MoE-16B-A3B는 토큰당 28억 개만 활성화하는 총 160억 매개변수를 갖춘 디코더 전용 MoE 모델입니다. 27개 레이어 각각은 숨겨진 크기 2048, 주의 헤드 16개, 토큰 128,896개 어휘를 갖춘 2명의 공유 전문가와 64명 풀에서 선택된 6명의 라우팅된 전문가를 사용합니다. 멀티 토큰 예측 목표는 사전 훈련과 중간 훈련 모두에서 사용됩니다.각 토큰에 대해 네트워크의 작은 조각이 "깨어나는" 희소 아키텍처는 지난 1년 동안 시장을 재편성한 저렴하게 실행되는 개방형 모델 뒤에 있는 동일한 효율성 논리입니다. AMD는 Nemotron-CC-v2, MegaMath, FineMath, RefineCode 및 TxT360을 포함한 공개 자료에서 가져온 7.1조 토큰에 대해 모델을 훈련한 다음 가중치 평균으로 병합된 세 가지 데이터 변형에 걸쳐 Dolma3 Dolmino 100B에서 중간 훈련 단계를 실행했습니다. 긴 컨텍스트 단계는 YaRN을 사용하여 창을 4K에서 64K 토큰으로 확장합니다.
두 가지 시스템 수준 혁신
이 릴리스에는 AMD가 의미 있는 엔지니어링 승리로 강조하는 두 가지 구조적 선택이 포함되어 있습니다. 첫 번째는 Gated Multi-head Latent Attention(Gated MLA)입니다. 이는 Multi-head Latent Attention에 경량 학습 출력 게이트를 추가합니다. 전용 선형 투영은 출력 투영 전에 곱셈적으로 적용되는 입력 조건 게이트를 파생합니다.
두 번째인 FarSkip-Collective는 오래되고 부분적인 활성화를 MoE 및 Attention 레이어에 전달하여 전문가와 병렬 통신을 계산과 겹치는 연결 방식입니다. AMD는 전문가 병렬 처리를 통해 12.7% 사전 훈련 속도 향상과 최대 1차 토큰 도달 시간 단축 39.2%를 보고했습니다. 가격 대비 성능을 강조하는 회사의 경우 이는 구매자가 보고 싶어하는 수치와 정확히 같습니다.
완전 개방형 모델을 위한 강력한 벤치마크
기본 체크포인트에서 Instella-MoE는 전체 평가에서 평균 76.7을 기록했으며, AMD는 이를 완전 개방형 모델 중에서 가장 강력한 결과라고 부릅니다. 이는 Moonlight-16B-A3B(76.2), SmolLM3-3B-Base(70.5), OLMo-3-7B(70.1) 및 OLMoE-1B-7B(61.9)보다 앞서지만 여전히 Qwen3.5-4B-Base(79.5)에 뒤지고 있습니다. WinoGrande에서는 86.5점으로 선두를 달리고 있으며 HumanEval+에서는 65.7점을 기록하고 있습니다. 긴 컨텍스트 작업의 경우 HELMET에서는 평균 41.5, RULER에서는 79.4입니다.
사후 학습은 모델을 더욱 선명하게 만듭니다. 평균 점수는 감독된 미세 조정 후 71.58에서 DPO 후 72.67로, "Think" 구성에서는 73.22로 올라 Olmo3-7B-Think(71.97), Gemma-4-E4B Think(70.47) 및 Qwen3.5-4B(69.73)를 제쳤습니다. 명령을 따르면 IFEval은 77.08에서 83.70으로 증가합니다.
훈련 후 레시피는 그 자체로 주목할 만합니다. Dolci-Think-SFT-7B 및 Nemotron 혼합에서 SFT를 수행한 후 AMD는 성능 저하를 방지하기 위해 라우터 바이어스 업데이트 및 보조 로드 밸런싱 손실을 비활성화한 상태로 DPO를 실행합니다. 그런 다음 강화 학습은 AMD의 Miles 프레임워크 내에서 진행됩니다. 지침을 따르는 RLVR의 1,400단계와 수학 또는 코드 성능을 희생하지 않고 이득을 다시 줄이는 Multi-Teacher On-Policy Distillation이 이어집니다.
라이선스 문제
상업용 사용자에게는 중요한 주의 사항이 있습니다. 모델 가중치는 학술 및 연구 목적으로만 사용을 제한하는 ResearchRAIL 라이센스에 따라 제공되므로 Instella-MoE는 프로덕션 배포를 위한 드롭인 모델이 아닙니다. 그러나 교육 코드베이스는 MIT 라이선스이며 재사용 가능성이 더 높은 자산입니다. 이는 다른 연구실에 AMD 실리콘 교육을 위한 구체적인 청사진을 제공합니다.
AMD는 Hugging Face 컬렉션, GitHub 저장소 및 ROCm 블로그 전반에 걸쳐 모든 훈련 단계, 데이터 혼합, 훈련 구성 및 추론 코드의 전체 가중치를 게시했습니다. 최종 체크포인트가 아닌 훈련 단계별 개방성 수준이 "완전 개방형" 릴리스와 일반적인 개방형 릴리스를 구별하는 요소입니다.
이것이 벤치마크를 넘어서 중요한 이유
릴리스의 하위 텍스트는 하드웨어 경쟁입니다. Nvidia의 CUDA 생태계와 H100급 GPU는 개척 모델 훈련의 기본 기반이었으며, 도전자들은 가속기가 전체 훈련 스택을 처리할 수 있음을 입증하기 위해 수년을 보냈습니다. Instella-MoE는 이미 하이퍼스케일러 및 국립 연구소에 의해 대규모로 배포된 AMD의 Instinct 라인이 추론 워크로드 이상의 기능을 수행할 수 있는 신뢰할 수 있는 아티팩트입니다. AMD가 자체 하드웨어에서 훈련된 경쟁력 있는 개방형 모델을 계속 생산할 수 있다면 AI 컴퓨팅 시장에서 Nvidia의 지배력을 깨고자 하는 구매자의 사례가 강화됩니다.
연구자에게 있어 매력은 투명성입니다. 데이터 혼합, 중간 훈련 혼합, 증류 전략 및 RL 커리큘럼을 문서화하는 완전 공개 릴리스는 여전히 드물며, 실험실의 말을 받아들이는 대신 커뮤니티가 주장을 감사하고 재현할 수 있도록 합니다. Instella-MoE는 AMD의 초기 Instella 고밀도 모델을 포함하여 작지만 성장하는 명단에 합류하여 해당 표준을 추진하고 있습니다.
AI보다 앞서 나가세요
이런 종류의 심층적인 기술 지원을 원하시나요? 최신 AI 개발에 대한 허브를 북마크에 추가하고 릴리스를 놓치지 마세요.
AI 뉴스 자세히 보기 →

