Un diseño pequeño pero amplio de una mezcla de expertos
Según un desglose detallado en MarkTechPost, Instella-MoE-16B-A3B es un modelo MoE solo decodificador con 16 mil millones de parámetros totales que activa solo 2,8 mil millones por token. Cada una de sus 27 capas utiliza 2 expertos compartidos más 6 expertos enrutados seleccionados de un grupo de 64, con un tamaño oculto de 2048, 16 cabezas de atención y un vocabulario de 128,896 tokens. Se utiliza un objetivo de Predicción de tokens múltiples durante el pre-entrenamiento y durante el mismo.
Esa arquitectura dispersa -donde una pequeña porción de la red "se despierta" para cada token- es la misma lógica de eficiencia detrás de los modelos abiertos baratos de ejecutar que han remodelado el mercado durante el año pasado. AMD entrenó el modelo en 7,1 billones de tokens extraídos de corpus abiertos, incluidos Nemotron-CC-v2, MegaMath, FineMath, RefineCode y TxT360, luego ejecutó una etapa intermedia de entrenamiento en Dolma3 Dolmino 100B en tres variantes de datos que se fusionaron mediante un promedio de peso. Una etapa de contexto largo extiende la ventana de 4K a 64K tokens usando YaRN.
Dos innovaciones a nivel de sistemas
El lanzamiento incluye dos opciones estructurales que AMD destaca como importantes victorias en ingeniería. La primera es Atención latente de múltiples cabezas cerrada (MLA cerrada), que agrega una puerta de salida aprendida liviana a la Atención latente de múltiples cabezas. Una proyección lineal dedicada deriva una puerta condicionada por la entrada que se aplica multiplicativamente antes de la proyección de salida.
El segundo, FarSkip-Collective, es un esquema de conectividad que transfiere activaciones obsoletas y parciales a las capas MoE y de atención, superponiendo la comunicación paralela de expertos con la computación. AMD informa una aceleración previa al entrenamiento del 12,7 % y hasta una reducción del 39,2 % en el tiempo hasta el primer token cuando se ofrece con paralelismo experto. Para una empresa que ofrece su hardware en función de la relación precio-rendimiento, esos son exactamente los números que un comprador quiere ver.
Puntos de referencia sólidos para un modelo totalmente abierto
En el punto de control básico, Instella-MoE promedia 76,7 en todas las evaluaciones, lo que AMD considera el resultado más sólido entre los modelos completamente abiertos. Eso lo coloca por delante de Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) y OLMoE-1B-7B (61,9), aunque todavía está por detrás de Qwen3.5-4B-Base (79,5). Lidera en WinoGrande con una puntuación de 86,5 y registra 65,7 en HumanEval+. Para tareas de contexto prolongado, tiene un promedio de 41,5 en HELMET y 79,4 en RULER.
El post-entrenamiento afina aún más el modelo. Las puntuaciones promedio aumentan de 71,58 después de un ajuste supervisado a 72,67 después de DPO y 73,22 en la configuración "Think", superando a Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) y Qwen3.5-4B (69,73). Al seguir instrucciones, el IFEval sube de 77,08 a 83,70.
La receta post-entrenamiento es en sí misma notable. Después de SFT en las mezclas Dolci-Think-SFT-7B y Nemotron, AMD ejecuta DPO con actualizaciones de polarización del enrutador y la pérdida de equilibrio de carga auxiliar deshabilitada para evitar la degradación. Luego, el aprendizaje por refuerzo continúa dentro del marco Miles de AMD: 1,400 pasos de RLVR que siguen instrucciones, seguidos de una Destilación basada en políticas de múltiples maestros que vuelve a incorporar la ganancia sin sacrificar el rendimiento de las matemáticas o el código.
El problema de las licencias
Hay una advertencia que es importante para los usuarios comerciales. Los pesos del modelo se envían bajo una licencia de ResearchRAIL, que restringe su uso únicamente con fines académicos y de investigación, por lo que Instella-MoE no es un modelo directo para implementaciones de producción. Sin embargo, el código base de capacitación tiene licencia MIT, y ese es posiblemente el activo más reutilizable: brinda a otros laboratorios un modelo concreto para la capacitación en silicio AMD.
AMD ha publicado los pesos completos de cada etapa de entrenamiento, las combinaciones de datos, las configuraciones de entrenamiento y el código de inferencia en una colección de Hugging Face, un repositorio de GitHub y su blog ROCm. Ese nivel de apertura (entrenamiento etapa por etapa de entrenamiento, no solo un punto de control final) es lo que distingue una versión "totalmente abierta" de una típica de peso abierto.
Por qué esto es importante más allá de los puntos de referencia
El trasfondo del comunicado es la competencia de hardware. El ecosistema CUDA de Nvidia y las GPU de clase H100 han sido el sustrato predeterminado para el entrenamiento de modelos de frontera, y los retadores han pasado años tratando de demostrar que sus aceleradores pueden manejar toda la pila de entrenamiento. Instella-MoE es un artefacto creíble de que la línea Instinct de AMD, ya implementada a escala por hiperescaladores y laboratorios nacionales, puede hacer más que cargas de trabajo de inferencia. Si AMD puede seguir produciendo modelos abiertos competitivos entrenados en su propio hardware, fortalecerá los argumentos para los compradores que buscan romper el control de Nvidia en el mercado de computación de IA.
Para los investigadores, el atractivo es la transparencia. Las publicaciones completamente abiertas que documentan la combinación de datos, la combinación de capacitación intermedia, la estrategia de destilación y el plan de estudios de RL siguen siendo raras, y permiten que la comunidad audite y reproduzca afirmaciones en lugar de confiar en la palabra de un laboratorio. Instella-MoE se une a una lista pequeña pero creciente, que incluye los modelos densos Instella anteriores de AMD, impulsando ese estándar.
Manténgase por delante de la IA
¿Quiere este tipo de cobertura técnica profunda a medida que sucede? Marque nuestro centro para conocer los últimos desarrollos de IA y no se pierda ningún lanzamiento.
Leer más noticias sobre IA →

