Un consorcio de instituciones de investigación alemanas y empresas de inteligencia artificial ha lanzado Soofi S 30B-A3B, un modelo de lenguaje abierto que, según el proyecto, logra las puntuaciones más altas en los puntos de referencia en inglés y alemán entre los modelos totalmente abiertos. Coordinado por KI Bundesverband, la asociación nacional de IA de Alemania, el lanzamiento es uno de los primeros grandes modelos de lenguaje entrenados íntegramente en la Nube de IA industrial de Deutsche Telekom en Munich y se posiciona como una alternativa europea soberana a los lanzamientos de peso abierto dominantes de Estados Unidos y China. Para los desarrolladores que siguen los últimos desarrollos de IA, el lanzamiento se destaca menos por la escala bruta que por la eficiencia inusual y el enfoque del lenguaje integrado en la arquitectura.

Un diseño híbrido con sólo 3.200 millones de parámetros activos

Soofi S es un modelo de combinación de expertos (MoE) con 31,6 mil millones de parámetros en total, pero activa solo alrededor de 3,2 mil millones por token generado. Eso acerca su costo de computación a un modelo de 3 mil millones de parámetros que a un modelo denso convencional de 30 mil millones de parámetros, una elección de diseño destinada a mantener la inferencia lo suficientemente barata como para ejecutarse en la infraestructura europea sin depender de proveedores de nube extranjeros.

La arquitectura está tomada del Nemotron 3 Nano de Nvidia, combinando capas Mamba-2 con capas de atención estándar en un diseño híbrido. Según el informe de preentrenamiento del proyecto, solo 6 de las 52 capas del modelo mantienen un caché de valor clave (KV), la estructura de memoria que almacena tokens anteriores para el cálculo de la atención. En los transformadores convencionales, ese caché crece linealmente con la longitud del contexto y se convierte en un cuello de botella importante durante la inferencia de contexto largo.

La recompensa práctica se manifiesta en el rendimiento. Con una longitud de contexto de 40.000 tokens con 32 solicitudes paralelas, Soofi S genera aproximadamente ocho veces más tokens por segundo por GPU que los modelos densos en el rango de 14 a 24 mil millones de parámetros. Mientras que la velocidad de generación de los modelos convencionales cae drásticamente a medida que crece el contexto, Soofi S se mantiene casi estable desde 4.000 tokens hasta 256.000 tokens. El único modelo comparable en las mediciones del consorcio es el Qwen3.5 35B-A3B de Alibaba, que también utiliza una arquitectura híbrida.

Formado en alemán, sin renunciar al inglés.

La atención deliberada al alemán es fundamental para el proyecto. En la primera fase de formación, el alemán representa el 7,2 por ciento de la combinación de datos; en la segunda fase, esa proporción aumenta al 15,3 por ciento. En comparación, en la receta de referencia Nemotron de Nvidia, todos los idiomas distintos del inglés combinados representan sólo alrededor del 5 por ciento de la combinación de entrenamiento.

Las fuentes de datos incluyen texto web alemán del corpus HPLT, el corpus German Commons con licencia abierta, partes alemanas de FinePDFs y FineWiki, y el archivo Genios con licencia comercial de 193 millones de artículos periodísticos extraídos de 916 publicaciones alemanas. Textos en alemán traducidos automáticamente y generados sintéticamente completan la mezcla.

El modelo procesó aproximadamente 27 billones de tokens en tres fases de entrenamiento: alrededor de 20 billones de tokens de web amplia, código, matemáticas y texto de dominio específico en la primera fase; alrededor de 6 billones de tokens de mayor calidad en el segundo; y una tercera fase más corta que amplía la ventana de contexto utilizando documentos de hasta un millón de tokens de longitud.

Resultados de las pruebas comparativas: adelante en alemán e inglés, peor en matemáticas

Según el consorcio, en las evaluaciones frente a otros 16 modelos abiertos, Soofi S lidera todos los modelos completamente abiertos en puntuaciones agregadas tanto en alemán como en inglés. Eso incluye OLMo 3 32B del Instituto Allen de IA y Apertus 70B de ETH Zurich y EPFL. Frente a todas las referencias soberanas europeas, el modelo sale adelante en todos los puntos de referencia alemanes del conjunto, a veces por márgenes de dos dígitos.

En tareas de código, Soofi S obtiene una puntuación del 73,8 por ciento en HumanEval, 70,2 en MBPP y 84,2 en la variante alemana MBPP, los mejores resultados entre sus pares de código abierto. En INCLUDE-DE, una prueba de conocimientos regionales específicos de Alemania, Soofi S empata en el primer lugar con 61,2 puntos con el Qwen3.5 35B-A3B más grande. En comparación con la línea de base de Nemotron, la receta de datos ponderados en alemán mejora el dominio del idioma en 15,1 puntos y el punto de referencia científico GPQA-Diamond en 9,6 puntos, sin perjudicar el rendimiento en inglés.

Hay debilidades claras. En la competición alemana de matemáticas (Minerva MATH-DE), Soofi S obtiene 56 puntos, muy por detrás de Qwen3.5 35B-A3B con 76,5 y Gemma 3 27B con 65,6. También va a la zaga en la recuperación abierta de hechos en NaturalQuestions, que el equipo atribuye a tener sólo alrededor de 3 mil millones de parámetros activos y, por lo tanto, menos conocimiento mundial almacenado que un modelo denso 27B. La prueba de contexto largo RULER descubre otra brecha: cuando el modelo tiene que extraer palabras que aparecen con frecuencia de un texto largo, su tasa de acierto cae a alrededor del 3 por ciento más allá de 32.000 tokens, mientras que el modelo Nemotron comparable todavía logra entre el 60 y el 64 por ciento.

Capacitado en 512 GPU Nvidia B200 en Munich

La capacitación se llevó a cabo entre marzo y mayo de 2026 en hasta 512 GPU Nvidia B200 en la nube de IA industrial de Deutsche Telekom en Munich, con un total de aproximadamente 253.000 horas de GPU. Según el informe, la instalación funciona íntegramente con energía renovable, se enfría con agua del canal Eisbach y suministra calor residual al barrio circundante de Tucherpark. Soofi S fue uno de los primeros grandes entrenamientos realizados en esta infraestructura.

El consorcio detrás del modelo está financiado por el Ministerio Federal de Economía y Energía de Alemania como parte del programa europeo IPCEI-CIS. Entre los participantes se incluyen los Institutos Fraunhofer IAIS e IIS, el Centro Alemán de Investigación de Inteligencia Artificial (DFKI), TU Darmstadt, la Universidad de Würzburg, el Centro de Investigación L3S, la Universidad de Ciencias Aplicadas de Berlín y las empresas de inteligencia artificial Ellamind y Merantix Momentum.

Un debate sobre el 'sobreentrenamiento'

Poco después del lanzamiento, los críticos argumentaron que Soofi S estaba muy sobreentrenado según los estándares de las clásicas leyes de escalamiento de Chinchilla publicadas por Google DeepMind en 2022, que sugerían un punto óptimo aproximado de 20 tokens por parámetro. Con 27 billones de tokens y aproximadamente 30 mil millones de parámetros, Soofi S obtiene varios cientos de tokens por parámetro; contando sólo los 3.200 millones de parámetros activos, la proporción aumenta a miles.

Michael Fromm, parte del liderazgo técnico del proyecto, rechazó esa crítica, argumentando que esas reglas no se aplican a las arquitecturas del MoE. "Hay nuevas investigaciones que muestran que las antiguas leyes de escala de modelos densos ya no se aplican a las arquitecturas MoE", dijo Fromm, señalando que los expertos individuales se benefician al ver los mismos documentos repetidamente en un conjunto de datos grande y de alta calidad. Como punto de comparación, señaló a Nvidia, que ha entrenado sus propios modelos con hasta 25 billones de tokens.

Qué se publica y qué no

Los investigadores están publicando pesos de modelo junto con puntos de control intermedios seleccionados, el código completo de capacitación y evaluación, y un inventario de datos detallado que enumera recuentos de tokens sin procesar, números de época y contribuciones efectivas por fuente. Según el equipo, esto significa que Soofi S cumple con la definición de IA de código abierto 1.0 de la Open Source Initiative.

Una propuesta más estricta para una definición europea de datos abiertos, que requeriría que cada token de capacitación fuera libremente distribuible, no se cumple porque el 1,3 por ciento de la combinación proviene del corpus Genios con licencia comercial. El informe dice que alrededor del 99 por ciento de los datos de entrenamiento aún pueden reconstruirse de forma independiente. La licencia exacta para el lanzamiento del modelo no se había finalizado en el momento de la publicación.

El consorcio ahora está buscando socios industriales para la siguiente fase para probar Soofi S en aplicaciones que involucran documentos técnicos, generación de código y sistemas basados ​​en agentes. Para obtener más información sobre los lanzamientos de modelos abiertos, la infraestructura soberana de IA y el ecosistema europeo de IA, manténgase al día con la cobertura de la industria de la IA publicada aquí.

Manténgase a la vanguardia en IA de código abierto

Los lanzamientos de peso abierto llegan casi semanalmente desde laboratorios de Estados Unidos, China y ahora Europa, y la brecha entre los modelos propietarios más grandes y las mejores alternativas abiertas sigue reduciéndose. Siga las últimas noticias sobre IA y el análisis comparativo aquí para obtener una imagen completa.

Leer más cobertura del modelo de IA →