Un consortium d'instituts de recherche allemands et d'entreprises d'IA a publié Soofi S 30B-A3B, un modèle de langage ouvert qui, selon le projet, obtient les scores les plus élevés aux tests de référence en anglais et en allemand parmi les modèles entièrement ouverts. Coordonnée par le KI Bundesverband, l'association nationale allemande de l'IA, cette version est l'un des premiers grands modèles de langage entièrement formés sur le cloud industriel d'IA de Deutsche Telekom à Munich et se positionne comme une alternative européenne souveraine aux versions ouvertes dominantes des États-Unis et de la Chine. Pour les développeurs qui suivent les derniers développements de l'IA, le lancement se distingue moins par son ampleur brute que par l'efficacité inhabituelle et l'accent mis sur le langage intégré à l'architecture.

Une conception hybride avec seulement 3,2 milliards de paramètres actifs

Soofi S est un modèle mixte d'experts (MoE) avec 31,6 milliards de paramètres au total, mais il n'en active qu'environ 3,2 milliards par jeton généré. Cela rapproche son coût de calcul d'un modèle à 3 milliards de paramètres par rapport à un modèle dense classique de 30 milliards de paramètres, un choix de conception visant à maintenir l'inférence suffisamment bon marché pour fonctionner sur l'infrastructure européenne sans dépendre de fournisseurs de cloud étrangers.

L'architecture est empruntée au Nemotron 3 Nano de Nvidia, combinant les couches Mamba-2 avec des couches d'attention standard dans une disposition hybride. Selon le rapport de pré-formation du projet, seules 6 des 52 couches du modèle conservent un cache clé-valeur (KV), la structure de mémoire qui stocke les jetons précédents pour le calcul de l'attention. Dans les transformateurs conventionnels, ce cache croît linéairement avec la longueur du contexte et devient un goulot d'étranglement majeur lors de l'inférence à contexte long.

Le gain pratique apparaît dans le débit. Avec une longueur de contexte de 40 000 jetons avec 32 requêtes parallèles, Soofi S génère environ huit fois plus de jetons par seconde et par GPU que les modèles denses dans la plage de 14 à 24 milliards de paramètres. Alors que la vitesse de génération des modèles conventionnels diminue fortement à mesure que le contexte évolue, Soofi S reste presque stable, passant de 4 000 jetons à 256 000 jetons. Le seul modèle comparable dans les mesures du consortium est le Qwen3.5 35B-A3B d'Alibaba, qui utilise également une architecture hybride.

Formé à l'allemand, sans sacrifier l'anglais

L'accent délibéré sur l'allemand est au cœur du projet. Dans la première phase de formation, l'allemand représente 7,2 pour cent du mix de données ; dans la deuxième phase, cette part s’élève à 15,3 pour cent. En comparaison, dans la recette de référence Nemotron de Nvidia, toutes les langues autres que l'anglais combinées ne représentent qu'environ 5 % du mix de formation.

Les sources de données comprennent le texte Web allemand du corpus HPLT, le corpus German Commons sous licence ouverte, les parties allemandes de FinePDFs et FineWiki, et les archives Genios sous licence commerciale de 193 millions d'articles de journaux tirés de 916 publications allemandes. Des textes allemands traduits automatiquement et générés de manière synthétique complètent le mélange.

Le modèle a traité environ 27 000 milliards de jetons au cours de trois phases de formation : environ 20 000 milliards de jetons de texte Web large, de code, de mathématiques et de domaine spécifique au cours de la première phase ; environ 6 000 milliards de jetons de meilleure qualité dans le second ; et une troisième phase plus courte étendant la fenêtre contextuelle en utilisant des documents pouvant atteindre un million de jetons.

Résultats du benchmark : en avance en allemand et en anglais, plus faible en mathématiques

Dans les évaluations par rapport à 16 autres modèles ouverts, Soofi S est en tête de tous les modèles entièrement ouverts sur les scores globaux pour l'allemand et l'anglais, selon le consortium. Cela inclut l'OLMo 3 32B de l'Allen Institute for AI et l'Apertus 70B de l'ETH Zurich et de l'EPFL. Par rapport à toutes les références souveraines européennes, le modèle arrive en tête sur tous les indices de référence allemands de la série, parfois avec des marges à deux chiffres.

Sur les tâches de code, Soofi S obtient 73,8 % sur HumanEval, 70,2 sur MBPP et 84,2 sur la variante allemande MBPP – les meilleurs résultats parmi ses pairs open source. Sur INCLUDE-DE, un test de connaissances régionales spécifiques à l'Allemagne, Soofi S est à égalité avec la première place avec 61,2 points avec le plus grand Qwen3.5 35B-A3B. Par rapport à la référence Nemotron, la recette de données pondérées en allemand améliore la maîtrise de la langue de 15,1 points et la référence scientifique GPQA-Diamond de 9,6 points, sans nuire aux performances en anglais.

Il existe des faiblesses évidentes. En mathématiques du concours allemand (Minerva MATH-DE), Soofi S marque 56 points, loin derrière Qwen3.5 35B-A3B à 76,5 et Gemma 3 27B à 65,6. Il est également à la traîne de la recherche factuelle ouverte dans NaturalQuestions, que l'équipe attribue à seulement environ 3 milliards de paramètres actifs et donc moins de connaissances mondiales stockées qu'un modèle dense 27B. Le test RULER en contexte long révèle une autre lacune : lorsque le modèle doit extraire des mots fréquents d'un texte long, son taux de réussite chute à environ 3 % au-delà de 32 000 tokens, alors que le modèle comparable Nemotron parvient toujours à 60 à 64 %.

Formé sur 512 GPU Nvidia B200 à Munich

La formation a eu lieu entre mars et mai 2026 sur un maximum de 512 GPU Nvidia B200 dans l'Industrial AI Cloud de Deutsche Telekom à Munich, totalisant environ 253 000 heures GPU. L'installation fonctionne entièrement à l'énergie renouvelable, est refroidie avec l'eau du canal d'Eisbach et alimente en chaleur résiduelle le quartier environnant du Tucherpark, selon le rapport. Soofi S a été l'une des premières grandes formations réalisées sur cette infrastructure.

Le consortium à l'origine du modèle est financé par le ministère fédéral allemand de l'Économie et de l'Énergie dans le cadre du programme européen IPCEI-CIS. Parmi les participants figurent les instituts Fraunhofer IAIS et IIS, le Centre allemand de recherche sur l'intelligence artificielle (DFKI), la TU Darmstadt, l'Université de Würzburg, le Centre de recherche L3S, l'Université des sciences appliquées de Berlin et les sociétés d'IA Ellamind et Merantix Momentum.

Un débat sur le « surentraînement »

Peu de temps après son lancement, les critiques ont fait valoir que Soofi S était fortement surentraîné par rapport aux normes des lois classiques de mise à l'échelle du Chinchilla publiées par Google DeepMind en 2022, qui suggéraient un point idéal approximatif de 20 jetons par paramètre. Avec 27 000 milliards de jetons et environ 30 milliards de paramètres, Soofi S atterrit à plusieurs centaines de jetons par paramètre ; en ne comptant que les 3,2 milliards de paramètres actifs, le ratio se chiffre en milliers.

Michael Fromm, membre de la direction technique du projet, a rejeté cette critique, arguant que ces règles ne s'appliquent pas aux architectures du MoE. "De nouvelles recherches montrent que les anciennes lois d'échelle des modèles denses ne s'appliquent plus aux architectures MoE", a déclaré Fromm, notant que les experts individuels bénéficient de la visualisation répétée des mêmes documents dans un vaste ensemble de données de haute qualité. À titre de comparaison, il a cité Nvidia, qui a formé ses propres modèles sur jusqu'à 25 000 milliards de jetons.

Ce qui est publié et ce qui ne l'est pas

Les chercheurs publient les poids du modèle ainsi que les points de contrôle intermédiaires sélectionnés, le code complet de formation et d'évaluation, ainsi qu'un inventaire détaillé des données répertoriant le nombre de jetons bruts, les numéros d'époque et les contributions efficaces par source. Selon l'équipe, cela signifie que Soofi S répond à la définition Open Source AI 1.0 de l'Open Source Initiative.

Une proposition plus stricte d'une définition européenne des données ouvertes, qui exigerait que chaque jeton de formation soit librement distribuable, n'est pas satisfaite car 1,3 % de l'ensemble provient du corpus Genios sous licence commerciale. Le rapport indique qu'environ 99 % des données de formation peuvent encore être reconstruites de manière indépendante. La licence exacte pour la sortie du modèle n'avait pas été finalisée au moment de la publication.

Le consortium recherche désormais des partenaires industriels pour la prochaine phase visant à tester Soofi S dans des applications impliquant des documents techniques, la génération de code et des systèmes basés sur des agents. Pour en savoir plus sur les versions de modèles ouverts, l'infrastructure d'IA souveraine et l'écosystème européen d'IA, suivez la couverture de l'industrie de l'IA publiée ici.

Gardez une longueur d'avance sur l'IA open source

Des versions à poids ouvert arrivent presque chaque semaine en provenance de laboratoires aux États-Unis, en Chine et maintenant en Europe, et l'écart entre les plus grands modèles propriétaires et les meilleures alternatives ouvertes ne cesse de se réduire. Suivez les dernières actualités sur l'IA et l'analyse de référence ici pour une image complète.

En savoir plus sur la couverture des modèles d'IA →