La société allemande d'IA Aleph Alpha a publié Kolibri, un modèle linguistique ouvert de mélange d'experts conçu à partir de zéro pour l'allemand et l'anglais. Le modèle contient 78,1 milliards de paramètres au total, mais n'en active que 3,46 milliards par jeton – environ 4,4 % – et est livré sous la licence permissive Apache 2.0 sur Hugging Face. Il accepte jusqu'à 1 048 576 jetons de contexte et permet aux utilisateurs de définir un effort de raisonnement par requête. Pour les lecteurs qui suivent l'écosystème des poids ouverts, cela arrive aux côtés de nos derniers développements en matière d'IA.
Ce communiqué est une déclaration délibérée sur la manière dont Aleph Alpha envisage son marché : un déploiement souverain dans des secteurs réglementés tels que l'administration publique, l'industrie et l'aérospatiale, où savoir exactement où un modèle a été formé, sur quelles données et dans quel cadre juridique n'est pas un avantage mais une exigence d'approvisionnement.
Qu'est-ce que Kolibri en réalité
Kolibri, referred to as Kolibri-1 in the technical materials, is a bilingual English-German MoE transformer that Aleph Alpha says was developed end to end by teams in Germany. Selon le rapport de recherche technique de l'entreprise, l'équipe contrôlait l'ensemble du pipeline (données, architecture, infrastructure de formation, post-formation et évaluation) plutôt que de partir du point de contrôle d'un autre laboratoire.
La formation s'est déroulée sur des infrastructures situées en Allemagne et en Finlande. Le processus de conception visait explicitement la conformité au code de bonnes pratiques de l’UE en matière d’IA à usage général, à la loi de l’UE sur l’IA et au RGPD, et Aleph Alpha est signataire de ce code. La société affirme que son pipeline de données supprime les données personnelles avant la formation, un détail destiné directement aux acheteurs du secteur public qui ne peuvent pas légalement intégrer les données des citoyens dans des modèles dont la provenance n'est pas claire.
Il fonctionne sur un seul GPU
La déployabilité était clairement une contrainte de conception et non une réflexion après coup. Le point de contrôle FP8 pèse environ 78 Go et fonctionne sur un seul NVIDIA B200, B300 ou H200 – ou sur deux GPU H100 SXM5 – servis via vLLM avec un raisonnement Kolibri dédié et des analyseurs d'appels d'outils. Pour un modèle de 78 milliards de paramètres, cela représente une empreinte matérielle modeste, et c'est le résultat direct de la conception MoE clairsemée : avec seulement 3,46 milliards de paramètres actifs par jeton, le coût d'inférence suit le nombre de paramètres actifs plutôt que le total.
Experts clairsemés et attention hybride
Sous le capot, Kolibri empile 50 blocs transformateurs d'une largeur de modèle de 2 560. Chaque couche MoE note les 384 experts routés avec un routeur sigmoïde, envoie chaque jeton au top 6 et exécute toujours 1 expert partagé à leurs côtés. La charge des experts est équilibrée à l'aide de deux techniques portant des noms alphabétiques (Équilibrage quantile exact et Injection d'erreur de charge) qui empêchent le routeur de concentrer tout le trafic sur une poignée de spécialistes.
C'est là que l'architecture devient plus intéressante. Kolibri utilise une attention de requête groupée avec 48 têtes de requête et 4 têtes KV, mais les couches ne sont pas uniformes : un bloc sur cinq utilise une attention complète sans codage positionnel, tandis que les 40 autres blocs utilisent une attention à fenêtre glissante sur les 512 jetons précédents, avec RoPE. La conséquence pratique est l'efficacité de la mémoire : les couches à fenêtre coulissante contiennent un cache KV de taille fixe, de sorte que seules 10 des 50 couches grandissent avec la longueur du contexte. En calcul apparié, Aleph Alpha rapporte que la conception hybride prend en charge des séquences quatre fois plus longues qu'un modèle équivalent à pleine attention. C'est ainsi qu'un modèle de cette taille revendique une fenêtre contextuelle d'un million de jetons sans infrastructure exotique.
Un tokenizer conçu pour l'allemand
La plupart des tokeniseurs de frontières traitent l'allemand après coup, divisant ses longs mots composés en fragments qui gonflent le nombre de jetons et les coûts effectifs. Aleph Alpha a attaqué ce problème directement avec UniBPE, un vocabulaire de 128 000 jetons qui construit des fusions comme le fait BPE mais marque chaque fusion par une perte Unigram.
Les chiffres plaident en faveur de cette situation. Sur le texte allemand, le tokenizer de Kolibri atteint 4,90 octets par token, contre 4,35 pour le tokenizer GPT-5, ce qui signifie 11,2 % de tokens en moins sur le texte Web allemand. En anglais, Kolibri arrive également en tête, avec 4,58 octets par jeton contre 4,67 pour GPT-5. Pour les entreprises clientes payant par token, il s’agit d’une réduction directe sur chaque charge de travail en langue allemande.
Formé à l'échelle des frontières
L’entraînement derrière Kolibri est conséquent. La pré-formation couvrait 20 000 milliards de jetons sur 768 GPU NVIDIA B200, suivis de 3 440 milliards de jetons à mi-formation sur une longueur de séquence de 65 536 jetons. Le pipeline est ensuite passé par des étapes supervisées de réglage fin et d’apprentissage par renforcement pour produire le modèle final capable de suivre les instructions et de raisonner. La société a publié un rapport de recherche technique couvrant le processus, un niveau de divulgation inhabituel pour un laboratoire européen et clairement destiné à instaurer la confiance avec les clients réglementés.
Ce que cela signifie pour la poussée de l'IA en Europe
Kolibri entre sur un marché où les publications ouvertes des laboratoires américains et chinois dominent la conversation, et où les gouvernements européens se font de plus en plus entendre sur la souveraineté numérique. Le pari d’Aleph Alpha est qu’une tranche de ce marché – ministères, industries adjacentes à la défense, infrastructures critiques – paiera pour un modèle qui n’est pas simplement ouvert mais qui est également vérifiable en termes de traitement des données, de lieu de formation et de posture juridique.
La réussite de ce pari dépend de questions auxquelles la version ne répond pas encore : comment Kolibri se compare aux modèles ouverts aux frontières sur des évaluations standard et à quelle vitesse un écosystème d'outils se forme autour de lui. Ce que le communiqué établit, c’est qu’il existe désormais une capacité de formation complète, proche des frontières, au sein de l’UE, avec les documents correspondants. Pour les organisations liées par le RGPD et l’AI Act, cette combinaison peut avoir plus d’importance que les positions au classement.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →