Een consortium van Duitse onderzoeksinstellingen en AI-bedrijven heeft Soofi S 30B-A3B uitgebracht, een open taalmodel dat volgens het project de hoogste scores behaalt op zowel Engelse als Duitse benchmarks onder volledig open modellen. De release, gecoördineerd door het KI Bundesverband, de nationale AI-vereniging van Duitsland, is een van de eerste grote taalmodellen die volledig zijn getraind op de Industrial AI Cloud van Deutsche Telekom in München en wordt gepositioneerd als een soeverein Europees alternatief voor de dominante Amerikaanse en Chinese open-weight releases. Voor ontwikkelaars die [de nieuwste AI-ontwikkelingen] (https://aibuzzwire.news) volgen, valt de lancering minder op vanwege de ruwe schaal dan vanwege de ongebruikelijke efficiëntie en taalfocus die in de architectuur is ingebakken.

Een hybride ontwerp met slechts 3,2 miljard actieve parameters

Soofi S is een mix-of-experts (MoE)-model met in totaal 31,6 miljard parameters, maar activeert slechts ongeveer 3,2 miljard per gegenereerd token. Dat brengt de rekenkosten dichter bij een model met 3 miljard parameters dan bij een conventioneel model met een dichtheid van 30 miljard parameters, een ontwerpkeuze die erop gericht is de gevolgtrekking goedkoop genoeg te houden om op de Europese infrastructuur te draaien zonder afhankelijk te zijn van buitenlandse cloudproviders.

De architectuur is geleend van Nvidia's Nemotron 3 Nano, waarbij Mamba-2-lagen worden gecombineerd met standaard aandachtslagen in een hybride lay-out. Volgens het pretrainingrapport van het project behouden slechts 6 van de 52 lagen van het model een key-value (KV) cache – de geheugenstructuur waarin eerdere tokens worden opgeslagen voor aandachtsberekening. Bij conventionele transformatoren groeit die cache lineair met de lengte van de context en wordt een belangrijk knelpunt tijdens gevolgtrekkingen over lange contexten.

De praktische winst blijkt uit de doorvoer. Bij een contextlengte van 40.000 tokens met 32 ​​parallelle verzoeken genereert Soofi S grofweg acht keer meer tokens per seconde per GPU dan compacte modellen in het bereik van 14 tot 24 miljard parameters. Terwijl de generatiesnelheid voor conventionele modellen scherp daalt naarmate de context groeit, blijft Soofi S vrijwel stabiel van 4.000 tokens tot 256.000 tokens. Het enige vergelijkbare model in de metingen van het consortium is Alibaba's Qwen3.5 35B-A3B, die ook gebruik maakt van een hybride architectuur.

Opgeleid voor Duits, zonder Engels op te offeren

De bewuste focus op Duits staat centraal in het project. In de eerste trainingsfase vormt Duits 7,2 procent van de datamix; in de tweede fase stijgt dat aandeel naar 15,3 procent. Ter vergelijking: in Nvidia's Nemotron-referentierecept vertegenwoordigen alle niet-Engelse talen samen slechts ongeveer 5 procent van de trainingsmix.

Gegevensbronnen omvatten Duitse webtekst uit het HPLT-corpus, het openlijk gelicentieerde Duitse Commons-corpus, Duitse delen van FinePDFs en FineWiki, en het commercieel gelicentieerde Genios-archief van 193 miljoen krantenartikelen afkomstig uit 916 Duitse publicaties. Machinaal vertaalde en synthetisch gegenereerde Duitse teksten ronden de mix af.

Het model verwerkte ongeveer 27 biljoen tokens in drie trainingsfasen: ongeveer 20 biljoen tokens van breed web, code, wiskunde en domeinspecifieke tekst in de eerste fase; ongeveer 6 biljoen tokens van hogere kwaliteit in de tweede; en een kortere derde fase waarbij het contextvenster wordt uitgebreid met documenten tot een miljoen tokens lang.

Benchmarkresultaten: voorsprong op Duits en Engels, zwakker op wiskunde

In evaluaties met 16 andere open modellen leidt Soofi S alle volledig open modellen op basis van de totale scores voor zowel Duits als Engels, aldus het consortium. Dat omvat OLMo 3 32B van het Allen Institute for AI en Apertus 70B van ETH Zürich en EPFL. Tegenover alle Europese staatsobligaties ligt het model voorop op alle Duitse benchmarks in de reeks, soms met marges van dubbele cijfers.

Op codetaken scoort Soofi S 73,8 procent op HumanEval, 70,2 op MBPP en 84,2 op de Duitse MBPP-variant – de beste resultaten onder open-source peers. Op INCLUDE-DE, een test voor Duitsland-specifieke regionale kennis, staat Soofi S met 61,2 punten op de eerste plaats met de grotere Qwen3.5 35B-A3B. Vergeleken met de Nemotron-basislijn verbetert het Duits-gewogen datarecept de taalvaardigheid met 15,1 punten en de GPQA-Diamond wetenschapsbenchmark met 9,6 punten, zonder de Engelse prestaties te schaden.

Er zijn duidelijke zwakke punten. Op de Duitse competitiewiskunde (Minerva MATH-DE) scoort Soofi S 56 punten, ruim achter Qwen3.5 35B-A3B met 76,5 en Gemma 3 27B met 65,6. Het volgt ook het open ophalen van feiten in NaturalQuestions, wat het team toeschrijft aan het feit dat er slechts ongeveer 3 miljard actieve parameters zijn en daarom minder opgeslagen wereldkennis dan een compact 27B-model. De RULER lange-contexttest brengt nog een gat aan het licht: wanneer het model veel voorkomende woorden uit een lange tekst moet halen, daalt het hitpercentage tot ongeveer 3 procent boven de 32.000 tokens, terwijl het vergelijkbare Nemotron-model nog steeds 60 tot 64 procent haalt.

Getraind op 512 Nvidia B200 GPU's in München

De training vond plaats tussen maart en mei 2026 op maximaal 512 Nvidia B200 GPU's in de Industrial AI Cloud van Deutsche Telekom in München, met in totaal ongeveer 253.000 GPU-uren. De installatie draait volledig op hernieuwbare energie, wordt gekoeld met water uit het Eisbachkanaal en levert restwarmte aan de omliggende wijk Tucherpark, aldus het rapport. Soofi S was een van de eerste grote trainingsritten op deze infrastructuur.

Het consortium achter het model wordt gefinancierd door het Duitse federale ministerie van Economische Zaken en Energie als onderdeel van het Europese IPCEI-CIS-programma. Deelnemers zijn onder meer de Fraunhofer Instituten IAIS en IIS, het Duitse Onderzoekscentrum voor Kunstmatige Intelligentie (DFKI), TU Darmstadt, de Universiteit van Würzburg, het L3S Onderzoekscentrum, de Universiteit voor Toegepaste Wetenschappen van Berlijn en AI-bedrijven Ellamind en Merantix Momentum.

Een debat over 'overtraining'

Kort na de lancering voerden critici aan dat Soofi S zwaar overtraind was door de normen van de klassieke Chinchilla-schaalwetten die in 2022 door Google DeepMind werden gepubliceerd, wat een ruwe sweet spot van 20 tokens per parameter suggereerde. Met 27 biljoen tokens en grofweg 30 miljard parameters komt Soofi S uit op enkele honderden tokens per parameter; door alleen de 3,2 miljard actieve parameters te tellen, loopt de verhouding in de duizenden.

Michael Fromm, onderdeel van de technische leiding van het project, heeft die kritiek teruggedrongen met het argument dat deze regels niet gelden voor MoE-architecturen. "Er is nieuw onderzoek waaruit blijkt dat de oude schaalwetten van compacte modellen niet langer van toepassing zijn op MoE-architecturen", zei Fromm, waarbij hij opmerkte dat individuele experts er baat bij hebben dezelfde documenten herhaaldelijk in een grote, hoogwaardige dataset te zien. Ter vergelijking wees hij op Nvidia, dat zijn eigen modellen heeft getraind op maximaal 25 biljoen tokens.

Wat wordt vrijgegeven en wat niet

De onderzoekers geven modelgewichten vrij samen met geselecteerde tussenliggende controlepunten, de volledige trainings- en evaluatiecode en een gedetailleerde gegevensinventaris met een overzicht van het aantal onbewerkte tokens, tijdperknummers en effectieve bijdragen per bron. Volgens het team betekent dit dat Soofi S voldoet aan de Open Source AI Definition 1.0 van het Open Source Initiative.

Aan een strenger voorstel voor een Europese open-data-definitie, die vereist dat elk afzonderlijk trainingstoken vrij distribueerbaar is, wordt niet voldaan omdat 1,3 procent van de mix afkomstig is van het commercieel gelicentieerde Genios-corpus. Volgens het rapport kan ongeveer 99 procent van de trainingsgegevens nog steeds onafhankelijk worden gereconstrueerd. De exacte licentie voor de release van het model was op het moment van publicatie nog niet definitief.

Het consortium is nu op zoek naar industriële partners voor de volgende fase om Soofi S te testen in toepassingen met technische documenten, codegeneratie en agent-gebaseerde systemen. Voor meer informatie over de releases van open-weight modellen, de soevereine AI-infrastructuur en het Europese AI-ecosysteem kunt u de AI-industrieverslaggeving volgen die hier is gepubliceerd.

Blijf voorop op het gebied van open-source AI

Er komen bijna wekelijks releases met open gewicht binnen vanuit laboratoria in de Verenigde Staten, China en nu ook Europa, en de kloof tussen de grootste eigen modellen en de beste open alternatieven wordt steeds kleiner. Volg het breaking AI news en de benchmarkanalyse hier voor het volledige beeld.

Lees meer dekking van AI-modellen →