Ett konsortium av tyska forskningsinstitutioner och AI-företag har släppt Soofi S 30B-A3B, en öppen språkmodell som enligt projektet uppnår de högsta poängen på både engelska och tyska riktmärken bland helt öppna modeller. Koordinerad av KI Bundesverband, Tysklands nationella AI-förbund, är utgåvan en av de första stora språkmodellerna som tränas helt på Deutsche Telekoms Industrial AI Cloud i München och är positionerat som ett suveränt europeiskt alternativ till de dominerande USA och kinesiska friviktsutgåvor. För utvecklare som spårar den senaste AI-utvecklingen, är lanseringen mindre anmärkningsvärd för råskala än för den ovanliga effektiviteten och språkfokus som är inbakat i arkitekturen.
En hybriddesign med endast 3,2 miljarder aktiva parametrar
Soofi S är en blandning av experter (MoE) modell med totalt 31,6 miljarder parametrar, men den aktiverar bara cirka 3,2 miljarder per genererad token. Det placerar dess beräkningskostnad närmare en modell med 3 miljarder parametrar än en konventionell modell med 30 miljarder parametrar, ett designval som syftar till att hålla slutsatserna billiga nog att köras på europeisk infrastruktur utan att lita på utländska molnleverantörer.
Arkitekturen är lånad från Nvidias Nemotron 3 Nano, som kombinerar Mamba-2-lager med vanliga uppmärksamhetslager i en hybridlayout. Enligt projektets förträningsrapport upprätthåller endast 6 av modellens 52 lager en nyckel-värde (KV) cache - minnesstrukturen som lagrar tidigare tokens för uppmärksamhetsberäkning. I konventionella transformatorer växer den cachen linjärt med kontextlängden och blir en stor flaskhals under långkontextinferens.
Den praktiska utdelningen visar sig i genomströmning. Vid en kontextlängd på 40 000 tokens med 32 parallella förfrågningar, genererar Soofi S ungefär åtta gånger fler tokens per sekund per GPU än täta modeller i intervallet 14 till 24 miljarder parametrar. Medan generationshastigheten för konventionella modeller sjunker kraftigt när sammanhanget växer, förblir Soofi S nästan oförändrad från 4 000 tokens hela vägen till 256 000 tokens. Den enda jämförbara modellen i konsortiets mätningar är Alibabas Qwen3.5 35B-A3B, som också använder en hybridarkitektur.
Utbildad för tyska, utan att offra engelska
Den medvetna fokuseringen på tyska är central i projektet. I den första utbildningsfasen utgör tyska 7,2 procent av datamixen; i den andra fasen stiger den andelen till 15,3 procent. Som jämförelse står i Nvidias referensrecept för Nemotron alla icke-engelska språk tillsammans endast för cirka 5 procent av träningsmixen.
Datakällor inkluderar tysk webbtext från HPLT-korpusen, den öppet licensierade tyska Commons-korpusen, tyska delar av FinePDFs och FineWiki, och det kommersiellt licensierade Genios-arkivet med 193 miljoner tidningsartiklar hämtade från 916 tyska publikationer. Maskinöversatta och syntetiskt genererade tyska texter kompletterar mixen.
Modellen bearbetade ungefär 27 biljoner tokens i tre utbildningsfaser: omkring 20 biljoner tokens med bred webb, kod, matematik och domänspecifik text i den första fasen; cirka 6 biljoner tokens av högre kvalitet i den andra; och en kortare tredje fas som utökar kontextfönstret med dokument som är upp till en miljon tokens långa.
Benchmarkresultat: framåt på tyska och engelska, svagare på matematik
I utvärderingar mot 16 andra öppna modeller leder Soofi S alla helt öppna modeller på sammanlagda poäng för både tyska och engelska, enligt konsortiet. Det inkluderar OLMo 3 32B från Allen Institute for AI och Apertus 70B från ETH Zürich och EPFL. Mot varje europeisk suverän baslinje kommer modellen fram på alla tyska riktmärken i sviten, ibland med tvåsiffriga marginaler.
På koduppgifter får Soofi S 73,8 procent på HumanEval, 70,2 på MBPP och 84,2 på den tyska MBPP-varianten – de bästa resultaten bland kamrater med öppen källkod. På INCLUDE-DE, ett test för Tysklandsspecifik regional kunskap, knyter Soofi S till förstaplatsen på 61,2 poäng med den större Qwen3.5 35B-A3B. Jämfört med Nemotrons baslinje förbättrar det tyskvägda datareceptet språkkunskaperna med 15,1 poäng och GPQA-Diamonds vetenskapliga benchmark med 9,6 poäng, utan att skada engelska prestanda.
Det finns tydliga svagheter. På tysk tävlingsmatematik (Minerva MATH-DE) får Soofi S 56 poäng, långt efter Qwen3,5 35B-A3B på 76,5 och Gemma 3 27B på 65,6. Den följer också öppen faktahämtning i NaturalQuestions, som teamet tillskriver att de bara har cirka 3 miljarder aktiva parametrar och därför mindre lagrad världskunskap än en tät 27B-modell. RULER-testet med långa kontexter upptäcker en annan lucka: när modellen måste extrahera ofta förekommande ord från en lång text, sjunker dess träfffrekvens till cirka 3 procent över 32 000 tokens, medan den jämförbara Nemotron-modellen fortfarande klarar av 60 till 64 procent.
Utbildad på 512 Nvidia B200 GPU:er i München
Utbildningskörningen ägde rum mellan mars och maj 2026 på upp till 512 Nvidia B200 GPU:er på Deutsche Telekoms Industrial AI Cloud i München, totalt cirka 253 000 GPU-timmar. Anläggningen drivs helt på förnybar energi, kyls med vatten från Eisbach-kanalen och matar spillvärme till det omgivande området Tucherpark, enligt rapporten. Soofi S var en av de första större träningskörningarna som genomfördes på denna infrastruktur.
Konsortiet bakom modellen finansieras av det tyska förbundsministeriet för ekonomi och energi som en del av det europeiska programmet IPCEI-CIS. Deltagare inkluderar Fraunhofer Institutes IAIS och IIS, German Research Centre for Artificial Intelligence (DFKI), TU Darmstadt, University of Würzburg, L3S Research Center, Berlin University of Applied Sciences och AI-företagen Ellamind och Merantix Momentum.
En debatt om "överträning"
Strax efter lanseringen hävdade kritiker att Soofi S var kraftigt övertränad av standarderna för de klassiska Chinchilla-skalningslagarna som publicerades av Google DeepMind 2022, vilket antydde en grov sweet spot på 20 tokens per parameter. Med 27 biljoner tokens och ungefär 30 miljarder parametrar landar Soofi S på flera hundra tokens per parameter; Om man bara räknar de 3,2 miljarder aktiva parametrarna skjuter man upp förhållandet till tusentals.
Michael Fromm, en del av projektets tekniska ledning, tryckte tillbaka på den kritiken och hävdade att dessa regler inte överförs till MoE-arkitekturer. "Det finns ny forskning som visar att de gamla skalningslagarna från täta modeller inte längre gäller för MoE-arkitekturer," sa Fromm och noterade att enskilda experter tjänar på att se samma dokument upprepade gånger i en stor datauppsättning av hög kvalitet. Som en jämförelse pekade han på Nvidia, som har tränat sina egna modeller på upp till 25 biljoner tokens.
Vad släpps och vad som inte gör det
Forskarna släpper modellvikter tillsammans med utvalda mellanliggande kontrollpunkter, den kompletta tränings- och utvärderingskoden och en detaljerad datainventering som listar råa tokenantal, epoknummer och effektiva bidrag per källa. Enligt teamet betyder det att Soofi S uppfyller Open Source AI Definition 1.0 från Open Source Initiative.
Ett striktare förslag till en europeisk definition av öppen data, som skulle kräva att varje enskild träningstoken är fritt distribuerad, uppfylls inte eftersom 1,3 procent av mixen kommer från den kommersiellt licensierade Genios-korpusen. Rapporten säger att cirka 99 procent av träningsdata fortfarande kan rekonstrueras oberoende. Den exakta licensen för modellens release hade inte slutförts vid tidpunkten för publiceringen.
Konsortiet söker nu industripartners för nästa fas för att testa Soofi S i applikationer som involverar tekniska dokument, kodgenerering och agentbaserade system. För mer om friviktsmodeller, suverän AI-infrastruktur och det europeiska AI-ekosystemet, håll dig uppdaterad med AI-branschens täckning som publiceras här.
Ligg före med öppen källkod AI
Open-weight releases kommer nästan varje vecka från labb i USA, Kina och nu Europa, och gapet mellan de största proprietära modellerna och de bästa öppna alternativen fortsätter att minska. Följ de brytande AI-nyheterna och benchmarkanalysen här för hela bilden.
Läs mer täckning av AI-modeller →


