Det tyska AI-företaget Aleph Alpha har släppt Kolibri, en språkmodell med öppen vikt från Mixture-of-Experts byggd från grunden för tyska och engelska. Modellen har totalt 78,1 miljarder parametrar men aktiverar endast 3,46 miljarder av dem per token – cirka 4,4 procent – och skickas under den tillåtande Apache 2.0-licensen på Hugging Face. Den accepterar upp till 1 048 576 kontextsymboler och låter användare ställa in resonemang per begäran. För läsare som spårar ekosystemet med öppna vikter landar detta tillsammans med vår senaste AI-utveckling.
Utgivningen är ett medvetet uttalande om var Aleph Alpha ser sin marknad: suverän utplacering i reglerade sektorer som offentlig förvaltning, industri och flyg, där man vet exakt var en modell utbildades, på vilka data och under vilka rättsliga ramar är inte ett trevligt att ha utan ett upphandlingskrav.
Vad Kolibri faktiskt är
Kolibri, kallad Kolibri-1 i det tekniska materialet, är en tvåspråkig engelsk-tysk MoE-transformator som Aleph Alpha säger utvecklades från början av team i Tyskland. Enligt företagets tekniska forskningsrapport kontrollerade teamet hela pipelinen - data, arkitektur, utbildningsinfrastruktur, efterträning och utvärdering - snarare än att börja från ett annat labbs kontrollpunkt.
Utbildningen gick på infrastruktur i Tyskland och Finland. Designprocessen var uttryckligen inriktad på efterlevnad av EU:s allmänna uppförandekod för AI, EU AI Act och GDPR, och Aleph Alpha har undertecknat den koden. Företaget säger att dess datapipeline redigerar personuppgifter före utbildning, en detalj som riktar sig direkt till köpare från den offentliga sektorn som inte lagligt kan mata in medborgardata i modeller med oklar härkomst.
Den körs på en enda GPU
Utplacerbarhet var helt klart en designbegränsning, inte en eftertanke. FP8-kontrollpunkten väger in på ungefär 78 GB och körs på en enda NVIDIA B200, B300 eller H200 – eller på två H100 SXM5 GPU:er – som serveras genom vLLM med dedikerade Kolibri-resonemang och verktygssamtalsparsers. För en modell med 78 miljarder parametrar är det ett blygsamt hårdvaruavtryck, och det är den direkta vinsten av den glesa MoE-designen: med endast 3,46 miljarder aktiva parametrar per token, följer slutsatskostnaden antalet aktiva parametrar snarare än totalen.
Sparsamma experter och hybrid uppmärksamhet
Under huven staplar Kolibri 50 transformatorblock med en modellbredd på 2 560. Varje MoE-lager ger alla 384 routade experter poäng med en sigmoid-router, skickar varje token till topp 6 och kör alltid 1 delad expert tillsammans med dem. Expertbelastningen balanseras med hjälp av två tekniker med alfabetiska soppnamn – Exakt kvantilbalansering och Load-Error Injection – som hindrar routern från att kollapsa all trafik till en handfull specialister.
Uppmärksamhet är där arkitekturen blir mer intressant. Kolibri använder uppmärksamhet för grupperad fråge med 48 frågehuvuden och 4 KV-huvuden, men lagren är inte enhetliga: vart femte block använder full uppmärksamhet utan positionskodning, medan de andra 40 blocken använder uppmärksamhet från skjutfönster över de 512 föregående tokens, med RoPE. Den praktiska konsekvensen är minneseffektivitet - lager med skjutfönster har en KV-cache med fast storlek, så bara 10 av de 50 lagren växer med kontextlängd. Vid matchad beräkning rapporterar Aleph Alpha att hybriddesignen stöder sekvenser fyra gånger längre än en motsvarande modell med full uppmärksamhet. Det är så en modell av denna storlek gör anspråk på ett kontextfönster på en miljon token utan exotisk infrastruktur.
En tokenizer byggd för tyska
De flesta frontier tokenizers behandlar tyska som en eftertanke, och delar upp dess långa sammansatta ord i fragment som ökar antalet token och effektiva kostnader. Aleph Alpha attackerade detta direkt med UniBPE, ett ordförråd på 128 000 token som bygger sammanslagningar på det sätt som BPE gör men poängsätter varje sammanslagning genom Unigram-förlust.
Siffrorna gör fallet. På tysk text når Kolibris tokenizer 4,90 byte per token, jämfört med 4,35 för GPT-5 tokenizer – vilket betyder 11,2 procent färre tokens på tysk webbtext. På engelska kommer Kolibri faktiskt också före, med 4,58 byte per token mot GPT-5:s 4,67. För företagskunder som betalar med token är det en direkt rabatt på varje tyskspråkig arbetsbelastning.
Utbildad i gränsskala
Utbildningsloppet bakom Kolibri är betydande. Förträning omfattade 20 biljoner tokens på 768 NVIDIA B200 GPU: er, följt av 3,44 biljoner mid-training tokens vid en sekvenslängd på 65 536 token. Pipelinen gick sedan genom övervakade finjusteringar och förstärkningsinlärningsstadier för att producera den slutliga instruktionsföljande modellen med resonemang. Företaget har publicerat en teknisk forskningsrapport som täcker processen, en ovanlig informationsnivå för ett europeiskt labb och en tydligt inriktad på att bygga förtroende hos reglerade kunder.
Vad det betyder för Europas AI-framgång
Kolibri går in på en marknad där öppen vikt från amerikanska och kinesiska labb dominerar samtalet, och där europeiska regeringar har blivit allt mer högljudda om digital suveränitet. Aleph Alphas satsning är att en del av den marknaden – ministerier, närliggande försvarsindustri, kritisk infrastruktur – kommer att betala för en modell som inte bara är öppen utan bevisligen europeisk i sin datahantering, utbildningsplats och rättsliga ställning.
Huruvida den satsningen lönar sig beror på frågor som releasen ännu inte besvarar: hur Kolibri riktmärker mot öppna gränsmodeller på standardutvärderingar, och hur snabbt ett ekosystem av verktyg bildas runt det. Vad releasen konstaterar är att en fullstack, gränsöverskridande träningskapacitet nu finns inom EU, med pappersarbetet att matcha. För organisationer som är bundna av GDPR och AI-lagen kan den kombinationen ha större betydelse än positioner på topplistan.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →