Het Duitse AI-bedrijf Aleph Alpha heeft Kolibri uitgebracht, een open-weight Mixture-of-Experts-taalmodel dat vanaf de basis is opgebouwd voor Duits en Engels. Het model bevat in totaal 78,1 miljard parameters, maar activeert er slechts 3,46 miljard per token – ongeveer 4,4 procent – ​​en wordt geleverd onder de toegestane Apache 2.0-licentie op Hugging Face. Het accepteert maximaal 1.048.576 tokens aan context en laat gebruikers de redeneerinspanning per verzoek instellen. Voor lezers die het open-weights-ecosysteem volgen, komt dit terecht naast onze laatste AI-ontwikkelingen.

De release is een bewuste verklaring over waar Aleph Alpha zijn markt ziet: soevereine inzet in gereguleerde sectoren zoals het openbaar bestuur, de industrie en de lucht- en ruimtevaart, waar precies weten waar een model is getraind, op welke gegevens en onder welk juridisch kader geen nice-to-have is, maar een aanbestedingsvereiste.

What Kolibri actually is

Kolibri, in de technische materialen Kolibri-1 genoemd, is een tweetalige Engels-Duitse MoE-transformator die volgens Aleph Alpha end-to-end is ontwikkeld door teams in Duitsland. Volgens het technische onderzoeksrapport van het bedrijf beheerde het team de volledige pijplijn – data, architectuur, trainingsinfrastructuur, post-training en evaluatie – in plaats van te beginnen bij het controlepunt van een ander laboratorium.

De training vond plaats op infrastructuur in Duitsland en Finland. Het ontwerpproces was expliciet gericht op naleving van de EU General-Purpose AI Code of Practice, de EU AI Act en de AVG, en Aleph Alpha heeft die Code ondertekend. Het bedrijf zegt dat zijn datapijplijn persoonlijke gegevens redigeert vóór de training, een detail dat rechtstreeks gericht is op kopers uit de publieke sector die burgergegevens niet legaal kunnen inbrengen in modellen van onduidelijke herkomst.

It runs on a single GPU

Inzetbaarheid was duidelijk een ontwerpbeperking en geen bijzaak. Het FP8-checkpoint weegt ongeveer 78 GB en draait op een enkele NVIDIA B200, B300 of H200 – of op twee H100 SXM5 GPU’s – bediend via vLLM met speciale Kolibri-redenering en tool-call-parsers. Voor een model met 78 miljard parameters is dat een bescheiden hardwarevoetafdruk, en het is de directe uitbetaling van het spaarzame MoE-ontwerp: met slechts 3,46 miljard actieve parameters per token volgen de gevolgtrekkingskosten het aantal actieve parameters in plaats van het totaal.

Sparse experts and hybrid attention

Onder de motorkap stapelt Kolibri 50 transformatorblokken met een modelbreedte van 2.560. Elke MoE-laag scoort alle 384 gerouteerde experts met een sigmoid-router, stuurt elk token naar de top 6 en laat altijd 1 gedeelde expert naast hen draaien. De deskundige belasting wordt gebalanceerd met behulp van twee technieken met alfabetische soepnamen – Exact Quantile Balancing en Load-Error Injection – die voorkomen dat de router al het verkeer op een handvol specialisten laat vallen.

Aandacht is waar de architectuur interessanter wordt. Kolibri gebruikt gegroepeerde query-aandacht met 48 query-heads en 4 KV-heads, maar de lagen zijn niet uniform: elk vijfde blok gebruikt volledige aandacht zonder positionele codering, terwijl de andere 40 blokken gebruik maken van een schuifvenster-aandacht over de 512 voorgaande tokens, met RoPE. Het praktische gevolg is geheugenefficiëntie: lagen met een schuifvenster bevatten een KV-cache met een vaste grootte, dus slechts 10 van de 50 lagen groeien met de contextlengte. Bij matched compute meldt Aleph Alpha dat het hybride ontwerp sequenties ondersteunt die vier keer langer zijn dan een gelijkwaardig model met volledige aandacht. Dat is hoe een model van deze omvang een contextvenster van één miljoen token claimt zonder exotische infrastructuur.

A tokenizer built for German

De meeste grens-tokenizers beschouwen het Duits als een bijzaak, waarbij de lange samengestelde woorden in fragmenten worden gesplitst, waardoor het aantal tokens en de effectieve kosten worden opgeblazen. Aleph Alpha viel dit rechtstreeks aan met UniBPE, een vocabulaire van 128.000 tokens dat samenvoegingen opbouwt zoals BPE dat doet, maar elke samenvoeging scoort op basis van Unigram-verlies.

The numbers make the case. Voor Duitse tekst haalt Kolibri's tokenizer 4,90 bytes per token, tegenover 4,35 voor de GPT-5-tokenizer – wat 11,2 procent minder tokens betekent voor Duitse webtekst. Op het gebied van Engels komt Kolibri zelfs voorop, met 4,58 bytes per token, tegenover de 4,67 van GPT-5. Voor zakelijke klanten die per token betalen, is dat een directe korting op elke Duitstalige werklast.

Trained at frontier scale

De trainingsloop achter Kolibri is substantieel. De pre-training omvatte 20 biljoen tokens op 768 NVIDIA B200 GPU's, gevolgd door 3,44 biljoen tokens tijdens de training bij een reekslengte van 65.536 tokens. Vervolgens doorliep de pijplijn begeleide leerfasen voor verfijning en versterking om het uiteindelijke, instructievolgende en redeneringsmodel te produceren. Het bedrijf heeft een technisch onderzoeksrapport gepubliceerd over het proces, een ongebruikelijk niveau van openbaarmaking voor een Europees laboratorium en een rapport dat duidelijk gericht is op het opbouwen van vertrouwen bij gereguleerde klanten.

Wat het betekent voor de AI-push van Europa

Kolibri betreedt een markt waar open-weight-releases van Amerikaanse en Chinese laboratoria het gesprek domineren, en waar Europese regeringen steeds meer hun stem laten horen over digitale soevereiniteit. Aleph Alpha's weddenschap is dat een deel van die markt – ministeries, aangrenzende defensie-industrie, kritieke infrastructuur – zal betalen voor een model dat niet alleen maar open-weight is, maar ook aantoonbaar Europees qua dataverwerking, trainingslocatie en juridische positie.

Of die weddenschap loont, hangt af van vragen die de release nog niet beantwoordt: hoe Kolibri zich vergelijkt met grensoverschrijdende open modellen op basis van standaardevaluaties, en hoe snel er een ecosysteem van tooling omheen ontstaat. Wat de release wel duidelijk maakt, is dat er nu binnen de EU een volledige, grensoverschrijdende trainingscapaciteit bestaat, met het bijbehorende papierwerk. Voor organisaties die gebonden zijn aan de AVG en de AI Act kan die combinatie belangrijker zijn dan ranglijstposities.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →