Das deutsche KI-Unternehmen Aleph Alpha hat Kolibri veröffentlicht, ein offenes Mixture-of-Experts-Sprachmodell, das von Grund auf für Deutsch und Englisch entwickelt wurde. Das Modell umfasst insgesamt 78,1 Milliarden Parameter, aktiviert jedoch nur 3,46 Milliarden davon pro Token – etwa 4,4 Prozent – ​​und wird unter der freizügigen Apache 2.0-Lizenz auf Hugging Face ausgeliefert. Es akzeptiert bis zu 1.048.576 Kontext-Tokens und ermöglicht es Benutzern, den Argumentationsaufwand pro Anfrage festzulegen. Für Leser, die das Open-Weights-Ökosystem verfolgen, landet dies neben unseren neuesten KI-Entwicklungen.

Die Veröffentlichung ist eine bewusste Aussage darüber, wo Aleph Alpha seinen Markt sieht: den souveränen Einsatz in regulierten Sektoren wie der öffentlichen Verwaltung, der Industrie und der Luft- und Raumfahrt, wo es kein „nice-to-have“, sondern eine Beschaffungsvoraussetzung ist, genau zu wissen, wo ein Modell trainiert wurde, auf welchen Daten und unter welchem ​​rechtlichen Rahmen.

Was Kolibri eigentlich ist

Kolibri, in den technischen Materialien als Kolibri-1 bezeichnet, ist ein zweisprachiger englisch-deutscher MoE-Transformer, der laut Aleph Alpha von Teams in Deutschland durchgängig entwickelt wurde. Dem technischen Forschungsbericht des Unternehmens zufolge kontrollierte das Team die gesamte Pipeline – Daten, Architektur, Trainingsinfrastruktur, Nachschulung und Auswertung –, anstatt am Kontrollpunkt eines anderen Labors zu beginnen.

Die Schulungen fanden auf Infrastrukturen in Deutschland und Finnland statt. Der Designprozess zielte ausdrücklich auf die Einhaltung des EU-Verhaltenskodex für allgemeine KI, des EU-KI-Gesetzes und der DSGVO ab, und Aleph Alpha ist Unterzeichner dieses Kodex. Das Unternehmen gibt an, dass seine Datenpipeline personenbezogene Daten vor der Schulung unkenntlich macht. Diese Maßnahme richtet sich direkt an Käufer aus dem öffentlichen Sektor, die Bürgerdaten nicht legal in Modelle unklarer Herkunft einspeisen dürfen.

Es läuft auf einer einzelnen GPU

Die Einsatzfähigkeit war eindeutig eine Designbeschränkung und kein nachträglicher Einfall. Der FP8-Checkpoint wiegt etwa 78 GB und läuft auf einer einzelnen NVIDIA B200, B300 oder H200 – oder auf zwei H100 SXM5-GPUs – und wird über vLLM mit dediziertem Kolibri Reasoning und Tool-Call-Parsern bedient. Für ein 78-Milliarden-Parameter-Modell ist das ein bescheidener Hardware-Fußabdruck und der direkte Vorteil des spärlichen MoE-Designs: Bei nur 3,46 Milliarden aktiven Parametern pro Token verfolgen die Inferenzkosten die Anzahl der aktiven Parameter und nicht die Gesamtzahl.

Wenig Experten und hybride Aufmerksamkeit

Unter der Haube stapelt Kolibri 50 Trafoblöcke mit einer Modellbreite von 2.560. Jede MoE-Schicht bewertet alle 384 gerouteten Experten mit einem Sigmoid-Router, sendet jeden Token an die Top 6 und führt immer einen gemeinsamen Experten neben ihnen aus. Die Expertenlast wird mithilfe von zwei Techniken mit alphabetischen Suppennamen ausgeglichen – Exact Quantile Balancing und Load-Error Injection –, die verhindern, dass der Router den gesamten Datenverkehr auf eine Handvoll Spezialisten reduziert.

Achtung, dort wird die Architektur interessanter. Kolibri verwendet eine gruppierte Abfrageaufmerksamkeit mit 48 Abfrageköpfen und 4 KV-Köpfen, aber die Schichten sind nicht einheitlich: Jeder fünfte Block verwendet die volle Aufmerksamkeit ohne Positionskodierung, während die anderen 40 Blöcke die Aufmerksamkeit mit gleitendem Fenster über die 512 vorhergehenden Token mit RoPE verwenden. Die praktische Konsequenz ist die Speichereffizienz – Sliding-Window-Layer enthalten einen KV-Cache mit fester Größe, sodass nur 10 der 50 Layer mit der Kontextlänge wachsen. Bei Matched Compute berichtet Aleph Alpha, dass das Hybriddesign Sequenzen unterstützt, die viermal länger sind als ein entsprechendes Modell mit voller Aufmerksamkeit. Auf diese Weise beansprucht ein Modell dieser Größe ein Kontextfenster mit einer Million Token ohne exotische Infrastruktur.

Ein Tokenizer für Deutsch

Die meisten Grenz-Tokenisierer behandeln Deutsch als Nebensache und zerlegen seine langen zusammengesetzten Wörter in Fragmente, die die Anzahl der Token und die effektiven Kosten in die Höhe treiben. Aleph Alpha griff dies direkt mit UniBPE an, einem Vokabular mit 128.000 Token, das Zusammenführungen auf die Art und Weise aufbaut, wie BPE es tut, aber jede Zusammenführung anhand des Unigram-Verlusts bewertet.

Die Zahlen machen es deutlich. Bei deutschem Text erreicht der Tokenizer von Kolibri 4,90 Bytes pro Token, gegenüber 4,35 beim GPT-5-Tokenizer – was 11,2 Prozent weniger Token bei deutschem Webtext bedeutet. Auch auf Englisch hat Kolibri tatsächlich die Nase vorn, mit 4,58 Bytes pro Token gegenüber 4,67 bei GPT-5. Für Unternehmenskunden, die mit dem Token zahlen, ist das ein direkter Rabatt auf jedes deutschsprachige Arbeitspensum.

Im Grenzbereich ausgebildet

Der Trainingslauf hinter Kolibri ist beachtlich. Das Vortraining umfasste 20 Billionen Token auf 768 NVIDIA B200-GPUs, gefolgt von 3,44 Billionen Token während des Trainings mit einer Sequenzlänge von 65.536 Token. Anschließend durchlief die Pipeline überwachte Feinabstimmungs- und Verstärkungslernphasen, um das endgültige, Anweisungsfolgende und argumentationsfähige Modell zu erstellen. Das Unternehmen hat einen technischen Forschungsbericht über den Prozess veröffentlicht, der für ein europäisches Labor ungewöhnlich offengelegt wird und eindeutig darauf abzielt, Vertrauen bei regulierten Kunden aufzubauen.

Was es für Europas KI-Vorstoß bedeutet

Kolibri betritt einen Markt, in dem Open-Weight-Veröffentlichungen aus amerikanischen und chinesischen Labors die Diskussion dominieren und in dem europäische Regierungen sich zunehmend lautstark für die digitale Souveränität einsetzen. Aleph Alpha geht davon aus, dass ein Teil dieses Marktes – Ministerien, verteidigungsnahe Industrie, kritische Infrastruktur – für ein Modell bezahlen wird, das nicht nur offen, sondern nachweislich europäisch ist, was Datenverarbeitung, Schulungsort und Rechtslage betrifft.

Ob sich diese Wette auszahlt, hängt von Fragen ab, die in der Veröffentlichung noch nicht beantwortet werden: wie Kolibri bei Standardauswertungen mit offenen Frontier-Modellen verglichen wird und wie schnell sich um ihn herum ein Ökosystem von Werkzeugen bildet. Aus der Pressemitteilung geht hervor, dass es innerhalb der EU mittlerweile eine umfassende, grenzüberschreitende Ausbildungskapazität mit entsprechendem Papierkram gibt. Für Organisationen, die an die DSGVO und das KI-Gesetz gebunden sind, kann diese Kombination wichtiger sein als die Platzierungen in der Bestenliste.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →