Niemiecka firma Aleph Alpha, zajmująca się sztuczną inteligencją, wypuściła Kolibri, model językowy typu Mixture-of-Experts o otwartej wadze, zbudowany od podstaw dla języka niemieckiego i angielskiego. Model zawiera łącznie 78,1 miliarda parametrów, ale aktywuje tylko 3,46 miliarda z nich na token – około 4,4 procent – i jest dostarczany w ramach liberalnej licencji Apache 2.0 na Hugging Face. Akceptuje do 1 048 576 tokenów kontekstu i pozwala użytkownikom ustawić wysiłek rozumowania na każde żądanie. Czytelnikom śledzącym ekosystem wag otwartych jest to równoznaczne z naszymi najnowszymi osiągnięciami AI.
Publikacja ta jest celowym oświadczeniem na temat tego, gdzie Aleph Alpha widzi swój rynek: suwerenne wdrożenie w regulowanych sektorach, takich jak administracja publiczna, przemysł i lotnictwo, gdzie dokładna wiedza o tym, gdzie model został przeszkolony, na jakich danych i w jakich ramach prawnych, nie jest czymś przyjemnym, ale wymogiem zamówienia.
Czym właściwie jest Kolibri
Kolibri, określany w materiałach technicznych jako Kolibri-1, to dwujęzyczny angielsko-niemiecki transformator MoE, który według Aleph Alpha został opracowany kompleksowo przez zespoły w Niemczech. Według raportu z badań technicznych firmy zespół kontrolował cały rurociąg – dane, architekturę, infrastrukturę szkoleniową, szkolenia poszkoleniowe i ocenę – zamiast zaczynać od punktu kontrolnego w innym laboratorium.
Szkolenia odbywały się na infrastrukturze zlokalizowanej w Niemczech i Finlandii. Proces projektowania wyraźnie miał na celu zgodność z unijnym kodeksem postępowania dotyczącym sztucznej inteligencji ogólnego przeznaczenia, ustawą UE o sztucznej inteligencji i RODO, a firma Aleph Alpha jest sygnatariuszem tego kodeksu. Firma twierdzi, że jej potok danych redaguje dane osobowe przed szkoleniem, co jest szczegółem skierowanym bezpośrednio do nabywców z sektora publicznego, którzy nie mogą legalnie wprowadzać danych obywateli do modeli o niejasnym pochodzeniu.
Działa na jednym GPU
Możliwość wdrożenia była wyraźnie ograniczeniem projektowym, a nie refleksją. Punkt kontrolny 8PR waży około 78 GB i działa na pojedynczej karcie NVIDIA B200, B300 lub H200 – lub na dwóch procesorach graficznych H100 SXM5 – obsługiwanych przez vLLM z dedykowanym rozumowaniem Kolibri i parserami wywołań narzędzi. W przypadku modelu zawierającego 78 miliardów parametrów jest to niewielki ślad sprzętowy i stanowi bezpośrednią korzyść z rzadkiego projektu MoE: przy aktywnych tylko 3,46 miliarda parametrów na token koszt wnioskowania śledzi liczbę aktywnych parametrów, a nie sumę.
Nieliczni eksperci i hybrydowa uwaga
Pod maską Kolibri mieści się 50 bloków transformatorów o szerokości modelu 2560. Każda warstwa MoE ocenia wszystkich 384 ekspertów kierowanych za pomocą routera sigmoidalnego, wysyła każdy token do 6 najlepszych i zawsze uruchamia obok nich 1 wspólnego eksperta. Obciążenie eksperckie jest równoważone przy użyciu dwóch technik o nazwach alfabetycznych — dokładne równoważenie kwantyli i wstrzykiwanie błędów obciążenia — które zapobiegają zrzucaniu całego ruchu przez router na garstkę specjalistów.
Uwaga jest tam, gdzie architektura staje się bardziej interesująca. Kolibri wykorzystuje uwagę zapytań grupowych z 48 głowicami zapytań i 4 głowicami KV, ale warstwy nie są jednolite: co piąty blok wykorzystuje pełną uwagę bez kodowania pozycyjnego, podczas gdy pozostałe 40 bloków wykorzystuje uwagę przesuwanego okna w porównaniu z 512 poprzedzającymi tokenami, z RoPE. Praktyczną konsekwencją jest wydajność pamięci — warstwy przesuwanego okna przechowują pamięć podręczną KV o stałym rozmiarze, więc tylko 10 z 50 warstw rośnie wraz z długością kontekstu. Przy dopasowanych obliczeniach Aleph Alpha informuje, że konstrukcja hybrydowa obsługuje sekwencje czterokrotnie dłuższe niż równoważny model skupiający całą uwagę. W ten sposób model tej wielkości zapewnia okno kontekstowe zawierające milion tokenów bez egzotycznej infrastruktury.
Tokenizer stworzony dla języka niemieckiego
Większość granicznych tokenizatorów traktuje język niemiecki po namyśle, dzieląc jego długie słowa złożone na fragmenty, co zawyża liczbę tokenów i efektywne koszty. Aleph Alpha zaatakował to bezpośrednio za pomocą UniBPE, słownictwa zawierającego 128 000 tokenów, które buduje fuzje w sposób, w jaki robi to BPE, ale każde połączenie jest punktowane utratą Unigramu.
Liczby potwierdzają sprawę. W przypadku tekstu niemieckiego tokenizer Kolibri osiąga 4,90 bajtów na token w porównaniu do 4,35 w przypadku tokenizera GPT-5, co oznacza 11,2 procent mniej tokenów w niemieckim tekście internetowym. W języku angielskim Kolibri również wyprzedza, uzyskując 4,58 bajtów na token w porównaniu z 4,67 w GPT-5. Dla klientów korporacyjnych płacących żetonem jest to bezpośredni rabat na każde obciążenie w języku niemieckim.
Wyszkoleni na skalę graniczną
Trening za Kolibri jest znaczny. Szkolenie wstępne objęło 20 bilionów tokenów na 768 procesorach graficznych NVIDIA B200, a następnie 3,44 biliona tokenów w trakcie treningu o długości sekwencji wynoszącej 65 536 tokenów. Następnie projekt przeszedł przez etapy nadzorowanego dostrajania i uczenia się przez wzmacnianie, aby stworzyć ostateczny model, zgodny z instrukcjami i zdolny do wnioskowania. Firma opublikowała raport z badań technicznych obejmujący proces, który jest nietypowym poziomem jawności jak na laboratorium europejskie i wyraźnie ma na celu budowanie zaufania wśród regulowanych klientów.
Co to oznacza dla europejskiego nacisku na sztuczną inteligencję
Kolibri wkracza na rynek, na którym dominują publikacje o otwartej wadze z amerykańskich i chińskich laboratoriów i gdzie europejskie rządy coraz częściej wypowiadają się na temat suwerenności cyfrowej. Aleph Alpha zakłada, że część tego rynku – ministerstwa, przemysł związany z obronnością, infrastruktura krytyczna – zapłaci za model, który jest nie tylko otwarty, ale w sposób weryfikowalny europejski pod względem obsługi danych, lokalizacji szkoleń i statusu prawnego.
To, czy ten zakład się opłaci, zależy od pytań, na które publikacja jeszcze nie odpowiedziała: w jaki sposób Kolibri porównuje z pionierskimi modelami otwartymi w standardowych ocenach i jak szybko tworzy się wokół niego ekosystem narzędzi. W komunikacie tym faktycznie stwierdzono, że w UE istnieje obecnie kompleksowy, transgraniczny potencjał szkoleniowy, któremu towarzyszy odpowiednia dokumentacja. Dla organizacji objętych RODO i ustawą o sztucznej inteligencji to połączenie może mieć większe znaczenie niż pozycje w rankingach.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →