La società tedesca di intelligenza artificiale Aleph Alpha ha rilasciato Kolibri, un modello linguistico di miscela di esperti costruito da zero per tedesco e inglese. Il modello racchiude 78,1 miliardi di parametri totali, ma ne attiva solo 3,46 miliardi per token (circa il 4,4%) e viene fornito con la permissiva licenza Apache 2.0 su Hugging Face. Accetta fino a 1.048.576 token di contesto e consente agli utenti di impostare lo sforzo di ragionamento per richiesta. Per i lettori che seguono l'ecosistema open-weights, questo si affianca ai nostri ultimi sviluppi dell'intelligenza artificiale.
Il comunicato è una dichiarazione deliberata su dove Aleph Alpha vede il suo mercato: dispiegamento sovrano in settori regolamentati come la pubblica amministrazione, l’industria e l’aerospaziale, dove sapere esattamente dove è stato addestrato un modello, su quali dati e in quale quadro giuridico non è un piacere da avere ma un requisito di approvvigionamento.
Cos'è realmente Kolibri
Kolibri, indicato come Kolibri-1 nei materiali tecnici, è un trasformatore MoE bilingue inglese-tedesco che secondo Aleph Alpha è stato sviluppato end-to-end da team in Germania. Secondo il rapporto di ricerca tecnica dell'azienda, il team ha controllato l'intera pipeline (dati, architettura, infrastruttura di formazione, post-formazione e valutazione) anziché iniziare dal punto di controllo di un altro laboratorio.
La formazione si è svolta su infrastrutture situate in Germania e Finlandia. Il processo di progettazione mirava esplicitamente alla conformità con il Codice di condotta generale dell’UE sull’IA, con la legge UE sull’intelligenza artificiale e con il GDPR, e Aleph Alpha è uno dei firmatari di tale codice. L’azienda afferma che la sua pipeline di dati oscura i dati personali prima della formazione, un dettaglio rivolto direttamente agli acquirenti del settore pubblico che non possono legalmente inserire i dati dei cittadini in modelli di provenienza poco chiara.
Funziona su una singola GPU
La distribuibilità era chiaramente un vincolo di progettazione, non un ripensamento. Il checkpoint FP8 pesa circa 78 GB e funziona su un singolo NVIDIA B200, B300 o H200 (o su due GPU H100 SXM5) servito tramite vLLM con ragionamento Kolibri dedicato e parser di chiamate agli strumenti. Per un modello da 78 miliardi di parametri, si tratta di un ingombro hardware modesto, ed è il vantaggio diretto della progettazione sparsa del MoE: con solo 3,46 miliardi di parametri attivi per token, il costo di inferenza tiene traccia del conteggio dei parametri attivi anziché del totale.
Esperti scarsi e attenzione ibrida
Sotto il cofano, Kolibri impila 50 blocchi di trasformatori con una larghezza del modello di 2.560. Ogni livello MoE assegna un punteggio a tutti i 384 esperti instradati con un router sigmoide, invia ciascun token ai primi 6 e esegue sempre 1 esperto condiviso insieme a loro. Il carico degli esperti viene bilanciato utilizzando due tecniche con nomi in ordine alfabetico – Exact Quantile Balancing e Load-Error Injection – che impediscono al router di concentrare tutto il traffico su una manciata di specialisti.
L'attenzione è dove l'architettura diventa più interessante. Kolibri utilizza l'attenzione delle query raggruppate con 48 teste di query e 4 teste KV, ma gli strati non sono uniformi: ogni quinto blocco utilizza la piena attenzione senza codifica posizionale, mentre gli altri 40 blocchi utilizzano l'attenzione della finestra scorrevole sui 512 token precedenti, con RoPE. La conseguenza pratica è l'efficienza della memoria: i livelli a finestra scorrevole contengono una cache KV di dimensione fissa, quindi solo 10 dei 50 livelli crescono con la lunghezza del contesto. Al calcolo abbinato, Aleph Alpha riferisce che il design ibrido supporta sequenze quattro volte più lunghe di un modello equivalente con piena attenzione. È così che un modello di queste dimensioni rivendica una finestra di contesto da un milione di token senza infrastrutture esotiche.
Un tokenizzatore creato per il tedesco
La maggior parte dei tokenizzatori di frontiera trattano il tedesco come un ripensamento, dividendo le sue lunghe parole composte in frammenti che gonfiano il numero di token e i costi effettivi. Aleph Alpha ha affrontato questo problema direttamente con UniBPE, un vocabolario da 128.000 token che crea fusioni come fa BPE ma assegna a ciascuna fusione un punteggio in base alla perdita di Unigram.
I numeri lo dicono. Sul testo tedesco, il tokenizzatore di Kolibri raggiunge 4,90 byte per token, contro i 4,35 del tokenizzatore GPT-5, il che significa l'11,2% di token in meno sul testo web tedesco. In inglese, anche Kolibri è in vantaggio, con 4,58 byte per token contro i 4,67 di GPT-5. Per i clienti aziendali che pagano con gettone si tratta di uno sconto diretto su ogni carico di lavoro in lingua tedesca.
Addestrato su scala di frontiera
Il percorso formativo dietro Kolibri è sostanziale. Il pre-training ha coperto 20 trilioni di token su 768 GPU NVIDIA B200, seguiti da 3,44 trilioni di token a metà training con una lunghezza della sequenza di 65.536 token. La pipeline è poi passata attraverso fasi supervisionate di perfezionamento e apprendimento di rinforzo per produrre il modello finale in grado di seguire le istruzioni e di ragionare. La società ha pubblicato un rapporto di ricerca tecnica che copre il processo, un livello di divulgazione insolito per un laboratorio europeo e chiaramente mirato a creare fiducia con i clienti regolamentati.
Cosa significa per la spinta europea verso l'intelligenza artificiale
Kolibri entra in un mercato in cui i rilasci open-weight dei laboratori americani e cinesi dominano la conversazione e dove i governi europei sono diventati sempre più espliciti riguardo alla sovranità digitale. La scommessa di Aleph Alpha è che una fetta di quel mercato – ministeri, industria adiacente alla difesa, infrastrutture critiche – pagherà per un modello che non sia semplicemente a peso aperto ma verificabilmente europeo nella gestione dei dati, nei luoghi di formazione e nella posizione legale.
Se la scommessa ripagherà dipende da domande a cui il comunicato non ha ancora risposto: come Kolibri si confronta con i modelli aperti di frontiera sulla base di valutazioni standard e quanto velocemente si forma un ecosistema di strumenti attorno ad esso. Ciò che il comunicato stabilisce è che ora esiste una capacità di formazione completa, adiacente alla frontiera, all’interno dell’UE, con la documentazione corrispondente. Per le organizzazioni vincolate dal GDPR e dall’AI Act, questa combinazione può avere più importanza delle posizioni in classifica.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →