A empresa alemã de IA Aleph Alpha lançou o Kolibri, um modelo de linguagem de mistura de especialistas de peso aberto construído desde o início para alemão e inglês. O modelo contém 78,1 bilhões de parâmetros no total, mas ativa apenas 3,46 bilhões deles por token – cerca de 4,4% – e é fornecido sob a licença permissiva Apache 2.0 no Hugging Face. Ele aceita até 1.048.576 tokens de contexto e permite que os usuários definam o esforço de raciocínio por solicitação. Para os leitores que acompanham o ecossistema de pesos abertos, isso acompanha nossos últimos desenvolvimentos de IA.
O comunicado é uma declaração deliberada sobre onde a Aleph Alpha vê o seu mercado: implementação soberana em sectores regulamentados, como a administração pública, a indústria e o aeroespacial, onde saber exactamente onde um modelo foi treinado, em que dados e sob que quadro jurídico não é uma boa ideia, mas sim um requisito de aquisição.
O que Kolibri realmente é
Kolibri, referido como Kolibri-1 nos materiais técnicos, é um transformador MoE bilíngue inglês-alemão que Aleph Alpha diz ter sido desenvolvido de ponta a ponta por equipes na Alemanha. De acordo com o relatório de pesquisa técnica da empresa, a equipe controlava todo o pipeline – dados, arquitetura, infraestrutura de treinamento, pós-treinamento e avaliação – em vez de partir do ponto de verificação de outro laboratório.
A formação decorreu em infraestruturas localizadas na Alemanha e na Finlândia. O processo de design visou explicitamente a conformidade com o Código de Práticas de IA de Uso Geral da UE, a Lei de IA da UE e o GDPR, e Aleph Alpha é signatário desse Código. A empresa afirma que o seu pipeline de dados edita dados pessoais antes da formação, um detalhe dirigido diretamente a compradores do setor público que não podem inserir legalmente dados de cidadãos em modelos de proveniência pouco clara.
Ele roda em uma única GPU
A capacidade de implantação era claramente uma restrição de projeto, e não uma reflexão tardia. O ponto de verificação FP8 pesa aproximadamente 78 GB e é executado em uma única NVIDIA B200, B300 ou H200 – ou em duas GPUs H100 SXM5 – atendidas por meio de vLLM com raciocínio Kolibri dedicado e analisadores de chamada de ferramenta. Para um modelo de 78 bilhões de parâmetros, isso representa um espaço de hardware modesto e é a recompensa direta do projeto esparso do MoE: com apenas 3,46 bilhões de parâmetros ativos por token, o custo de inferência rastreia a contagem de parâmetros ativos em vez do total.
Especialistas escassos e atenção híbrida
Sob o capô, Kolibri empilha 50 blocos transformadores com largura de modelo de 2.560. Cada camada do MoE pontua todos os 384 especialistas roteados com um roteador sigmóide, envia cada token para os 6 primeiros e sempre executa 1 especialista compartilhado ao lado deles. A carga especializada é balanceada usando duas técnicas com nomes alfabéticos – balanceamento de quantil exato e injeção de erro de carga – que evitam que o roteador recaia todo o tráfego para um punhado de especialistas.
A atenção é onde a arquitetura fica mais interessante. Kolibri usa atenção de consulta agrupada com 48 cabeças de consulta e 4 cabeças KV, mas as camadas não são uniformes: cada quinto bloco usa atenção total sem codificação posicional, enquanto os outros 40 blocos usam atenção de janela deslizante sobre os 512 tokens anteriores, com RoPE. A consequência prática é a eficiência da memória – as camadas de janela deslizante mantêm um cache KV de tamanho fixo, de modo que apenas 10 das 50 camadas crescem com o comprimento do contexto. Na computação correspondente, Aleph Alpha relata que o design híbrido suporta sequências quatro vezes mais longas do que um modelo equivalente de atenção total. É assim que um modelo deste tamanho reivindica uma janela de contexto de um milhão de tokens sem infraestrutura exótica.
Um tokenizer desenvolvido para alemão
A maioria dos tokenizadores de fronteira trata o alemão como uma reflexão tardia, dividindo suas longas palavras compostas em fragmentos que aumentam a contagem de tokens e os custos efetivos. Aleph Alpha atacou isso diretamente com o UniBPE, um vocabulário de 128.000 tokens que constrói fusões da mesma forma que o BPE, mas pontua cada mesclagem por perda de Unigram.
Os números justificam o caso. No texto alemão, o tokenizer do Kolibri atinge 4,90 bytes por token, contra 4,35 para o tokenizer GPT-5 – o que significa 11,2% menos tokens no texto da web em alemão. Em inglês, o Kolibri também sai na frente, com 4,58 bytes por token contra 4,67 do GPT-5. Para clientes empresariais que pagam por token, isso representa um desconto direto em todas as cargas de trabalho em alemão.
Treinado em escala de fronteira
O treinamento por trás do Kolibri é substancial. O pré-treinamento cobriu 20 trilhões de tokens em 768 GPUs NVIDIA B200, seguido por 3,44 trilhões de tokens intermediários em um comprimento de sequência de 65.536 tokens. O pipeline então passou por estágios supervisionados de ajuste fino e aprendizado por reforço para produzir o modelo final com capacidade de raciocínio e seguimento de instruções. A empresa publicou um relatório de investigação técnica que abrange o processo, um nível de divulgação incomum para um laboratório europeu e claramente destinado a construir a confiança dos clientes regulamentados.
O que isso significa para o impulso da IA na Europa
Kolibri entra num mercado onde os lançamentos de peso aberto de laboratórios americanos e chineses dominam a conversa, e onde os governos europeus têm cada vez mais voz sobre a soberania digital. A aposta de Aleph Alpha é que uma fatia desse mercado – ministérios, indústria adjacente à defesa, infra-estruturas críticas – pagará por um modelo que não é apenas aberto, mas comprovadamente europeu no tratamento de dados, local de formação e postura jurídica.
Se essa aposta vale a pena depende de questões que o lançamento ainda não responde: como o Kolibri compara modelos abertos de fronteira em avaliações padrão e com que rapidez um ecossistema de ferramentas se forma em torno dele. O que o comunicado estabelece é que existe agora dentro da UE uma capacidade de formação completa, adjacente às fronteiras, com a documentação adequada. Para organizações vinculadas ao GDPR e à Lei de IA, essa combinação pode ser mais importante do que posições na tabela de classificação.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →