Um consórcio de instituições de pesquisa alemãs e empresas de IA lançou o Soofi S 30B-A3B, um modelo de linguagem aberta que, segundo o projeto, alcança as pontuações mais altas nos benchmarks inglês e alemão entre os modelos totalmente abertos. Coordenado pela KI Bundesverband, a associação nacional de IA da Alemanha, o lançamento é um dos primeiros grandes modelos de linguagem treinados inteiramente na Industrial AI Cloud da Deutsche Telekom em Munique e está posicionado como uma alternativa europeia soberana aos lançamentos de peso aberto dominantes nos Estados Unidos e na China. Para os desenvolvedores que acompanham os mais recentes desenvolvimentos de IA, o lançamento é notável menos pela escala bruta do que pela eficiência incomum e pelo foco na linguagem incorporados à arquitetura.

Um design híbrido com apenas 3,2 bilhões de parâmetros ativos

Soofi S é um modelo misto de especialistas (MoE) com 31,6 bilhões de parâmetros no total, mas ativa apenas cerca de 3,2 bilhões por token gerado. Isto coloca o seu custo computacional mais próximo de um modelo de 3 mil milhões de parâmetros do que de um modelo convencional denso de 30 mil milhões de parâmetros, uma escolha de design que visa manter a inferência suficientemente barata para ser executada na infra-estrutura europeia sem depender de fornecedores de nuvem estrangeiros.

A arquitetura é emprestada do Nemotron 3 Nano da Nvidia, combinando camadas Mamba-2 com camadas de atenção padrão em um layout híbrido. De acordo com o relatório de pré-treinamento do projeto, apenas 6 das 52 camadas do modelo mantêm um cache de valor-chave (KV) – a estrutura de memória que armazena tokens anteriores para cálculo de atenção. Em transformadores convencionais, esse cache cresce linearmente com o comprimento do contexto e se torna um grande gargalo durante a inferência de contexto longo.

A recompensa prática aparece no rendimento. Com um comprimento de contexto de 40.000 tokens com 32 solicitações paralelas, o Soofi S gera cerca de oito vezes mais tokens por segundo por GPU do que modelos densos na faixa de 14 a 24 bilhões de parâmetros. Embora a velocidade de geração dos modelos convencionais caia drasticamente à medida que o contexto aumenta, o Soofi S permanece quase estável, de 4.000 tokens até 256.000 tokens. O único modelo comparável nas medições do consórcio é o Qwen3.5 35B-A3B do Alibaba, que também utiliza uma arquitetura híbrida.

Treinado em alemão, sem sacrificar o inglês

O foco deliberado no alemão é central para o projeto. Na primeira fase de formação, o alemão representa 7,2% do conjunto de dados; na segunda fase, essa percentagem sobe para 15,3 por cento. Em comparação, na receita de referência Nemotron da Nvidia, todos os idiomas diferentes do inglês combinados representam apenas cerca de 5% do mix de treinamento.

As fontes de dados incluem texto da web em alemão do corpus HPLT, o corpus German Commons licenciado abertamente, porções alemãs de FinePDFs e FineWiki e o arquivo Genios comercialmente licenciado de 193 milhões de artigos de jornais extraídos de 916 publicações alemãs. Textos alemães traduzidos automaticamente e gerados sinteticamente completam a mistura.

O modelo processou cerca de 27 trilhões de tokens em três fases de treinamento: cerca de 20 trilhões de tokens de web ampla, código, matemática e texto específico de domínio na primeira fase; cerca de 6 trilhões de tokens de maior qualidade no segundo; e uma terceira fase mais curta que estende a janela de contexto usando documentos de até um milhão de tokens.

Resultados de referência: à frente em alemão e inglês, mais fracos em matemática

Nas avaliações de outros 16 modelos abertos, Soofi S lidera todos os modelos totalmente abertos em pontuações agregadas para alemão e inglês, de acordo com o consórcio. Isso inclui OLMo 3 32B do Allen Institute for AI e Apertus 70B da ETH Zurich e EPFL. Em relação a todos os valores de base soberanos europeus, o modelo sai à frente em todos os valores de referência alemães do conjunto, por vezes por margens de dois dígitos.

Em tarefas de código, Soofi S pontua 73,8% no HumanEval, 70,2 no MBPP e 84,2 na variante alemã do MBPP – os melhores resultados entre pares de código aberto. No INCLUDE-DE, um teste para conhecimento regional específico da Alemanha, Soofi S empata em primeiro lugar com 61,2 pontos com o maior Qwen3.5 35B-A3B. Em comparação com a linha de base do Nemotron, a receita de dados ponderada em alemão melhora a proficiência no idioma em 15,1 pontos e o benchmark científico GPQA-Diamond em 9,6 pontos, sem prejudicar o desempenho em inglês.

Existem fraquezas claras. Na competição de matemática alemã (Minerva MATH-DE), Soofi S marca 56 pontos, bem atrás de Qwen3,5 35B-A3B com 76,5 e Gemma 3 27B com 65,6. Ele também segue a recuperação factual aberta em NaturalQuestions, que a equipe atribui a ter apenas cerca de 3 bilhões de parâmetros ativos e, portanto, menos conhecimento mundial armazenado do que um modelo denso de 27B. O teste de contexto longo RULER revela outra lacuna: quando o modelo precisa extrair palavras que ocorrem com frequência de um texto longo, sua taxa de acerto cai para cerca de 3% além de 32.000 tokens, enquanto o modelo Nemotron comparável ainda consegue 60 a 64%.

Treinamento em 512 GPUs Nvidia B200 em Munique

O treinamento ocorreu entre março e maio de 2026 em até 512 GPUs Nvidia B200 na Industrial AI Cloud da Deutsche Telekom em Munique, totalizando cerca de 253.000 horas de GPU. A instalação funciona inteiramente com energia renovável, é resfriada com água do canal Eisbach e alimenta o calor residual no bairro vizinho de Tucherpark, de acordo com o relatório. O Soofi S foi um dos primeiros grandes treinamentos realizados nesta infraestrutura.

O consórcio por trás do modelo é financiado pelo Ministério Federal Alemão de Assuntos Econômicos e Energia como parte do programa europeu IPCEI-CIS. Os participantes incluem os Institutos Fraunhofer IAIS e IIS, o Centro Alemão de Pesquisa para Inteligência Artificial (DFKI), TU Darmstadt, a Universidade de Würzburg, o Centro de Pesquisa L3S, a Universidade de Ciências Aplicadas de Berlim e as empresas de IA Ellamind e Merantix Momentum.

Um debate sobre 'overtraining'

Logo após o lançamento, os críticos argumentaram que Soofi S estava fortemente sobrecarregado pelos padrões das leis clássicas de escala de chinchila publicadas pelo Google DeepMind em 2022, que sugeriam um ponto ideal aproximado de 20 tokens por parâmetro. Com 27 trilhões de tokens e cerca de 30 bilhões de parâmetros, Soofi S chega a várias centenas de tokens por parâmetro; contar apenas os 3,2 bilhões de parâmetros ativos eleva a proporção para milhares.

Michael Fromm, parte da liderança técnica do projeto, rejeitou essas críticas, argumentando que essas regras não se aplicam às arquiteturas do MoE. “Há novas pesquisas mostrando que as antigas leis de escala de modelos densos não se aplicam mais às arquiteturas MoE”, disse Fromm, observando que os especialistas individuais se beneficiam ao ver os mesmos documentos repetidamente em um grande conjunto de dados de alta qualidade. Como ponto de comparação, ele apontou a Nvidia, que treinou seus próprios modelos em até 25 trilhões de tokens.

O que é liberado e o que não é

Os pesquisadores estão lançando pesos de modelo junto com pontos de verificação intermediários selecionados, o código completo de treinamento e avaliação e um inventário de dados detalhado listando contagens de tokens brutos, números de época e contribuições efetivas por fonte. De acordo com a equipe, isso significa que Soofi S atende à Definição 1.0 de IA de código aberto da Open Source Initiative.

Uma proposta mais rigorosa para uma definição europeia de dados abertos, que exigiria que cada token de formação fosse distribuível gratuitamente, não foi cumprida porque 1,3% do mix provém do corpus Genios comercialmente licenciado. O relatório diz que cerca de 99% dos dados de treinamento ainda podem ser reconstruídos de forma independente. A licença exata para o lançamento do modelo não havia sido finalizada no momento da publicação.

O consórcio está agora à procura de parceiros da indústria para a próxima fase de teste do Soofi S em aplicações que envolvem documentos técnicos, geração de código e sistemas baseados em agentes. Para saber mais sobre lançamentos de modelos abertos, infraestrutura soberana de IA e o ecossistema europeu de IA, acompanhe a cobertura da indústria de IA publicada aqui.

Fique à frente com IA de código aberto

Lançamentos de peso aberto chegam quase semanalmente de laboratórios nos Estados Unidos, na China e agora na Europa, e a lacuna entre os maiores modelos proprietários e as melhores alternativas abertas continua diminuindo. Acompanhe as notícias de última hora sobre IA e a análise de benchmark aqui para ter uma visão completa.

Leia mais cobertura do modelo de IA →