Reflection AI, a startup americana apoiada pela Nvidia, apresentou seu primeiro modelo de peso aberto em 5 de outubro, um sistema esparso de mistura de especialistas chamado Beam, que a empresa posiciona como o mais forte desafio ocidental até agora para a fronteira de peso aberto atualmente dominada por laboratórios chineses. O anúncio, publicado no próprio blog da Reflection e rapidamente divulgado pela Reuters, TechCrunch, Fortune e Semafor, chega com uma reviravolta: o modelo ainda não pode ser baixado.
A Beam está passando pelo que a empresa descreve como red-teaming e avaliações finais. O acesso antecipado é aberto por meio de um processo de inscrição, e a Reflection afirma que lançará os pesos, um relatório técnico, um cartão modelo e artefatos de desenvolvedor ainda este mês. Quando isso acontecer, o Beam se tornará um dos maiores lançamentos de peso aberto já publicados por um laboratório dos EUA, e o teste mais claro até agora para saber se uma empresa americana pode igualar a cadência e a abertura de lançamento que fizeram dos modelos chineses a escolha padrão para grande parte da comunidade de código aberto. Para cobertura contínua da corrida de peso aberto e tudo mais que move o campo, marque nossa página inicial de notícias de IA.
Os números por trás do feixe
Beam é um modelo esparso de mistura de especialistas com 501 bilhões de parâmetros totais, dos quais cerca de 23 bilhões estão ativos por token. A Reflection diz que pré-treinou o modelo em 23,8 trilhões de tokens extraídos da web e de conjuntos de dados licenciados proprietários, alegando que o modelo básico corresponde ou supera modelos de base aberta de tamanho semelhante.
A afirmação mais distinta diz respeito à aprendizagem por reforço. A Reflection construiu algoritmos, ambientes de treinamento e infraestrutura para sustentar RL de alta computação em escala, e a empresa relata que sua execução de RL gerou mais de 100 milhões de implementações em 10.500 GPUs NVIDIA GB300 ao longo de quatro semanas de treinamento. Esse é um investimento RL incomumente grande para um lançamento de peso aberto, e a Reflection credita isso ao desempenho competitivo do Beam com o que chama de eficiência computacional de inferência de fronteira.
Benchmarks: competitivos, ainda não líderes
A tabela de benchmark publicada pela Reflection coloca o Beam solidamente no grupo de peso aberto, atrás dos maiores modelos chineses, mas à frente ou no mesmo nível de vários nomes estabelecidos.
No SWE-Bench Pro v2-Hard, Beam pontua 77,2, atrás do GLM 5,3 com 88,2 e Kimi K3 com 88,2 na mesma linha, mas bem à frente de Inkling com 56,9. No SWE-Bench Pro v1, Beam pontua 65,5, à frente de Inkling (54,3), Nemotron 3 Ultra (46,4) e GLM 5,2 (62,1), enquanto Qwen 3,8-Max registra 67,7. No benchmark de codificação agente DeepSWE v1.1, o Beam registra 44,4, nível 44,0 do GLM 5.2 e atrás do GLM 5.3 (61,0), Qwen 3.8-Max (51,0) e DeepSeek V4.1 Flash (74,2).
O enquadramento da própria empresa é sincero sobre a posição de Beam. Na postagem do blog, a Reflection escreve que o Beam “avança a fronteira ocidental de peso aberto” e é “competitivo com modelos abertos maiores, como GLM 5.2 e se aproximando do Qwen 3.8-Max em codificação e tarefas de agência”. Ele também admite que modelos de fronteira aberta como o Kimi K3 “permanecem à frente em capacidade bruta”.
Duas advertências merecem destaque. Primeiro, cada número aqui é auto-relatado pela Reflection antes da divulgação do peso, e a verificação independente só será possível quando o relatório técnico e os pontos de verificação forem públicos. Em segundo lugar, várias células na tabela da própria empresa estão marcadas como não reportadas, o que torna impossíveis comparações completas entre maçãs por enquanto.
O argumento da eficiência
O que a Reflection apresenta como a verdadeira vantagem do Beam não é a posição bruta na tabela de classificação, mas o custo no momento da inferência. Como apenas 23 bilhões de seus 501 bilhões de parâmetros são ativados por token, a empresa argumenta que o Beam pode fornecer desempenho de codificação e agente próximo da fronteira por uma fração do custo de computação de modelos densos maiores. Esse posicionamento reflete a estratégia que tornou as famílias chinesas de peso aberto tão populares entre as startups: capacidade suficientemente forte a preços que tornem os agentes sempre ativos economicamente viáveis.
Se a afirmação de eficiência sobreviver a um benchmarking independente, poderá ser mais importante do que os deltas da tabela de classificação. As equipes que executam milhares de agentes de codificação paralela se preocupam mais com o custo por tarefa concluída do que com pontos de referência de um dígito.
Uma tendência geopolítica
A cobertura do lançamento foi surpreendentemente geopolítica para um lançamento de modelo de código aberto. A Reuters descreveu o Beam como o “primeiro modelo de IA” da Reflection a “assumir os modelos abertos chineses”. A Fortune perguntou se a Beam poderia ser “a melhor chance da América de competir com a China”, e a Semafor enquadrou a empresa como “uma resposta ocidental de código aberto aos laboratórios chineses”.
Esse enquadramento reflete o estado do ecossistema de peso aberto no final de 2026: os modelos mais capazes para download vieram esmagadoramente de laboratórios chineses, incluindo a família GLM de Z.ai, a linha Kimi de Moonshot, Qwen de Alibaba e DeepSeek. Os laboratórios americanos mantiveram em grande parte seus melhores pesos fechados, apostando na receita de API. A Reflection está apostando no oposto: que um modelo de fronteira ocidental aberta pode atrair o ecossistema de desenvolvedores, e que o apoio da Nvidia lhe dá a pista de computação para acompanhar.
O que acontece a seguir
A divulgação do peso no final deste mês responderá às questões importantes: qual o desempenho do Beam fora das avaliações do próprio Reflection, qual licença acompanha os pesos e se a eficiência se mantém sob carga independente. Até então, o Beam continua sendo uma tabela de referência promissora, um formulário de inscrição e a promessa de peso aberto mais importante que um laboratório americano fez este ano.
Para os desenvolvedores que decidem padronizar o GLM, Kimi, Qwen ou esperar pelo Beam, o conselho prático é manter as decisões finais até que o relatório técnico e as avaliações de terceiros cheguem. A corrida do absoluto tem um novo participante americano e, pela primeira vez em muito tempo, ele não larga do final do pelotão.
Fique à frente da IA
A fronteira do peso aberto se move semanalmente e os laboratórios são lançados mais rápido do que qualquer um pode acompanhar. Leia mais notícias sobre IA no AI Buzz Wire para lançamentos de modelos, análises de benchmark e histórias de negócios por trás deles.
Explore os últimos desenvolvimentos de IA aqui.