A Fireworks Research, a equipe modelo da startup de inferência Fireworks AI, lançou o Ember-1, um modelo especializado que, segundo a empresa, produz as mesmas respostas que o Kimi K3 da Moonshot AI, ao mesmo tempo que emite cerca de 40% menos tokens. O modelo foi lançado na plataforma Fireworks em 23 de setembro e, nos últimos dias, tornou-se um dos lançamentos mais discutidos na comunidade de desenvolvedores, atraindo centenas de votos positivos no Hacker News enquanto os programadores debatiam se os tokens de raciocínio seriam a próxima fronteira de custo.

A proposta surge em um momento em que as contas de inferência, e não a capacidade do modelo, decidem cada vez mais o que as equipes podem oferecer. Para as equipes que observam as cargas de trabalho dos agentes consumirem orçamentos, os mais recentes desenvolvimentos de IA deixaram uma coisa clara: o hábito mais caro do setor no momento não é treinar modelos de fronteira, mas sim executá-los. O Ember-1 é a tentativa do Fireworks de atacar esse problema diretamente, e a empresa o apoiou com um conjunto incomumente detalhado de benchmarks e números de produção.

Modelos de pensamento pensam demais

A principal observação por trás do Ember-1 é que modelos de raciocínio como o Kimi K3 gastam a maior parte de seus tokens gerados – às vezes mais de 90%, de acordo com o Fireworks – no raciocínio interno, e não na resposta em si. Em uma única solicitação, isso é caro. Em cargas de trabalho de agente, isso se agrava: cada turno de uma conversa do agente reproduz todo o raciocínio anterior de volta ao modelo, de modo que o contexto cresce aproximadamente quadraticamente com o número de turnos, e longos traços de raciocínio dos primeiros turnos são relidos e cobrados novamente em cada chamada subsequente.

A Fireworks diz que os clientes lhes disseram que queriam a capacidade de codificação do Kimi K3 a um custo menor, mas que simplesmente recusar o esforço de raciocínio do modelo não funcionou – as configurações de baixo esforço ofereciam muita qualidade. A alternativa foi treinar um modelo que raciocinasse com mais eficiência e ao mesmo tempo mantivesse o raciocínio que importa.

Treinamento para eliminar o desperdício

A construção do Ember-1 exigiu mais de 50 experimentos de treinamento e mais de 200 avaliações, executadas inteiramente na plataforma de treinamento sem servidor do Fireworks, de acordo com a postagem no blog da empresa. A equipe afirma ter desenvolvido novos algoritmos de treinamento ao longo do caminho para encurtar o raciocínio sem perder a precisão.

Notavelmente, a empresa não tentou eliminar o raciocínio por atacado. Parte da aparente verbosidade de Kimi K3 é uma autorreflexão produtiva – revisitar uma suposição, responder ao feedback ou rastrear um resultado até uma decisão anterior ajuda o modelo a se recuperar de erros. O regime de treinamento foi projetado para preservar essa habilidade enquanto corta loops improdutivos.

Os dados de treinamento abrangeram matemática, codificação, acompanhamento de instruções, conversação, pesquisa, uso de ferramentas e engenharia de software, cobrindo problemas autônomos e interações estendidas de múltiplas voltas. A Fireworks afirma que usou apenas seus próprios dados e nenhum dado de cliente.

Benchmarks: na fronteira de Pareto ou perto dela

Para justificar o custo, o Fireworks calculou o custo por benchmark usando o preço da API pública do Kimi K3 – US$ 3 por milhão de tokens de entrada não armazenados em cache, US$ 0,30 por milhão de tokens de entrada armazenados em cache e US$ 15 por milhão de tokens de saída – e comparou o Ember-1 com o K3 em esforço de raciocínio baixo, alto e máximo. Em todos os benchmarks com mais de 50 amostras de teste, a empresa relata que o Ember-1 fica na fronteira de Pareto ou próximo a ela, igualando o K3 com esforço máximo por uma fração do custo e dominando estritamente o K3 com baixo esforço.

As comparações das manchetes com o K3 com esforço máximo, conforme relatado pelo Fireworks:

| Referência | Amostras | K3 (esforço máximo) | Brasa-1 |
|---|---|---|---|
| Bancada Terminal 2.1 | 89 | 80,9% | 82,0% |
| Banco SWE verificado | 500 | 93,2% | 92,2% |
| SWE-Interagir | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Companhia Aérea de Banco | 50 | 64% | 66% |

No custo por tarefa, o Fireworks relata que o Ember-1 reduziu os gastos em 51,9% no Terminal Bench 2.1, 32,5% no SWE-Interact, 23,7% no DeepSWE 1.1 e 15,5% no SWE-bench Verified em relação ao K3 com esforço máximo - no caso do DeepSWE, uma diferença de mais de US$ 126 por unidade de trabalho nas taxas calculadas da empresa.

A empresa também avaliou o Ember-1 no Bedside Bench da Doximity, uma referência validada por médicos de 500 casos clínicos em 10 especialidades que o Fireworks executa por meio de seu recém-lançado Índice de Inteligência Especializada. Lá, o Fireworks diz que o Ember-1 estabeleceu uma nova fronteira de Pareto no custo por tarefa em modelos abertos e fechados, incluindo GPT-5.6 Sol, GPT-6 Astra e Claude Opus 5. Essa afirmação vem do próprio índice do Fireworks e não foi verificado de forma independente.

Tráfego ao vivo: menos tokens, mesmas pontuações

Os benchmarks são uma coisa; a produção é outra. O Fireworks executou testes A/B ao vivo com dois clientes em suas cargas de trabalho de codificação de produção e relatou que o Ember-1 usou aproximadamente 35% menos tokens por tarefa com qualidade comparável. Em uma comparação medida, Kimi K3 obteve pontuação de 0,751 ao gerar 49.300 tokens de saída por tarefa, contra 0,753 para Ember-1 em 29.900 tokens – uma redução de 71,3% nos tokens de raciocínio e 39% menos tokens totais. Após os testes, um cliente transferiu o Ember-1 para produção ao vivo com planos de ampliá-lo para substituir totalmente o modelo básico.

Dentro do próprio Fireworks, o modelo foi discretamente trocado pelos fluxos de trabalho de codificação da própria empresa antes do lançamento. O resultado do qual a equipe mais se orgulha: ninguém percebeu. Os desenvolvedores continuaram seu trabalho sem detectar a mudança, consumindo substancialmente menos tokens.

Inteligência Especializada como Estratégia

Ember-1 é o primeiro modelo de uma série planejada da Fireworks Research e chega junto com o Índice de Inteligência Especializada da empresa, um esforço de benchmarking introduzido no início deste mês para comparar modelos abertos, fechados e especializados em tarefas do mundo real criadas por especialistas.

A jogada estratégica é fácil de ler. Em vez de treinar um modelo de fronteira do zero, o Fireworks adotou um modelo forte de peso aberto, treinou nele a eficiência do token e agora está vendendo a mesma capacidade a um custo por tarefa menor. À medida que lançamentos abertos de laboratórios como o Moonshot continuam fechando a lacuna de capacidade, os provedores de inferência estão descobrindo que a diferenciação durável pode estar no custo por tarefa concluída, e não na posição na tabela de classificação – uma mudança que favorece empresas com forte treinamento e infraestrutura de atendimento.

Vale a pena declarar claramente as advertências: os números acima vêm do próprio blog do Fireworks, de suas próprias avaliações e de seus próprios clientes pagantes. A replicação independente da economia de tokens em cargas de trabalho externas será o verdadeiro teste. Mas se os resultados se mantiverem, a forma mais económica de gerir um modelo aberto de classe fronteiriça poderá já não ser fazê-lo pensar menos – poderá ser gerir um modelo que aprendeu a pensar de forma eficiente.
---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →