Fireworks Research, il team di modelli all'interno della startup di inferenza Fireworks AI, ha introdotto Ember-1, un modello specializzato che secondo l'azienda produce le stesse risposte del Kimi K3 di Moonshot AI emettendo circa il 40% in meno di token. Il modello è stato pubblicato sulla piattaforma Fireworks il 23 settembre e negli ultimi giorni è diventato uno dei rilasci più discussi nella comunità degli sviluppatori, attirando centinaia di voti positivi su Hacker News mentre i programmatori discutevano se i token di ragionamento fossero la prossima frontiera dei costi.
La proposta arriva in un momento in cui i conti di inferenza, non la capacità del modello, decidono sempre più cosa i team possono permettersi di spedire. Per i team che osservano i carichi di lavoro degli agenti consumare budget, gli ultimi sviluppi dell'intelligenza artificiale hanno chiarito una cosa: l'abitudine più costosa del settore in questo momento non è formare modelli di frontiera, ma gestirli. Ember-1 è il tentativo di Fireworks di affrontare direttamente il problema e l'azienda lo ha supportato con una serie insolitamente dettagliata di benchmark e numeri di produzione.
I modelli pensanti pensano troppo
L’osservazione principale alla base di Ember-1 è che modelli di ragionamento come Kimi K3 spendono la maggior parte dei token generati – a volte più del 90%, secondo Fireworks – sul ragionamento interno piuttosto che sulla risposta stessa. Per una singola richiesta, è costoso. Nei carichi di lavoro degli agenti, la situazione si aggrava: ogni turno di una conversazione con un agente riproduce tutti i ragionamenti precedenti nel modello, quindi il contesto cresce in modo più o meno quadratico con il numero di turni e le lunghe tracce di ragionamento dei primi turni vengono rilette e fatturate ad ogni chiamata successiva.
Fireworks afferma che i clienti hanno detto loro che volevano la capacità di codifica di Kimi K3 a un costo inferiore, ma che semplicemente abbassare lo sforzo di ragionamento del modello non funzionava: le impostazioni a basso sforzo rinunciavano a troppa qualità. L’alternativa era addestrare un modello che ragioni in modo più efficiente mantenendo il ragionamento che conta.
Eliminare gli sprechi
Per costruire Ember-1 sono stati necessari più di 50 esperimenti di formazione e oltre 200 valutazioni, eseguiti interamente sulla piattaforma Serverless Training di Fireworks, secondo il post sul blog dell'azienda. Il team afferma di aver sviluppato nuovi algoritmi di addestramento lungo il percorso per abbreviare il ragionamento senza perdere la precisione.
In particolare, l’azienda non ha cercato di eliminare completamente il ragionamento. Parte dell'apparente verbosità di Kimi K3 è un'autoriflessione produttiva: rivisitare un presupposto, rispondere al feedback o far risalire un risultato a una decisione precedente aiuta il modello a riprendersi dagli errori. Il regime di allenamento è stato progettato per preservare tale capacità riducendo i cicli improduttivi.
I dati di formazione riguardavano matematica, codifica, seguito delle istruzioni, conversazione, ricerca, utilizzo di strumenti e ingegneria del software, coprendo sia problemi autonomi che interazioni estese multi-turno. Fireworks afferma di aver utilizzato solo i propri dati e nessun dato dei clienti.
Benchmark: sopra o vicino alla frontiera di Pareto
Per valutare i costi, Fireworks ha calcolato il costo per benchmark utilizzando i prezzi dell'API pubblica di Kimi K3 (3 dollari per milione di token di input non memorizzati nella cache, 0,30 dollari per milione di token di input memorizzati nella cache e 15 dollari per milione di token di output) e ha confrontato Ember-1 con K3 con sforzo di ragionamento basso, alto e massimo. Attraverso ogni benchmark con più di 50 campioni di test, l'azienda riferisce che Ember-1 si trova sulla o vicino alla frontiera di Pareto, eguagliando K3 al massimo sforzo per una frazione del costo e dominando strettamente K3 a basso sforzo.
I principali confronti con K3 al massimo sforzo, come riportato da Fireworks:
| Punto di riferimento | Campioni | K3 (sforzo massimo) | Brace-1 |
|---|---|---|---|
| Banco terminale 2.1 | 89| 80,9%| 82,0% |
| Banco SWE verificato | 500| 93,2%| 92,2%|
| SWE-Interagire | 75| 21,3%| 20,0%|
| DeepSWE 1.1 | 113| 66,4%| 75,2%|
| τ²-Bench compagnia aerea | 50| 64% | 66% |
Per quanto riguarda il costo per attività, Fireworks riporta che Ember-1 ha tagliato la spesa del 51,9% su Terminal Bench 2.1, del 32,5% su SWE-Interact, del 23,7% su DeepSWE 1.1 e del 15,5% su SWE-bench Verified rispetto a K3 al massimo sforzo - nel caso di DeepSWE, una differenza di oltre $ 126 per unità di lavoro alle tariffe calcolate dall'azienda.
L'azienda ha inoltre valutato Ember-1 su Bedside Bench di Doximity, un benchmark convalidato dai medici di 500 casi clinici in 10 specialità che Fireworks analizza attraverso il suo Specialized Intelligence Index recentemente lanciato. Lì, Fireworks afferma che Ember-1 ha stabilito una nuova frontiera di Pareto sul costo per attività sia su modelli aperti che chiusi, inclusi GPT-5.6 Sol, GPT-6 Astra e Claude Opus 5. Tale affermazione proviene dall'indice di Fireworks e non è stata verificata in modo indipendente.
Traffico in tempo reale: meno token, stessi punteggi
I benchmark sono una cosa; la produzione è un'altra. Fireworks ha eseguito test A/B in tempo reale con due clienti sui loro carichi di lavoro di codifica di produzione e ha riferito che Ember-1 ha utilizzato circa il 35% in meno di token per attività con qualità paragonabile. In un confronto misurato, Kimi K3 ha ottenuto 0,751 generando 49.300 token di output per attività, contro 0,753 per Ember-1 su 29.900 token: una riduzione del 71,3% dei token di ragionamento e del 39% in meno di token totali. Dopo i test, un cliente ha messo Ember-1 in produzione dal vivo con l'intenzione di ingrandirlo per sostituire completamente il modello base.
All'interno dello stesso Fireworks, il modello è stato tranquillamente inserito nei flussi di lavoro di codifica dell'azienda prima del lancio. Il risultato di cui il team dice di essere più orgoglioso: nessuno se ne è accorto. Gli sviluppatori hanno continuato il loro lavoro senza rilevare il passaggio consumando sostanzialmente meno token.
L'intelligenza specializzata come strategia
Ember-1 è il primo modello di una serie pianificata da Fireworks Research e arriva insieme allo Specialized Intelligence Index dell'azienda, uno sforzo di benchmarking introdotto all'inizio di questo mese per confrontare modelli aperti, chiusi e specializzati su attività del mondo reale create da esperti.
Il gioco strategico è facile da leggere. Invece di addestrare un modello di frontiera da zero, Fireworks ha preso un forte modello open-weight, vi ha addestrato l’efficienza dei token e ora vende la stessa funzionalità a un costo per attività inferiore. Mentre i rilasci open-weight da laboratori come Moonshot continuano a colmare il divario di capacità, i fornitori di inferenza stanno scoprendo che la differenziazione duratura può risiedere nel costo per attività completata piuttosto che nella posizione in classifica: un cambiamento che favorisce le aziende con una forte formazione e infrastrutture di servizio.
Vale la pena esprimere chiaramente le avvertenze: i numeri sopra riportati provengono dal blog di Fireworks, dalle sue valutazioni e dai suoi stessi clienti paganti. La replica indipendente dei risparmi sui token sui carichi di lavoro esterni sarà il vero test. Ma se i risultati dovessero reggere, il modo più conveniente per gestire un modello aperto di frontiera potrebbe non essere più quello di fargli pensare meno, ma potrebbe essere quello di gestire un modello che impari a pensare in modo efficiente.
---
Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →