Fireworks Research, het modelteam binnen de inferentiestartup Fireworks AI, heeft Ember-1 geïntroduceerd, een gespecialiseerd model dat volgens het bedrijf dezelfde antwoorden oplevert als Kimi K3 van Moonshot AI, terwijl het ongeveer 40% minder tokens uitstoot. Het model ging op 23 september live op het Fireworks-platform en de afgelopen dagen is het een van de meest besproken releases in de ontwikkelaarsgemeenschap geworden, met honderden positieve stemmen op Hacker News terwijl programmeurs debatteerden over de vraag of redeneringstokens de volgende kostenpost zijn.

Het veld komt op een moment waarop gevolgtrekkingen, en niet modelcapaciteiten, steeds vaker beslissen wat teams zich kunnen veroorloven te verzenden. Voor teams die zien hoe werklasten van agenten budgetten verbruiken, hebben [de nieuwste AI-ontwikkelingen] (https://aibuzzwire.new) één ding duidelijk gemaakt: de duurste gewoonte van de industrie op dit moment is niet het trainen van grensmodellen, maar het uitvoeren ervan. Ember-1 is de poging van Fireworks om dat probleem rechtstreeks aan te pakken, en het bedrijf ondersteunde dit met een ongewoon gedetailleerde reeks benchmark- en productiecijfers.

Denkmodellen denken te veel

De kernobservatie achter Ember-1 is dat redeneermodellen zoals Kimi K3 het grootste deel van hun gegenereerde tokens – soms meer dan 90%, volgens Fireworks – besteden aan intern redeneren in plaats van aan het antwoord zelf. Bij één aanvraag is dat duur. Bij agentische werkbelastingen wordt dit steeds groter: elke beurt van een agentgesprek herhaalt alle eerdere redeneringen terug naar het model, zodat de context ruwweg kwadratisch groeit met het aantal beurten, en lange redeneersporen uit vroege beurten opnieuw worden gelezen en opnieuw worden gefactureerd bij elk volgend gesprek.

Fireworks zegt dat klanten hen vertelden dat ze de codeermogelijkheden van Kimi K3 tegen lagere kosten wilden hebben, maar dat het eenvoudigweg afwijzen van de redeneerinspanning van het model niet werkte: de instellingen met weinig inspanning gaven te veel kwaliteit weg. Het alternatief was om een ​​model te trainen dat efficiënter redeneert en tegelijkertijd de redenering behoudt die er toe doet.

Train het afval eruit

Voor het bouwen van Ember-1 waren meer dan 50 trainingsexperimenten en meer dan 200 evaluaties nodig, volledig uitgevoerd op Fireworks' eigen Serverless Training-platform, aldus de blogpost van het bedrijf. Het team zegt dat het gaandeweg nieuwe trainingsalgoritmen heeft ontwikkeld om de redenering te verkorten zonder de nauwkeurigheid te verliezen.

Het bedrijf heeft met name niet geprobeerd het redeneren op grote schaal uit te bannen. Een deel van de schijnbare breedsprakigheid van Kimi K3 is productieve zelfreflectie: het opnieuw bekijken van een aanname, het reageren op feedback of het terugvoeren van een uitkomst naar een eerdere beslissing helpt het model te herstellen van fouten. Het trainingsregime is ontworpen om dat vermogen te behouden en tegelijkertijd onproductieve lussen in te korten.

De trainingsgegevens omvatten wiskunde, coderen, het volgen van instructies, gesprekken, zoeken, gereedschapsgebruik en software-engineering, waarbij zowel op zichzelf staande problemen als uitgebreide multi-turn-interacties werden behandeld. Fireworks zegt alleen eigen data te hebben gebruikt en geen klantdata.

Benchmarks: op of nabij de Pareto-grens

Om de kosten te illustreren, berekende Fireworks de kosten per benchmark met behulp van de openbare API-prijzen van Kimi K3 – $3 per miljoen niet-gecachte invoertokens, $0,30 per miljoen in de cache opgeslagen invoertokens en $15 per miljoen uitvoertokens – en vergeleek Ember-1 met K3 bij lage, hoge en maximale redeneringsinspanning. Voor elke benchmark met meer dan 50 testmonsters meldt het bedrijf dat Ember-1 zich op of nabij de Pareto-grens bevindt, waarbij K3 bij maximale inspanning voor een fractie van de kosten wordt geëvenaard en K3 strikt wordt gedomineerd bij lage inspanning.

De kopvergelijkingen met K3 bij maximale inspanning, zoals gerapporteerd door Fireworks:

| Benchmark | Monsters | K3 (max. inspanning) | Ember-1 |
|---|---|---|---|
| Terminalbank 2.1 | 89 | 80,9% | 82,0% |
| SWE-bank geverifieerd | 500 | 93,2% | 92,2% |
| SWE-interactie | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Bench luchtvaartmaatschappij | 50 | 64% | 66% |

Wat de kosten per taak betreft, meldt Fireworks dat Ember-1 de uitgaven met 51,9% heeft verlaagd voor Terminal Bench 2.1, 32,5% voor SWE-Interact, 23,7% voor DeepSWE 1.1 en 15,5% voor SWE-bench Verified ten opzichte van K3 bij maximale inspanning – in het geval van DeepSWE een verschil van meer dan $126 per werkeenheid tegen de door het bedrijf berekende tarieven.

Het bedrijf evalueerde Ember-1 ook op Doximity's Bedside Bench, een door artsen gevalideerde benchmark van 500 klinische gevallen in 10 specialiteiten die Fireworks doorloopt via de onlangs gelanceerde Specialized Intelligence Index. Daar zegt Fireworks dat Ember-1 een nieuwe Pareto-grens heeft ingesteld op het gebied van de kosten per taak voor zowel open als gesloten modellen, waaronder GPT-5.6 Sol, GPT-6 Astra en Claude Opus 5. Die bewering komt uit de eigen index van Fireworks en is niet onafhankelijk geverifieerd.

Live verkeer: minder tokens, dezelfde scores

Benchmarks zijn één ding; productie is een andere. Fireworks voerde met twee klanten live A/B-tests uit op hun productiecoderingsworkloads en rapporteerde dat Ember-1 ongeveer 35% minder tokens per taak gebruikte bij vergelijkbare kwaliteit. In één gemeten vergelijking scoorde Kimi K3 0,751 terwijl hij 49.300 uitvoertokens per taak genereerde, tegenover 0,753 voor Ember-1 op 29.900 tokens – een vermindering van 71,3% in redeneertokens en 39% minder totale tokens. Na de tests heeft een klant de Ember-1 live in productie genomen met plannen om deze op te schalen om het basismodel volledig te vervangen.

Binnen Fireworks zelf werd het model vóór de lancering stilletjes omgezet in de eigen codeerworkflows van het bedrijf. Het resultaat waar het team naar eigen zeggen het meest trots op is: niemand heeft er iets van gemerkt. Ontwikkelaars gingen door met hun werk zonder de overstap te detecteren, terwijl ze aanzienlijk minder tokens gebruikten.

Gespecialiseerde intelligentie als strategie

Ember-1 is het eerste model in een geplande serie van Fireworks Research en komt samen met de Specialized Intelligence Index van het bedrijf, een benchmarking-inspanning die eerder deze maand werd geïntroduceerd om open, gesloten en gespecialiseerde modellen te vergelijken voor door experts gemaakte taken uit de echte wereld.

Het strategische spel is gemakkelijk te lezen. In plaats van een grensmodel helemaal opnieuw te trainen, heeft Fireworks een sterk open-weight-model gebruikt, de token-efficiëntie erin getraind en nu dezelfde mogelijkheid verkocht tegen lagere kosten per taak. Terwijl open-weight releases van laboratoria als Moonshot de capaciteitskloof blijven dichten, ontdekken aanbieders van inferenties dat het duurzame onderscheid wellicht in de kosten per voltooide taak ligt in plaats van in de ranglijstpositie – een verschuiving die in het voordeel is van bedrijven met een sterke opleidings- en dienstverleningsinfrastructuur.

De kanttekeningen zijn de moeite waard om duidelijk te vermelden: de bovenstaande cijfers zijn afkomstig van Fireworks' eigen blog, zijn eigen evaluaties en zijn eigen betalende klanten. Onafhankelijke replicatie van de tokenbesparingen op externe werklasten zal de echte test zijn. Maar als de resultaten standhouden, is de meest kosteneffectieve manier om een ​​open model van de grensklasse te runnen misschien niet langer het minder nadenken; het kan zijn dat je een model gebruikt dat leert efficiënt te denken.
---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →