Fireworks Research, modellteamet inom inferensstartupen Fireworks AI, har introducerat Ember-1, en specialiserad modell som företaget säger ger samma svar som Moonshot AI:s Kimi K3 samtidigt som den släpper ut ungefär 40 % färre tokens. Modellen gick live på Fireworks plattform den 23 september, och under de senaste dagarna har den blivit en av de mest diskuterade utgåvorna i utvecklargemenskapen, och drar hundratals uppröster på Hacker News när kodare diskuterade om resonemangstokens är nästa kostnadsgräns.

Pitch kommer i ett ögonblick då slutsatser, inte modellkapacitet, i allt högre grad avgör vad team har råd att skicka. För team som ser att agenter konsumerar budgetar har den senaste AI-utvecklingen gjort en sak klar: branschens dyraste vana just nu är inte att träna frontiermodeller, det är att köra dem. Ember-1 är Fireworks försök att attackera det problemet direkt, och företaget stödde det med en ovanligt detaljerad uppsättning benchmark- och produktionsnummer.

Tänkande modeller tänker för mycket

Kärnobservationen bakom Ember-1 är att resonemangsmodeller som Kimi K3 spenderar majoriteten av sina genererade tokens - ibland mer än 90%, enligt Fireworks - på interna resonemang snarare än på själva svaret. På en enda begäran är det dyrt. I agentarbetsbelastningar förvärras det: varje vändning i en agentkonversation spelar upp alla tidigare resonemang tillbaka till modellen, så sammanhanget växer ungefär kvadratiskt med antalet vändningar, och långa resonemangsspår från tidiga vändningar läses om och faktureras på nytt vid varje efterföljande samtal.

Fireworks säger att kunderna sa till dem att de ville ha Kimi K3:s kodningsförmåga till en lägre kostnad, men att det inte fungerade att helt enkelt tacka nej till modellens resonemang – inställningarna med låg ansträngning gav upp för mycket kvalitet. Alternativet var att träna en modell som resonerar mer effektivt samtidigt som man behåller resonemanget som betyder något.

Utbilda avfallet

Building Ember-1 tog mer än 50 träningsexperiment och över 200 utvärderingar, körda helt på Fireworks egen Serverless Training-plattform, enligt företagets blogginlägg. Teamet säger att det utvecklat nya träningsalgoritmer längs vägen för att förkorta resonemang utan att tappa exaktheten.

Noterbart, företaget försökte inte eliminera resonemang partihandel. En del av Kimi K3:s uppenbara mångsidighet är produktiv självreflektion - att återgå till ett antagande, svara på feedback eller spåra ett resultat tillbaka till ett tidigare beslut hjälper modellen att återhämta sig från misstag. Träningsregimen var utformad för att bevara den förmågan samtidigt som den trimmade improduktiva loopar.

Träningsdatan sträckte sig över matematik, kodning, instruktionsföljning, konversation, sökning, verktygsanvändning och mjukvaruutveckling, och täckte både fristående problem och utökade interaktioner med flera svängar. Fireworks säger att de bara använde sin egen data och ingen kunddata.

Benchmarks: På eller nära Pareto Frontier

För att göra kostnadsfallet, beräknade Fireworks kostnaden per benchmark med hjälp av Kimi K3:s offentliga API-prissättning – 3 USD per miljon uncachade indatatokens, 0,30 USD per miljon cachade indatatokens och 15 USD per miljon outputtokens – och jämförde Ember-1 mot K3 vid låg, hög och maximal resonemangsansträngning. Över varje benchmark med mer än 50 testprover rapporterar företaget att Ember-1 sitter på eller nära Pareto-gränsen, matchar K3 med maximal ansträngning för en bråkdel av kostnaden och dominerar strikt K3 vid låg ansträngning.

Rubriken jämförs med K3 vid maximal ansträngning, som rapporterats av Fireworks:

| Benchmark | Prover | K3 (max ansträngning) | Ember-1 |
|---|---|---|---|
| Terminal Bench 2.1 | 89 | 80,9 % | 82,0 % |
| SWE-bänk Verifierad | 500 | 93,2 % | 92,2 % |
| SWE-Interact | 75 | 21,3 % | 20,0 % |
| DeepSWE 1.1 | 113 | 66,4 % | 75,2 % |
| τ²-Bench Airline | 50 | 64 % | 66 % |

När det gäller kostnad per uppgift rapporterar Fireworks att Ember-1 sänkte utgifterna med 51,9 % på Terminal Bench 2.1, 32,5 % på SWE-Interact, 23,7 % på DeepSWE 1.1 och 15,5 % på SWE-bench Verified i förhållande till K3 vid maximal ansträngning – i fallet med DeepSWE:s arbete på mer än 126 USD per enhet, beräknas skillnaden på 126 USD. priser.

Företaget utvärderade också Ember-1 på Doximity's Bedside Bench, ett läkarvaliderat riktmärke av 500 kliniska fall över 10 specialiteter som Fireworks kör genom sitt nylanserade Specialized Intelligence Index. Där säger Fireworks att Ember-1 satte en ny Pareto-gräns för kostnad per uppgift över både öppna och slutna modeller, inklusive GPT-5.6 Sol, GPT-6 Astra och Claude Opus 5. Det påståendet kommer från Fireworks eget index och har inte verifierats oberoende.

Livetrafik: färre tokens, samma poäng

Riktmärken är en sak; produktion är en annan. Fireworks körde live A/B-tester med två kunder på deras produktionskodningsarbetsbelastningar och rapporterar att Ember-1 använde cirka 35 % färre tokens per uppgift med jämförbar kvalitet. I en uppmätt jämförelse fick Kimi K3 0,751 samtidigt som den genererade 49 300 output-tokens per uppgift, mot 0,753 för Ember-1 på 29 900 tokens - en 71,3% minskning av resonemangstokens och 39% färre totala tokens. Efter testerna flyttade en kund Ember-1 till liveproduktion med planer på att skala upp den för att ersätta basmodellen helt.

Inne i själva Fireworks byttes modellen tyst in i företagets egna kodningsarbetsflöden innan lanseringen. Resultatet som teamet säger sig vara stoltast över: ingen märkte det. Utvecklare fortsatte sitt arbete utan att upptäcka switchen samtidigt som de förbrukade betydligt färre tokens.

Specialiserad intelligens som strategi

Ember-1 är den första modellen i en planerad serie från Fireworks Research, och den kommer tillsammans med företagets Specialized Intelligence Index, en benchmarkingsatsning som introducerades tidigare denna månad för att jämföra öppna, stängda och specialiserade modeller på expertskapade verkliga uppgifter.

Den strategiska pjäsen är lätt att läsa. Istället för att träna en gränsmodell från början tog Fireworks en stark modell med öppen vikt, tränade in tokeneffektivitet i den och säljer nu samma kapacitet till en lägre kostnad per uppgift. Eftersom öppna släpp från labb som Moonshot fortsätter att täppa till kapacitetsgapet, upptäcker slutledningsleverantörer att den varaktiga differentieringen kan ligga i kostnad per genomförd uppgift snarare än position i topplistan – ett skifte som gynnar företag med stark utbildning och serviceinfrastruktur.

Förbehållen är värda att uttrycka tydligt: ​​siffrorna ovan kommer från Fireworks egen blogg, sina egna utvärderingar och sina egna betalande kunder. Oberoende replikering av token-besparingar på externa arbetsbelastningar kommer att vara det verkliga testet. Men om resultaten håller, kanske det mest kostnadseffektiva sättet att driva en öppen modell i frontierklass inte längre är att få den att tänka mindre – det kan vara att köra en modell som lärt sig att tänka effektivt.
---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →