Fireworks Research, das Modellteam des Inferenz-Startups Fireworks AI, hat Ember-1 eingeführt, ein spezielles Modell, das nach Angaben des Unternehmens die gleichen Antworten wie Kimi K3 von Moonshot AI liefert und dabei etwa 40 % weniger Token ausgibt. Das Modell ging am 23. September auf der Fireworks-Plattform live und hat sich in den letzten Tagen zu einer der am meisten diskutierten Veröffentlichungen in der Entwickler-Community entwickelt. Hunderte positive Stimmen wurden auf Hacker News abgegeben, während Programmierer darüber debattierten, ob Reasoning-Tokens die nächste Kostengrenze darstellen.
Der Pitch kommt zu einem Zeitpunkt, an dem Inferenzrechnungen und nicht die Modellfähigkeit zunehmend darüber entscheiden, welche Lieferungen sich Teams leisten können. Für Teams, die beobachten, wie Agenten-Workloads Budgets verschlingen, haben die neuesten KI-Entwicklungen eines deutlich gemacht: Die derzeit teuerste Angewohnheit der Branche besteht nicht darin, Grenzmodelle zu trainieren, sondern sie auszuführen. Ember-1 ist der Versuch von Fireworks, dieses Problem direkt anzugehen, und das Unternehmen untermauerte dies mit ungewöhnlich detaillierten Benchmark- und Produktionszahlen.
Denkende Modelle denken zu viel
Die Kernbeobachtung hinter Ember-1 ist, dass Argumentationsmodelle wie Kimi K3 den Großteil ihrer generierten Token – laut Fireworks manchmal mehr als 90 % – für interne Überlegungen und nicht für die Antwort selbst ausgeben. Bei einer einzigen Anfrage ist das teuer. Bei Agenten-Arbeitsbelastungen kommt es noch schlimmer: Bei jeder Runde eines Agentengesprächs werden alle vorherigen Argumente an das Modell zurückgegeben, sodass der Kontext ungefähr quadratisch mit der Anzahl der Runden wächst und lange Argumentationsspuren aus frühen Runden bei jedem weiteren Anruf erneut gelesen und in Rechnung gestellt werden.
Laut Fireworks sagten Kunden, sie wollten die Codierfähigkeit von Kimi K3 zu geringeren Kosten, aber dass es nicht funktionierte, den Argumentationsaufwand des Modells einfach herunterzufahren – die Einstellungen mit geringem Aufwand führten zu zu viel Qualität. Die Alternative bestand darin, ein Modell zu trainieren, das effizienter argumentiert und gleichzeitig die Argumentation, auf die es ankommt, beibehält.
Den Abfall raus trainieren
Laut dem Blogbeitrag des Unternehmens waren für den Aufbau von Ember-1 mehr als 50 Trainingsexperimente und über 200 Evaluierungen erforderlich, die vollständig auf der eigenen serverlosen Trainingsplattform von Fireworks durchgeführt wurden. Das Team gab an, nebenbei neue Trainingsalgorithmen entwickelt zu haben, um die Argumentation zu verkürzen, ohne an Genauigkeit zu verlieren.
Insbesondere hat das Unternehmen nicht versucht, die Argumentation pauschal zu beseitigen. Ein Teil der offensichtlichen Ausführlichkeit von Kimi K3 ist produktive Selbstreflexion – das Überdenken einer Annahme, das Reagieren auf Feedback oder das Zurückverfolgen eines Ergebnisses auf eine frühere Entscheidung hilft dem Modell, sich von Fehlern zu erholen. Das Trainingsprogramm wurde entwickelt, um diese Fähigkeit zu bewahren und gleichzeitig unproduktive Schleifen zu kürzen.
Die Trainingsdaten umfassten Mathematik, Codierung, Befolgen von Anweisungen, Konversation, Suche, Werkzeugnutzung und Softwareentwicklung und deckten sowohl eigenständige Probleme als auch erweiterte Interaktionen mit mehreren Runden ab. Fireworks gibt an, nur eigene Daten und keine Kundendaten verwendet zu haben.
Benchmarks: An oder nahe der Pareto-Grenze
Um die Kosten zu verdeutlichen, berechnete Fireworks die Kosten pro Benchmark mithilfe der öffentlichen API-Preise von Kimi K3 – 3 US-Dollar pro Million nicht zwischengespeicherter Eingabe-Tokens, 0,30 US-Dollar pro Million zwischengespeicherter Eingabe-Tokens und 15 US-Dollar pro Million Ausgabe-Tokens – und verglich Ember-1 mit K3 bei niedrigem, hohem und maximalem Argumentationsaufwand. Bei jedem Benchmark mit mehr als 50 Testproben berichtet das Unternehmen, dass Ember-1 an oder nahe der Pareto-Grenze liegt, K3 bei maximalem Aufwand zu einem Bruchteil der Kosten erreicht und K3 bei geringem Aufwand strikt dominiert.
Die wichtigsten Vergleiche mit K3 bei maximaler Anstrengung, wie von Fireworks berichtet:
| Benchmark | Proben | K3 (maximale Anstrengung) | Glut-1 |
|---|---|---|---|
| Terminalbank 2.1 | 89 | 80,9 % | 82,0 % |
| SWE-Bench verifiziert | 500 | 93,2 % | 92,2 % |
| SWE-Interact | 75 | 21,3 % | 20,0 % |
| DeepSWE 1.1 | 113 | 66,4 % | 75,2 % |
| τ²-Bench Airline | 50 | 64 % | 66 % |
In Bezug auf die Kosten pro Aufgabe berichtet Fireworks, dass Ember-1 die Ausgaben um 51,9 % für Terminal Bench 2.1, 32,5 % für SWE-Interact, 23,7 % für DeepSWE 1.1 und 15,5 % für SWE-bench Verified im Vergleich zu K3 bei maximalem Aufwand gesenkt hat – im Fall von DeepSWE eine Differenz von mehr als 126 US-Dollar pro Arbeitseinheit zu den vom Unternehmen berechneten Sätzen.
Das Unternehmen bewertete Ember-1 außerdem auf der „Bedside Bench“ von Doximity, einem von Ärzten validierten Benchmark von 500 klinischen Fällen in 10 Fachgebieten, den Fireworks anhand seines neu eingeführten Specialized Intelligence Index durchläuft. Laut Fireworks hat Ember-1 eine neue Pareto-Grenze für die Kosten pro Aufgabe sowohl bei offenen als auch bei geschlossenen Modellen gesetzt, darunter GPT-5.6 Sol, GPT-6 Astra und Claude Opus 5. Diese Behauptung stammt aus dem eigenen Index von Fireworks und wurde nicht unabhängig überprüft.
Live-Verkehr: Weniger Token, gleiche Ergebnisse
Benchmarks sind eine Sache; Produktion ist eine andere. Fireworks führte Live-A/B-Tests mit zwei Kunden zu ihren Produktions-Codierungs-Workloads durch und berichtet, dass Ember-1 bei vergleichbarer Qualität etwa 35 % weniger Token pro Aufgabe verbrauchte. In einem gemessenen Vergleich erzielte Kimi K3 0,751 Punkte bei der Generierung von 49.300 Ausgabe-Tokens pro Aufgabe, gegenüber 0,753 für Ember-1 bei 29.900 Tokens – eine Reduzierung um 71,3 % bei den Reasoning-Tokens und 39 % weniger Gesamt-Tokens. Nach den Tests überführte ein Kunde Ember-1 in die Live-Produktion mit dem Plan, es zu vergrößern, um das Basismodell vollständig zu ersetzen.
Innerhalb von Fireworks selbst wurde das Modell vor der Veröffentlichung stillschweigend in die unternehmenseigenen Codierungsworkflows integriert. Das Ergebnis, auf das das Team nach eigenen Angaben am stolzesten ist: Niemand hat es gemerkt. Die Entwickler setzten ihre Arbeit fort, ohne den Wechsel zu bemerken, und verbrauchten dabei wesentlich weniger Token.
Spezialisierte Intelligenz als Strategie
Ember-1 ist das erste Modell einer geplanten Serie von Fireworks Research und wird zusammen mit dem Specialized Intelligence Index des Unternehmens eingeführt, einem Benchmarking-Ansatz, der Anfang dieses Monats eingeführt wurde, um offene, geschlossene und spezialisierte Modelle für von Experten erstellte reale Aufgaben zu vergleichen.
Das strategische Spiel ist leicht zu lesen. Anstatt ein Frontier-Modell von Grund auf zu trainieren, hat Fireworks ein starkes Open-Weight-Modell übernommen, die Token-Effizienz darin trainiert und verkauft nun die gleichen Fähigkeiten zu geringeren Kosten pro Aufgabe. Während Open-Weight-Releases von Laboren wie Moonshot die Leistungslücke immer weiter schließen, stellen Inferenzanbieter fest, dass die dauerhafte Differenzierung möglicherweise eher in den Kosten pro abgeschlossener Aufgabe als in der Bestenliste liegt – eine Verschiebung, die Unternehmen mit einer starken Schulungs- und Serviceinfrastruktur begünstigt.
Die Vorbehalte sind deutlich zu erwähnen: Die oben genannten Zahlen stammen aus dem eigenen Blog von Fireworks, seinen eigenen Bewertungen und seinen eigenen zahlenden Kunden. Die unabhängige Replikation der Token-Einsparungen auf externe Workloads wird der eigentliche Test sein. Wenn die Ergebnisse jedoch zutreffen, besteht der kostengünstigste Weg, ein offenes Modell der Grenzklasse auszuführen, möglicherweise nicht mehr darin, es weniger denken zu lassen, sondern darin, ein Modell auszuführen, das gelernt hat, effizient zu denken.
---
Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →