Fireworks Research, modelový tým uvnitř inferenčního startupu Fireworks AI, představil Ember-1, specializovaný model, který podle společnosti produkuje stejné odpovědi jako Kimi K3 od Moonshot AI, přičemž vydává zhruba o 40 % méně tokenů. Tento model byl spuštěn na platformě Fireworks 23. září a během posledních několika dní se stal jedním z nejdiskutovanějších vydání ve vývojářské komunitě, který získal stovky kladných hlasů na Hacker News, zatímco kodéři debatovali o tom, zda jsou tokeny uvažování další hranicí nákladů.
Hřiště přichází ve chvíli, kdy se o tom, co si týmy mohou dovolit dodávat, stále více rozhodují odvozené účty, nikoli modelové schopnosti. Pro týmy, které sledují zátěže agentů, spotřebovávají rozpočty, nejnovější vývoj AI objasnil jednu věc: nejdražším zvykem v tomto odvětví momentálně není trénovat hraniční modely, ale provozovat je. Ember-1 je pokus Fireworks zaútočit na tento problém přímo a společnost jej podpořila neobvykle podrobným souborem benchmarků a výrobních čísel.
Modely myšlení příliš mnoho
Hlavním postřehem Ember-1 je, že modely uvažování, jako je Kimi K3, utrácejí většinu svých vygenerovaných tokenů – někdy více než 90 %, podle Fireworks – na interní uvažování spíše než na samotnou odpověď. Na jednu žádost je to drahé. V agentní pracovní zátěži se to sčítá: každé kolo konverzace agenta přehraje všechny předchozí úvahy zpět do modelu, takže kontext roste zhruba kvadraticky s počtem kol a dlouhé stopy uvažování z prvních kol se znovu přečtou a přeúčtují při každém dalším hovoru.
Fireworks říká, že zákazníci jim řekli, že chtějí kódovací schopnosti Kimi K3 za nižší cenu, ale že pouhé odmítnutí uvažování modelu nefungovalo – nastavení s nízkou námahou ztratilo příliš mnoho kvality. Alternativou bylo trénovat model, který argumentuje efektivněji a přitom zachovává argumentaci, na které záleží.
Školení odpadu
Budování Ember-1 zahrnovalo více než 50 školicích experimentů a více než 200 hodnocení, které probíhaly výhradně na vlastní platformě Fireworks Serverless Training, podle blogového příspěvku společnosti. Tým říká, že vyvinul nové tréninkové algoritmy, které zkrátí uvažování bez ztráty přesnosti.
Je pozoruhodné, že se společnost nesnažila eliminovat uvažování velkoobchodně. Část zjevné upovídanosti Kimi K3 je produktivní sebereflexe – přehodnocení předpokladu, reakce na zpětnou vazbu nebo sledování výsledku zpět k dřívějšímu rozhodnutí pomáhá modelu zotavit se z chyb. Tréninkový režim byl navržen tak, aby si tuto schopnost zachoval a zároveň omezil neproduktivní smyčky.
Tréninková data zahrnovala matematiku, kódování, následování instrukcí, konverzaci, vyhledávání, používání nástrojů a softwarové inženýrství, pokrývající jak samostatné problémy, tak rozšířené víceotáčkové interakce. Fireworks říká, že používal pouze svá vlastní data a žádná data zákazníků.
Srovnávací hodnoty: Na hranici Pareto nebo v její blízkosti
Abychom to vysvětlili, Fireworks vypočítal náklady na benchmark pomocí veřejných cen API Kimi K3 – 3 $ za milion neuložených vstupních tokenů, 0,30 $ za milion mezipaměti vstupních tokenů a 15 $ za milion výstupních tokenů – a porovnal Ember-1 s K3 při nízké, vysoké a maximální snaze o uvažování. Napříč každým benchmarkem s více než 50 testovacími vzorky společnost uvádí, že Ember-1 leží na hranici Pareto nebo v její blízkosti, přičemž odpovídá K3 při maximálním úsilí za zlomek nákladů a striktně dominuje K3 při nízkém úsilí.
Srovnání titulků s K3 při maximálním úsilí, jak uvádí Fireworks:
| Benchmark | Ukázky | K3 (maximální úsilí) | Ember-1 |
|---|---|---|---|
| Terminál Bench 2.1 | 89 | 80,9 % | 82,0 % |
| SWE-bench Ověřeno | 500 | 93,2 % | 92,2 % |
| SWE-Interact | 75 | 21,3 % | 20,0 % |
| DeepSWE 1.1 | 113 | 66,4 % | 75,2 % |
| τ²-Bench Airline | 50 | 64 % | 66 % |
Pokud jde o náklady na úkol, Fireworks uvádí, že Ember-1 snížil výdaje o 51,9 % na Terminal Bench 2.1, 32,5 % na SWE-Interact, 23,7 % na DeepSWE 1.1 a 15,5 % na SWE-bench Verified ve srovnání s K3 při maximálním úsilí – v případě společnosti DeepSWE vypočtené sazby za práci více než 126 USD, rozdíl ve výši 126 USD.
Společnost také vyhodnotila Ember-1 na Doximity's Bedside Bench, lékařem ověřený benchmark 500 klinických případů v 10 specializacích, které Fireworks prochází prostřednictvím svého nově spuštěného Specialized Intelligence Index. Fireworks říká, že Ember-1 nastavil novou Paretovu hranici v ceně za úkol napříč otevřenými i uzavřenými modely, včetně GPT-5.6 Sol, GPT-6 Astra a Claude Opus 5. Toto tvrzení pochází z vlastního indexu Fireworks a nebylo nezávisle ověřeno.
Živý provoz: Méně tokenů, stejné skóre
Benchmarky jsou jedna věc; výroba je jiná. Fireworks provedl živé A/B testy se dvěma zákazníky na jejich pracovní zátěži produkčního kódování a uvádí, že Ember-1 použil přibližně o 35 % méně tokenů na úlohu při srovnatelné kvalitě. V jednom měřeném srovnání Kimi K3 dosáhl 0,751 při generování 49 300 výstupních tokenů na úkol, oproti 0,753 pro Ember-1 na 29 900 tokenech – 71,3% snížení počtu tokenů pro uvažování a o 39 % méně celkových tokenů. Po testech jeden zákazník přesunul Ember-1 do ostré výroby s plány na jeho zvětšení, aby zcela nahradil základní model.
V samotném Fireworks byl model před spuštěním tiše zaměněn do vlastních pracovních postupů kódování společnosti. Výsledek, na který je tým podle svých slov nejpyšnější: nikdo si toho nevšiml. Vývojáři pokračovali ve své práci, aniž by detekovali přepínač, a přitom spotřebovali podstatně méně tokenů.
Specializovaná inteligence jako strategie
Ember-1 je prvním modelem z plánované série od Fireworks Research a přichází spolu se specializovaným indexem inteligence společnosti, srovnávacím úsilím představeným začátkem tohoto měsíce za účelem porovnávání otevřených, uzavřených a specializovaných modelů na úkolech vytvořených odborníky v reálném světě.
Strategická hra je snadno čitelná. Spíše než trénovat hraniční model od nuly, Fireworks vzal silný model s otevřenou váhou, natrénoval do něj efektivitu tokenů a nyní prodává stejnou schopnost za nižší cenu za úkol. Vzhledem k tomu, že zprávy s otevřenou váhou z laboratoří, jako je Moonshot, neustále uzavírají mezeru ve schopnostech, poskytovatelé inferencí zjišťují, že trvalé odlišení může spočívat spíše v nákladech na dokončený úkol než v umístění v žebříčku – posun, který upřednostňuje společnosti se silnou školicí a servisní infrastrukturou.
Námitky stojí za to říci jasně: výše uvedená čísla pocházejí z vlastního blogu Fireworks, jeho vlastních hodnocení a vlastních platících zákazníků. Skutečným testem bude nezávislá replikace úspor tokenů na externí zátěž. Pokud se však výsledky udrží, nákladově nejefektivnějším způsobem provozování otevřeného modelu hraniční třídy již nemusí být přimět jej méně přemýšlet – může to být provozování modelu, který se naučil myslet efektivně.
---
Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →