Fireworks Research, zespół zajmujący się modelami w startupie Fireworks AI zajmującym się wnioskowaniem, wprowadził Ember-1, wyspecjalizowany model, który według firmy generuje te same odpowiedzi, co Kimi K3 firmy Moonshot AI, emitując przy tym około 40% mniej tokenów. Model został udostępniony na platformie Fireworks 23 września i w ciągu ostatnich kilku dni stał się jedną z najczęściej dyskutowanych wersji w społeczności programistów, zdobywając setki głosów pozytywnych w serwisie Hacker News, gdy programiści debatowali, czy tokeny wnioskowania stanowią kolejną granicę kosztów.

Temat pojawia się w momencie, gdy rachunki, a nie możliwości modelu, w coraz większym stopniu decydują o tym, na jakie zespoły mogą sobie pozwolić na wysyłkę. W przypadku zespołów obserwujących, jak obciążenia agentów pochłaniają budżet, najnowsze osiągnięcia w zakresie sztucznej inteligencji pokazały jedną rzecz jasno: obecnie najkosztowniejszym zwyczajem w branży nie jest szkolenie pionierskich modeli, lecz ich uruchamianie. Ember-1 to podjęta przez Fireworks próba bezpośredniego zaatakowania tego problemu, a firma poparła ją niezwykle szczegółowym zestawem wskaźników porównawczych i liczb produkcyjnych.

Modele myślenia myślą za dużo

Podstawową obserwacją stojącą za Ember-1 jest to, że modele rozumowania takie jak Kimi K3 wydają większość wygenerowanych tokenów – według Fireworks czasami ponad 90% – na wewnętrzne rozumowanie, a nie na samą odpowiedź. Na jedno żądanie jest to kosztowne. W przypadku obciążeń agentowych sytuacja się komplikuje: w każdej turze rozmowy z agentem odtwarzane są wszystkie wcześniejsze rozumowania z powrotem do modelu, więc kontekst rośnie mniej więcej kwadratowo wraz z liczbą tur, a długie ślady rozumowania z wczesnych tur są ponownie odczytywane i ponownie rozliczane przy każdej kolejnej rozmowie.

Fireworks twierdzi, że klienci powiedzieli im, że chcą możliwości kodowania Kimi K3 przy niższym koszcie, ale samo odrzucenie wysiłku modela w zakresie rozumowania nie zadziałało — ustawienia wymagające niewielkiego wysiłku oznaczały zbyt dużą jakość. Alternatywą było wyszkolenie modelu, który rozumuje wydajniej, zachowując jednocześnie to, co ma znaczenie.

Szkolenie w zakresie usuwania odpadów

Jak wynika z wpisu na blogu firmy, budowanie Ember-1 wymagało ponad 50 eksperymentów szkoleniowych i ponad 200 ocen, a całość przebiegała w całości na własnej platformie szkoleniowej bez serwera Fireworks. Zespół twierdzi, że po drodze opracował nowe algorytmy szkoleniowe, aby skrócić rozumowanie bez utraty dokładności.

Warto zauważyć, że firma nie próbowała hurtowo eliminować rozumowania. Pozorna gadatliwość Kimi K3 wynika w pewnym stopniu z produktywnej autorefleksji — ponowne sprawdzenie założeń, zareagowanie na opinie lub prześledzenie wyniku wstecz do wcześniejszej decyzji pomaga modelce odzyskać siły po błędach. Reżim treningowy został zaprojektowany tak, aby zachować tę zdolność podczas przycinania nieproduktywnych pętli.

Dane szkoleniowe obejmowały matematykę, kodowanie, przestrzeganie instrukcji, rozmowy, wyszukiwanie, użycie narzędzi i inżynierię oprogramowania, obejmując zarówno samodzielne problemy, jak i rozszerzone interakcje wieloobrotowe. Fireworks twierdzi, że wykorzystało wyłącznie własne dane, a nie dane klientów.

Punkty odniesienia: na granicy Pareto lub w jej pobliżu

Aby przedstawić koszty, Fireworks obliczył koszt w przeliczeniu na benchmark, korzystając z publicznych cen API Kimi K3 — 3 USD za milion niezapisanych w pamięci podręcznej tokenów wejściowych, 0,30 USD za milion tokenów wejściowych w pamięci podręcznej i 15 USD za milion tokenów wyjściowych — i porównał Ember-1 z K3 przy niskim, wysokim i maksymalnym wysiłku wnioskowania. W każdym benchmarku obejmującym ponad 50 próbek testowych firma podaje, że Ember-1 znajduje się na granicy Pareto lub w jej pobliżu, dorównując K3 przy maksymalnym wysiłku za ułamek kosztów i ściśle dominując nad K3 przy niewielkim wysiłku.

Główne porównania z K3 przy maksymalnym wysiłku, według Fireworks:

| punkt odniesienia | Próbki | K3 (maksymalny wysiłek) | Żar-1 |
|---|---|---|---|
| Ławka terminalowa 2.1 | 89 | 80,9% | 82,0% |
| Zweryfikowano w SWE-bench | 500 | 93,2% | 92,2% |
| Interakcja SWE | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| Linia lotnicza τ²-Bench | 50 | 64% | 66% |

Fireworks podaje, że jeśli chodzi o koszt zadania, Ember-1 obniżył wydatki o 51,9% w przypadku Terminal Bench 2.1, 32,5% w przypadku SWE-Interact, 23,7% w przypadku DeepSWE 1.1 i 15,5% w przypadku SWE-bench Verified w porównaniu z K3 przy maksymalnym wysiłku — w przypadku DeepSWE jest to różnica ponad 126 dolarów na jednostkę pracy według stawek obliczonych przez firmę.

Firma oceniła także Ember-1 na ławce przyłóżkowej Doximity, zatwierdzonym przez lekarza benchmarku obejmującym 500 przypadków klinicznych w 10 specjalizacjach, który Fireworks analizuje w ramach nowo wprowadzonego indeksu Specialized Intelligence Index. Fireworks twierdzi, że Ember-1 wyznaczył tam nową granicę Pareto w zakresie kosztu zadania zarówno w modelach otwartych, jak i zamkniętych, w tym GPT-5.6 Sol, GPT-6 Astra i Claude Opus 5. Twierdzenie to pochodzi z własnego indeksu Fireworks i nie zostało niezależnie zweryfikowane.

Ruch na żywo: mniej tokenów, te same wyniki

Benchmarki to jedno; produkcja to co innego. Firma Fireworks przeprowadziła na żywo testy A/B z dwoma klientami dotyczące ich obciążeń związanych z kodowaniem produkcyjnym i raportowała, że ​​Ember-1 zużywał około 35% mniej tokenów na zadanie przy porównywalnej jakości. W jednym zmierzonym porównaniu Kimi K3 uzyskała wynik 0,751, generując 49 300 tokenów wyjściowych na zadanie, w porównaniu z 0,753 w przypadku Ember-1 na 29 900 tokenów — co oznacza zmniejszenie liczby tokenów wnioskowania o 71,3% i całkowitą liczbę tokenów o 39%. Po testach jeden z klientów wprowadził Ember-1 do produkcji na żywo, planując jego zwiększenie, aby całkowicie zastąpić model podstawowy.

W samym Fireworks model został po cichu zamieniony na własne procesy kodowania firmy przed premierą. Wynik, z którego zespół jest najbardziej dumny: nikt tego nie zauważył. Programiści kontynuowali swoją pracę bez wykrywania zmiany, zużywając przy tym znacznie mniej tokenów.

Wyspecjalizowana inteligencja jako strategia

Ember-1 to pierwszy model z planowanej serii Fireworks Research, który pojawia się wraz z firmowym indeksem Specialized Intelligence Index, wprowadzoną na początku tego miesiąca analizą porównawczą mającą na celu porównywanie modeli otwartych, zamkniętych i specjalistycznych z zadaniami w świecie rzeczywistym tworzonymi przez ekspertów.

Gra strategiczna jest łatwa do odczytania. Zamiast trenować od podstaw model pionierski, firma Fireworks przyjęła mocny model o otwartej masie, przeszkoliła go pod względem wydajności symbolicznej i teraz sprzedaje te same możliwości przy niższym koszcie zadania. W miarę jak otwarte publikacje z laboratoriów takich jak Moonshot zmniejszają lukę w możliwościach, dostawcy wnioskowania odkrywają, że trwałe zróżnicowanie może polegać na koszcie wykonania zadania, a nie na pozycji w tabeli liderów — zmiana ta faworyzuje firmy posiadające silną infrastrukturę szkoleniową i obsługującą.

Zastrzeżenia warto jasno przedstawić: powyższe liczby pochodzą z własnego bloga Fireworks, z jego własnych ocen i z jego własnych płacących klientów. Niezależna replikacja oszczędności tokenów na zewnętrznych obciążeniach będzie prawdziwym testem. Jeśli jednak wyniki się sprawdzą, najbardziej opłacalnym sposobem wykorzystania pionierskiego modelu otwartego nie będzie już ograniczanie myślenia, lecz wprowadzenie modelu, który nauczył się efektywnie myśleć.
---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →