Fireworks Research, echipa de modele din cadrul startup-ului de inferență Fireworks AI, a introdus Ember-1, un model specializat despre care compania spune că produce aceleași răspunsuri ca Kimi K3 de la Moonshot AI, în timp ce emite cu aproximativ 40% mai puține jetoane. Modelul a intrat pe platforma Fireworks pe 23 septembrie, iar în ultimele zile a devenit una dintre cele mai discutate versiuni din comunitatea dezvoltatorilor, atrăgând sute de voturi pozitive pe Hacker News, în timp ce programatorii au dezbătut dacă jetoanele de raționament sunt următoarea frontieră a costurilor.

Prezentarea vine într-un moment în care facturile de inferență, nu capacitatea modelului, decid din ce în ce mai mult ce echipe își pot permite să livreze. Pentru echipele care urmăresc sarcinile de lucru agentice consumând bugete, cele mai recente dezvoltări AI au clarificat un lucru: cel mai scump obicei al industriei în acest moment nu este antrenarea modelelor de frontieră, ci le rulează. Ember-1 este încercarea Fireworks de a ataca această problemă în mod direct, iar compania a susținut-o cu un set neobișnuit de detaliat de referințe și numere de producție.

Modelele de gândire gândesc prea mult

Observația de bază din spatele Ember-1 este că modelele de raționament precum Kimi K3 cheltuiesc majoritatea jetoanelor generate - uneori mai mult de 90%, conform Fireworks - mai degrabă pe raționamentul intern decât pe răspunsul în sine. La o singură cerere, este scump. În sarcinile de lucru agentice, se agravează: fiecare tură a unei conversații cu un agent redă toate raționamentele anterioare înapoi la model, astfel încât contextul crește aproximativ pătratic odată cu numărul de ture, iar urmele lungi de raționament de la turele timpurii sunt recitite și re-facturate la fiecare apel ulterioar.

Fireworks spune că clienții le-au spus că doresc capacitatea de codare a lui Kimi K3 la un cost mai mic, dar că pur și simplu refuzul efortului de raționament al modelului nu a funcționat - setările cu efort redus au renunțat la prea multă calitate. Alternativa a fost să antrenezi un model care să raționeze mai eficient, păstrând în același timp raționamentul care contează.

Antrenarea deșeurilor

Construirea Ember-1 a avut nevoie de peste 50 de experimente de antrenament și peste 200 de evaluări, desfășurate în întregime pe propria platformă Serverless Training a Fireworks, potrivit postării pe blog a companiei. Echipa spune că a dezvoltat noi algoritmi de antrenament pe parcurs pentru a scurta raționamentul fără a pierde acuratețea.

În special, compania nu a încercat să elimine raționamentul angro. O parte din verbozitatea aparentă a lui Kimi K3 este autoreflecția productivă - reexaminarea unei presupuneri, răspunsul la feedback sau urmărirea unui rezultat la o decizie anterioară ajută modelul să se recupereze din greșeli. Regimul de antrenament a fost conceput pentru a păstra această abilitate în timp ce tăiați buclele neproductive.

Datele de instruire au cuprins matematică, codificare, urmărire a instrucțiunilor, conversație, căutare, utilizarea instrumentelor și inginerie software, acoperind atât probleme de sine stătătoare, cât și interacțiuni extinse cu mai multe ture. Fireworks spune că a folosit doar propriile date și nicio dată despre clienți.

Benchmarks: pe sau în apropierea frontierei Pareto

Pentru a justifica costul, Fireworks a calculat costul pe benchmark folosind prețul public API al Kimi K3 - 3 USD per milion de jetoane de intrare necache, 0,30 USD per milion de jetoane de intrare în cache și 15 USD per milion de jetoane de ieșire - și a comparat Ember-1 cu K3 la efort de raționament scăzut, ridicat și maxim. Pentru fiecare etalon de referință cu peste 50 de mostre de testare, compania raportează că Ember-1 se află pe sau în apropierea frontierei Pareto, potrivind K3 la efort maxim pentru o fracțiune din cost și dominând strict K3 la efort redus.

Comparațiile de titlu față de K3 la efort maxim, după cum a raportat Fireworks:

| Benchmark | Mostre | K3 (efort maxim) | Ember-1 |
|---|---|---|---|
| Banc terminal 2.1 | 89 | 80,9% | 82,0% |
| SWE-bench Verificat | 500 | 93,2% | 92,2% |
| SWE-Interact | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Binch Airline | 50 | 64% | 66% |

În ceea ce privește costul pe sarcină, Fireworks raportează că Ember-1 a redus cheltuielile cu 51,9% pe Terminal Bench 2.1, 32,5% pe SWE-Interact, 23,7% pe DeepSWE 1.1 și 15,5% pe SWE-bench Verified în raport cu K3 la efort maxim - în cazul DeepSWE, o diferență de 12 dolari pe unitatea de muncă calculată pe companie. ratele.

Compania a evaluat, de asemenea, Ember-1 pe Doximity's Bedside Bench, un punct de referință validat de medic de 500 de cazuri clinice din 10 specialități pe care Fireworks le rulează prin intermediul noului său Specialized Intelligence Index. Acolo, Fireworks spune că Ember-1 a stabilit o nouă frontieră Pareto cu privire la costul pe sarcină atât pentru modelele deschise, cât și pentru cele închise, inclusiv GPT-5.6 Sol, GPT-6 Astra și Claude Opus 5. Această afirmație provine din propriul index al Fireworks și nu a fost verificată independent.

Trafic în direct: mai puține jetoane, aceleași scoruri

Benchmark-urile sunt un lucru; producția este alta. Fireworks a efectuat teste A/B live cu doi clienți cu privire la sarcinile de lucru de codare de producție și raportează că Ember-1 a folosit aproximativ 35% mai puține jetoane per sarcină la o calitate comparabilă. Într-o comparație măsurată, Kimi K3 a obținut 0,751 în timp ce a generat 49.300 de jetoane de ieșire per sarcină, față de 0,753 pentru Ember-1 pe 29.900 de jetoane - o reducere cu 71,3% a jetoanelor de raționament și cu 39% mai puține jetoane totale. În urma testelor, un client a mutat Ember-1 în producție live cu planuri de a-l extinde pentru a înlocui complet modelul de bază.

În interiorul Fireworks în sine, modelul a fost schimbat în liniște în fluxurile de lucru de codare ale companiei înainte de lansare. Rezultatul de care echipa spune că este cel mai mândră: nimeni nu l-a observat. Dezvoltatorii și-au continuat munca fără a detecta comutatorul, consumând în același timp substanțial mai puține jetoane.

Inteligența specializată ca strategie

Ember-1 este primul model dintr-o serie planificată de la Fireworks Research și vine alături de Specialized Intelligence Index al companiei, un efort de comparare introdus la începutul acestei luni pentru a compara modele deschise, închise și specializate pe sarcini create de experți în lumea reală.

Piesa strategică este ușor de citit. În loc să antreneze un model de frontieră de la zero, Fireworks a preluat un model puternic deschis, a antrenat eficiența token-ului și acum vinde aceeași capacitate la un cost mai mic pe sarcină. Pe măsură ce lansările deschise de la laboratoare precum Moonshot continuă să reducă decalajul de capacități, furnizorii de inferențe descoperă că diferențierea durabilă poate consta în costul pe sarcină finalizată, mai degrabă decât în ​​poziția în clasament - o schimbare care favorizează companiile cu o infrastructură de instruire și deservire puternică.

Avertismentele merită menționate clar: numerele de mai sus provin de pe blogul Fireworks, propriile evaluări și proprii clienți plătitori. Replicarea independentă a economiilor de simboluri pe sarcinile de lucru din afara va fi adevăratul test. Dar dacă rezultatele se mențin, cel mai rentabil mod de a rula un model deschis de clasă de frontieră poate să nu mai fie de a-l face să gândească mai puțin – poate fi de a rula un model care a învățat să gândească eficient.
---

Rămâneți înaintea AI

Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citiți mai multe știri AI →