Fireworks Research, tim model ing wiwitan inferensi Fireworks AI, wis ngenalake Ember-1, model khusus sing dikandhakake perusahaan kasebut ngasilake jawaban sing padha karo Kimi K3 Moonshot AI nalika ngetokake kurang luwih 40% token. Model kasebut langsung urip ing platform Fireworks tanggal 23 September, lan sawetara dina kepungkur dadi salah sawijining rilis sing paling dibahas ing komunitas pangembang, nggambar atusan upvotes ing Hacker News minangka coders debat apa token pertimbangan minangka wates biaya sabanjure.

Jarak kasebut nalika tagihan inferensi, dudu kemampuan model, tambah akeh mutusake tim apa sing bisa dikirim. Kanggo tim sing nonton beban kerja agen nggunakake anggaran, perkembangan AI paling anyar wis jelas: pakulinan paling larang ing industri saiki ora nglatih model perbatasan, nanging mlaku. Ember-1 minangka upaya Fireworks kanggo nyerang masalah kasebut kanthi langsung, lan perusahaan kasebut ndhukung kanthi set pathokan lan nomer produksi sing luar biasa rinci.

Model Mikir Mikir Kakehan

Pengamatan inti ing mburi Ember-1 yaiku model penalaran kaya Kimi K3 mbuwang mayoritas token sing digawe - kadhangkala luwih saka 90%, miturut Fireworks - ing pertimbangan internal tinimbang ing jawaban dhewe. Ing panjalukan siji, sing larang. Ing workloads agen, iku majemuk: saben giliran saka obrolan agen muter kabeh alesan sadurunge bali menyang model, supaya context mundak akeh kira-kira quadratically karo nomer giliran, lan ngambah pertimbangan dawa saka awal dadi maca maneh lan tagihan maneh ing saben telpon sakteruse.

Fireworks ujar para pelanggan ngandhani yen dheweke pengin kapabilitas pengkodean Kimi K3 kanthi biaya sing luwih murah, nanging mung nolak upaya nalar model kasebut ora bisa ditindakake - setelan kurang upaya nyerahake kualitas sing akeh banget. Alternatif kasebut yaiku nglatih model sing menehi alasan kanthi luwih efisien nalika tetep nalar sing penting.

Latih Sampah

Bangunan Ember-1 njupuk luwih saka 50 eksperimen latihan lan luwih saka 200 evaluasi, mlaku kabeh ing platform Pelatihan Tanpa Server Fireworks dhewe, miturut kiriman blog perusahaan. Tim kasebut ujar manawa ngembangake algoritma latihan anyar ing sadawane dalan kanggo nyepetake penalaran tanpa kelangan akurasi.

Utamane, perusahaan ora nyoba ngilangi grosir pertimbangan. Sawetara verbosity Kimi K3 sing katon minangka refleksi diri sing produktif - mriksa maneh asumsi, nanggapi umpan balik, utawa nglacak asil bali menyang keputusan sadurunge mbantu model pulih saka kesalahan. Regime latihan dirancang kanggo njaga kemampuan kasebut nalika motong puteran sing ora produktif.

Data latihan kasebut kalebu matématika, coding, instruksi ing ngisor iki, obrolan, telusuran, panggunaan alat, lan rekayasa piranti lunak, nyakup masalah mandiri lan interaksi multi-giliran. Fireworks ujar yen mung nggunakake data dhewe lan ora ana data pelanggan.

Tolok ukur: Ing utawa Cedhak Pareto Frontier

Kanggo nggawe kasus biaya, Fireworks ngetung biaya saben pathokan nggunakake rega API umum Kimi K3 - $ 3 saben yuta token input uncached, $ 0,30 saben yuta cache input token, lan $ 15 saben yuta token output - lan mbandhingaké Ember-1 marang K3 ing kurang, dhuwur, lan gaweyan alesan maksimum. Ing saben pathokan kanthi luwih saka 50 conto tes, perusahaan kasebut nglaporake manawa Ember-1 lenggah ing utawa ing cedhak perbatasan Pareto, cocog karo K3 kanthi maksimal gaweyan kanggo bagian sekedhik saka biaya lan dominasi K3 kanthi sithik.

Bandhingan judhul karo K3 kanthi maksimal, kaya sing dilaporake Fireworks:

| pathokan | Tuladha | K3 (maks gaweyan) | Ember-1 |
|---|---|---|---|
| Bangku Terminal 2.1 | 89 | 80,9% | 82,0% |
| SWE-bench Diverifikasi | 500 | 93,2% | 92,2% |
| SWE-Interaksi | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Maskapai Penerbangan | 50 | 64% | 66% |

Ing biaya saben tugas, Fireworks laporan Ember-1 Cut mbuwang dening 51,9% ing Terminal Bench 2.1, 32.5% ing SWE-Interact, 23.7% ing DeepSWE 1.1, lan 15.5% ing SWE-bench Diverifikasi relatif kanggo K3 ing maksimum gaweyan - ing cilik saka DeepSWE12 karya, prabédan saka luwih saka $ 12.

Perusahaan kasebut uga ngevaluasi Ember-1 ing Doximity's Bedside Bench, benchmark sing divalidasi dokter saka 500 kasus klinis ing 10 spesialisasi sing diluncurake Fireworks liwat Indeks Intelijen Khusus sing mentas diluncurake. Ing kana, Fireworks ngandika Ember-1 nyetel wates Pareto anyar ing biaya saben tugas antarane model mbukak lan ditutup, kalebu GPT-5.6 Sol, GPT-6 Astra, lan Claude Opus 5. Pratelan kasebut asalé saka indeks Fireworks dhewe lan durung diverifikasi sacara mandiri.

Lalu Lintas Langsung: Token Kurang, Skor sing padha

Benchmarks iku siji bab; produksi liyane. Kembang api nglakokake tes A/B langsung karo loro pelanggan ing beban kerja coding produksi lan laporan yen Ember-1 nggunakake kurang luwih 35% token saben tugas kanthi kualitas sing padha. Ing siji perbandingan sing diukur, Kimi K3 ngetung 0.751 nalika ngasilake 49.300 token output saben tugas, nglawan 0.753 kanggo Ember-1 ing 29.900 token - pangurangan 71.3% ing token penalaran lan 39% kurang total token. Sawise tes kasebut, salah sawijining pelanggan mindhah Ember-1 menyang produksi langsung kanthi rencana kanggo nambah ukuran kanggo ngganti model dhasar.

Ing Fireworks dhewe, model kasebut kanthi tenang diganti menyang alur kerja coding perusahaan sadurunge diluncurake. Asil tim ngandika bangga: ora ana sing weruh. Pangembang nindakake pakaryan tanpa ndeteksi saklar nalika nggunakake token sing luwih sithik.

Intelijen Khusus minangka Strategi

Ember-1 minangka model pisanan ing seri sing direncanakake saka Fireworks Research, lan teka bebarengan karo Indeks Intelijen Khusus perusahaan, upaya benchmarking sing dienalake ing awal wulan iki kanggo mbandhingake model mbukak, ditutup, lan khusus babagan tugas nyata sing digawe pakar.

Play strategis gampang diwaca. Tinimbang nglatih model perbatasan saka awal, Fireworks njupuk model bobot mbukak sing kuwat, nglatih efisiensi token, lan saiki adol kemampuan sing padha kanthi biaya sing luwih murah saben tugas. Nalika rilis bobot mbukak saka lab kaya Moonshot terus nutup celah kemampuan, panyedhiya inferensi nemokake manawa diferensiasi tahan lama bisa uga ana ing biaya saben tugas sing wis rampung tinimbang posisi leaderboard - owah-owahan sing luwih disenengi perusahaan sing duwe latihan lan infrastruktur sing kuat.

Caveat kasebut kudu dicritakake kanthi jelas: nomer ing ndhuwur asale saka blog Fireworks dhewe, evaluasi dhewe, lan pelanggan sing mbayar dhewe. Replikasi bebas saka tabungan token ing beban kerja ing njaba bakal dadi tes nyata. Nanging yen asile tetep, cara sing paling larang kanggo mbukak model terbuka kelas perbatasan bisa uga ora mikir maneh - bisa uga nganggo model sing sinau mikir kanthi efisien.
---

Tetep Ahead of AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane AI warta →