Fireworks Research, tim model di dalam startup inferensi Fireworks AI, telah memperkenalkan Ember-1, model khusus yang menurut perusahaan menghasilkan jawaban yang sama seperti Kimi K3 dari Moonshot AI sambil mengeluarkan token sekitar 40% lebih sedikit. Model ini ditayangkan di platform Fireworks pada tanggal 23 September, dan selama beberapa hari terakhir ini telah menjadi salah satu rilis yang paling banyak dibicarakan di komunitas pengembang, menarik ratusan suara positif di Hacker News saat para pembuat kode memperdebatkan apakah token yang masuk akal adalah batasan biaya berikutnya.
Persoalan ini muncul pada saat tagihan inferensi, bukan kemampuan model, semakin menentukan apa yang mampu dikirimkan oleh tim. Bagi tim yang melihat beban kerja agen menghabiskan anggaran, perkembangan AI terkini telah memperjelas satu hal: kebiasaan industri yang paling mahal saat ini bukanlah melatih model terdepan, melainkan menjalankannya. Ember-1 adalah upaya Fireworks untuk mengatasi masalah tersebut secara langsung, dan perusahaan mendukungnya dengan serangkaian patokan dan angka produksi yang sangat rinci.
Model Berpikir Terlalu Banyak Berpikir
Pengamatan inti di balik Ember-1 adalah bahwa model penalaran seperti Kimi K3 menghabiskan sebagian besar token yang dihasilkan — terkadang lebih dari 90%, menurut Fireworks — pada penalaran internal, bukan pada jawaban itu sendiri. Untuk satu permintaan, itu mahal. Dalam beban kerja agen, hal ini bertambah: setiap pergantian percakapan agen memutar ulang semua penalaran sebelumnya kembali ke model, sehingga konteks tumbuh kira-kira secara kuadratik dengan jumlah putaran, dan alur penalaran yang panjang dari putaran awal dibaca ulang dan ditagih ulang pada setiap panggilan berikutnya.
Fireworks mengatakan pelanggan mengatakan kepada mereka bahwa mereka menginginkan kemampuan pengkodean Kimi K3 dengan biaya lebih rendah, namun menolak upaya penalaran model saja tidak akan berhasil — pengaturan yang mudah dilakukan akan memberikan terlalu banyak kualitas. Alternatifnya adalah melatih model yang memberikan alasan lebih efisien sekaligus menjaga alasan yang penting.
Melatih Pembuangan Sampah
Membangun Ember-1 membutuhkan lebih dari 50 eksperimen pelatihan dan lebih dari 200 evaluasi, dijalankan sepenuhnya pada platform Pelatihan Tanpa Server milik Fireworks, menurut postingan blog perusahaan. Tim mengatakan mereka mengembangkan algoritma pelatihan baru untuk mempersingkat penalaran tanpa kehilangan akurasi.
Khususnya, perusahaan tidak berusaha menghilangkan alasan grosir. Beberapa dari verbositas Kimi K3 adalah refleksi diri yang produktif — meninjau kembali asumsi, menanggapi umpan balik, atau menelusuri hasil kembali ke keputusan sebelumnya membantu model pulih dari kesalahan. Rezim pelatihan dirancang untuk mempertahankan kemampuan tersebut sambil memangkas putaran yang tidak produktif.
Data pelatihan mencakup matematika, pengkodean, mengikuti instruksi, percakapan, pencarian, penggunaan alat, dan rekayasa perangkat lunak, yang mencakup masalah mandiri dan interaksi multi-putaran yang diperluas. Fireworks mengatakan mereka hanya menggunakan datanya sendiri dan tidak ada data pelanggan.
Tolok Ukur: Di atau Dekat Perbatasan Pareto
Untuk memperhitungkan biaya, Fireworks menghitung biaya per tolok ukur menggunakan harga API publik Kimi K3 — $3 per juta token masukan yang tidak di-cache, $0,30 per juta token masukan yang di-cache, dan $15 per juta token keluaran — dan membandingkan Ember-1 dengan K3 dengan upaya penalaran yang rendah, tinggi, dan maksimal. Di setiap benchmark dengan lebih dari 50 sampel uji, perusahaan melaporkan bahwa Ember-1 berada di atau dekat batas Pareto, menyamai K3 dengan upaya maksimal dengan biaya yang lebih murah dan mendominasi K3 dengan upaya yang rendah.
Perbandingan judulnya dengan K3 dengan upaya maksimal, seperti dilansir Fireworks:
| Tolok Ukur | Sampel | K3 (usaha maksimal) | Bara-1 |
|---|---|---|---|
| Bangku Terminal 2.1 | 89 | 80,9% | 82,0% |
| Bangku SWE Terverifikasi | 500 | 93,2% | 92,2% |
| SWE-Berinteraksi | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Maskapai Penerbangan | 50 | 64% | 66% |
Mengenai biaya per tugas, Fireworks melaporkan Ember-1 memangkas pengeluaran sebesar 51,9% pada Terminal Bench 2.1, 32,5% pada SWE-Interact, 23,7% pada DeepSWE 1.1, dan 15,5% pada SWE-bench Terverifikasi relatif terhadap K3 dengan upaya maksimal — dalam kasus DeepSWE, selisihnya lebih dari $126 per unit pekerjaan pada tarif yang dihitung perusahaan.
Perusahaan juga mengevaluasi Ember-1 di Doximity's Bedside Bench, tolok ukur yang divalidasi oleh dokter terhadap 500 kasus klinis di 10 spesialisasi yang dijalankan Fireworks melalui Indeks Kecerdasan Khusus yang baru diluncurkan. Di sana, Fireworks mengatakan Ember-1 menetapkan batas Pareto baru pada biaya per tugas di model terbuka dan tertutup, termasuk GPT-5.6 Sol, GPT-6 Astra, dan Claude Opus 5. Klaim tersebut berasal dari indeks Fireworks sendiri dan belum diverifikasi secara independen.
Lalu Lintas Langsung: Token Lebih Sedikit, Skor Sama
Tolok ukur adalah satu hal; produksi adalah hal lain. Fireworks menjalankan pengujian A/B langsung dengan dua pelanggan pada beban kerja pengkodean produksi mereka dan melaporkan bahwa Ember-1 menggunakan sekitar 35% lebih sedikit token per tugas dengan kualitas yang sebanding. Dalam satu perbandingan terukur, Kimi K3 mencetak 0,751 sambil menghasilkan 49,300 token keluaran per tugas, dibandingkan 0,753 untuk Ember-1 dengan 29,900 token — pengurangan token penalaran sebesar 71,3% dan total token 39% lebih sedikit. Setelah pengujian, satu pelanggan memindahkan Ember-1 ke produksi langsung dengan rencana untuk meningkatkan skalanya guna menggantikan model dasar sepenuhnya.
Di dalam Fireworks sendiri, model tersebut secara diam-diam ditukar dengan alur kerja pengkodean milik perusahaan sebelum diluncurkan. Hasil yang paling dibanggakan oleh tim: tidak ada yang menyadarinya. Pengembang melanjutkan pekerjaan mereka tanpa mendeteksi peralihan sambil mengonsumsi token yang jauh lebih sedikit.
Intelijen Khusus sebagai Strategi
Ember-1 adalah model pertama dalam seri yang direncanakan dari Fireworks Research, dan hadir bersamaan dengan Indeks Intelijen Khusus perusahaan, sebuah upaya pembandingan yang diperkenalkan awal bulan ini untuk membandingkan model terbuka, tertutup, dan khusus pada tugas-tugas dunia nyata yang dibuat oleh para ahli.
Permainan strategisnya mudah dibaca. Daripada melatih model frontier dari awal, Fireworks menggunakan model open-weight yang kuat, melatih efisiensi token ke dalamnya, dan kini menjual kemampuan yang sama dengan biaya per tugas yang lebih rendah. Ketika rilis open-weight dari laboratorium seperti Moonshot terus menutup kesenjangan kemampuan, penyedia inferensi menemukan bahwa diferensiasi yang tahan lama mungkin terletak pada biaya per tugas yang diselesaikan, bukan pada posisi di papan peringkat – sebuah perubahan yang menguntungkan perusahaan dengan pelatihan yang kuat dan infrastruktur layanan.
Peringatannya patut dinyatakan dengan jelas: angka-angka di atas berasal dari blog Fireworks sendiri, evaluasinya sendiri, dan pelanggannya yang membayar. Replikasi independen dari penghematan token pada beban kerja luar akan menjadi ujian sesungguhnya. Namun jika hasilnya tetap sama, cara yang paling hemat biaya untuk menjalankan model kelas terdepan yang terbuka mungkin bukan lagi dengan membuatnya berpikir lebih sedikit — namun mungkin dengan menjalankan model yang belajar berpikir secara efisien.
---
Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.
Baca berita AI selengkapnya →