Fireworks Research, pasukan model dalam permulaan inferens Fireworks AI, telah memperkenalkan Ember-1, model khusus yang dikatakan syarikat menghasilkan jawapan yang sama seperti Kimi K3 Moonshot AI sambil mengeluarkan kira-kira 40% token lebih sedikit. Model itu disiarkan secara langsung di platform Fireworks pada 23 September, dan sejak beberapa hari lalu ia telah menjadi salah satu keluaran yang paling banyak dibincangkan dalam komuniti pembangun, menarik beratus-ratus undian positif pada Berita Hacker ketika pembuat kod membahaskan sama ada token penaakulan adalah sempadan kos seterusnya.
Nada datang pada saat apabila bil inferens, bukan keupayaan model, semakin menentukan apa yang mampu dihantar oleh pasukan. Bagi pasukan yang menonton beban kerja agen menggunakan belanjawan, perkembangan AI terkini telah menjelaskan satu perkara: tabiat paling mahal industri sekarang bukanlah melatih model sempadan, ia menjalankannya. Ember-1 ialah percubaan Fireworks untuk menyerang masalah itu secara langsung, dan syarikat itu menyokongnya dengan set penanda aras dan nombor pengeluaran yang luar biasa terperinci.
Model Berfikir Terlalu Banyak Berfikir
Pemerhatian teras di sebalik Ember-1 ialah model penaakulan seperti Kimi K3 membelanjakan sebahagian besar token yang dijana mereka — kadangkala lebih daripada 90%, menurut Fireworks — pada penaakulan dalaman dan bukannya pada jawapan itu sendiri. Atas permintaan tunggal, itu mahal. Dalam beban kerja agenik, ia menggabungkan: setiap pusingan perbualan ejen memainkan semula semua penaakulan terdahulu kembali kepada model, jadi konteks berkembang secara kasar secara kuadratik dengan bilangan pusingan, dan jejak penaakulan panjang dari pusingan awal dibaca semula dan dibilkan semula pada setiap panggilan berikutnya.
Fireworks berkata pelanggan memberitahu mereka bahawa mereka mahukan keupayaan pengekodan Kimi K3 pada kos yang lebih rendah, tetapi itu hanya menolak usaha penaakulan model itu tidak berhasil — tetapan usaha rendah melepaskan terlalu banyak kualiti. Alternatifnya ialah melatih model yang membuat alasan dengan lebih cekap sambil mengekalkan penaakulan yang penting.
Melatih Sisa Keluar
Building Ember-1 mengambil lebih daripada 50 eksperimen latihan dan lebih 200 penilaian, dijalankan sepenuhnya pada platform Latihan Tanpa Pelayan Fireworks sendiri, menurut catatan blog syarikat itu. Pasukan itu berkata ia membangunkan algoritma latihan baharu di sepanjang jalan untuk memendekkan penaakulan tanpa kehilangan ketepatan.
Terutama, syarikat itu tidak cuba menghapuskan penaakulan borong. Beberapa kata kerja Kimi K3 yang jelas ialah refleksi kendiri yang produktif — menyemak semula andaian, membalas maklum balas atau mengesan hasil kembali kepada keputusan awal membantu model pulih daripada kesilapan. Rejim latihan direka untuk mengekalkan keupayaan itu sambil memotong gelung yang tidak produktif.
Data latihan merangkumi matematik, pengekodan, mengikut arahan, perbualan, carian, penggunaan alat dan kejuruteraan perisian, meliputi kedua-dua masalah kendiri dan interaksi berbilang pusingan yang dilanjutkan. Fireworks mengatakan ia hanya menggunakan datanya sendiri dan tiada data pelanggan.
Penanda Aras: Di atau Berhampiran Sempadan Pareto
Untuk membuat kes kos, Fireworks mengira kos setiap penanda aras menggunakan harga API awam Kimi K3 — $3 setiap juta token input tidak dicache, $0.30 setiap juta token input cache dan $15 setiap juta token keluaran — dan membandingkan Ember-1 berbanding K3 pada usaha penaakulan yang rendah, tinggi dan maksimum. Merentasi setiap penanda aras dengan lebih daripada 50 sampel ujian, syarikat melaporkan bahawa Ember-1 terletak di atau berhampiran sempadan Pareto, memadankan K3 pada usaha maksimum untuk sebahagian kecil daripada kos dan mendominasi K3 secara ketat pada usaha rendah.
Perbandingan tajuk utama terhadap K3 pada usaha maksimum, seperti yang dilaporkan oleh Fireworks:
| Penanda aras | Sampel | K3 (usaha maksimum) | Ember-1 |
|---|---|---|---|
| Bangku Terminal 2.1 | 89 | 80.9% | 82.0% |
| SWE-bench Disahkan | 500 | 93.2% | 92.2% |
| SWE-Interaksi | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-Syarikat Penerbangan Bangku | 50 | 64% | 66% |
Mengenai kos setiap tugas, Fireworks melaporkan Ember-1 mengurangkan perbelanjaan sebanyak 51.9% pada Terminal Bench 2.1, 32.5% pada SWE-Interact, 23.7% pada DeepSWE 1.1 dan 15.5% pada SWE-bench Verified berbanding dengan K3 pada usaha maksimum — dalam kes DeepSWE kerja, perbezaan dikira lebih daripada $12 syarikat.
Syarikat itu juga menilai Ember-1 di Doximity's Bedside Bench, penanda aras yang disahkan oleh doktor bagi 500 kes klinikal merentas 10 kepakaran yang dijalankan oleh Fireworks melalui Indeks Kecerdasan Khususnya yang baru dilancarkan. Di sana, Fireworks berkata Ember-1 menetapkan sempadan Pareto baharu pada kos setiap tugas merentas kedua-dua model terbuka dan tertutup, termasuk GPT-5.6 Sol, GPT-6 Astra dan Claude Opus 5. Tuntutan itu datang daripada indeks Fireworks sendiri dan belum disahkan secara bebas.
Trafik Langsung: Token Lebih Sedikit, Markah Sama
Penanda aras adalah satu perkara; pengeluaran adalah lain. Bunga api menjalankan ujian A/B secara langsung dengan dua pelanggan pada beban kerja pengekodan pengeluaran mereka dan melaporkan bahawa Ember-1 menggunakan kira-kira 35% lebih sedikit token setiap tugas pada kualiti yang setanding. Dalam satu perbandingan yang diukur, Kimi K3 menjaringkan 0.751 sambil menjana 49,300 token output setiap tugas, berbanding 0.753 untuk Ember-1 pada 29,900 token — pengurangan 71.3% dalam token penaakulan dan jumlah token 39% lebih sedikit. Berikutan ujian, seorang pelanggan memindahkan Ember-1 ke dalam pengeluaran langsung dengan rancangan untuk meningkatkannya untuk menggantikan model asas sepenuhnya.
Di dalam Fireworks sendiri, model itu ditukar secara senyap-senyap ke dalam aliran kerja pengekodan syarikat sendiri sebelum dilancarkan. Hasil yang dikatakan pasukan itu paling membanggakan: tiada siapa yang perasan. Pembangun menjalankan kerja mereka tanpa mengesan suis sambil menggunakan token yang jauh lebih sedikit.
Kecerdasan Khusus sebagai Strategi
Ember-1 ialah model pertama dalam siri terancang daripada Fireworks Research, dan ia hadir bersama Indeks Kecerdasan Khusus syarikat, usaha penanda aras yang diperkenalkan awal bulan ini untuk membandingkan model terbuka, tertutup dan khusus pada tugas dunia sebenar ciptaan pakar.
Permainan strategik mudah dibaca. Daripada melatih model sempadan dari awal, Fireworks menggunakan model berat terbuka yang kukuh, melatih kecekapan token ke dalamnya dan kini menjual keupayaan yang sama pada kos yang lebih rendah bagi setiap tugas. Memandangkan keluaran berwajaran terbuka daripada makmal seperti Moonshot terus menutup jurang keupayaan, penyedia inferens mendapati bahawa pembezaan tahan lama mungkin terletak pada kos setiap tugas yang telah disiapkan dan bukannya kedudukan papan pendahulu — anjakan yang memihak kepada syarikat yang mempunyai infrastruktur latihan dan perkhidmatan yang kukuh.
Kaveat patut dinyatakan dengan jelas: nombor di atas datang daripada blog Fireworks sendiri, penilaiannya sendiri dan pelanggannya yang membayar sendiri. Replikasi bebas penjimatan token pada beban kerja luar akan menjadi ujian sebenar. Tetapi jika keputusannya kekal, cara yang paling menjimatkan kos untuk menjalankan model terbuka kelas sempadan mungkin bukan lagi dengan menjadikannya kurang berfikir — mungkin dengan menjalankan model yang belajar berfikir dengan cekap.
---
Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →