Çıkarım girişimi Fireworks AI'nin model ekibi olan Fireworks Research, şirketin Moonshot AI'nin Kimi K3 modeliyle aynı yanıtları ürettiğini ve yaklaşık %40 daha az token yaydığını söylediği özel bir model olan Ember-1'i tanıttı. Model, 23 Eylül'de Fireworks platformunda yayına girdi ve son birkaç gün içinde geliştirici topluluğunda en çok tartışılan sürümlerden biri haline geldi ve kodlayıcılar akıl yürütme belirteçlerinin bir sonraki maliyet sınırı olup olmadığını tartışırken Hacker News'te yüzlerce olumlu oy aldı.
Satış konuşması, ekiplerin neyi göndermeye gücünün yeteceğine model yeteneğinin değil, çıkarım faturalarının giderek daha fazla karar verdiği bir zamanda geliyor. Ajanslı iş yüklerinin bütçe tükettiğini izleyen ekipler için en son yapay zeka gelişmeleri bir şeyi açıkça ortaya koydu: Sektörün şu anda en pahalı alışkanlığı öncü modelleri eğitmek değil, onları çalıştırmaktır. Ember-1, Fireworks'ün bu soruna doğrudan saldırma girişimidir ve şirket bunu alışılmadık derecede ayrıntılı bir dizi kıyaslama ve üretim numarasıyla desteklemiştir.
Düşünen Modeller Çok Fazla Düşünür
Ember-1'in ardındaki temel gözlem, Kimi K3 gibi akıl yürütme modellerinin, üretilen jetonların çoğunu (Fireworks'e göre bazen %90'dan fazlasını) cevabın kendisi yerine dahili akıl yürütmeye harcadığıdır. Tek bir istek üzerine bu pahalıdır. Aracılı iş yüklerinde, bu durum daha da karmaşık hale gelir: Bir temsilci görüşmesinin her dönüşü, önceki tüm akıl yürütmeyi modele geri döndürür, böylece bağlam, dönüş sayısıyla kabaca karesel olarak büyür ve ilk sıralardan gelen uzun akıl yürütme izleri, sonraki her çağrıda yeniden okunur ve yeniden faturalandırılır.
Fireworks, müşterilerin Kimi K3'ün kodlama kapasitesini daha düşük maliyetle istediklerini ancak modelin akıl yürütme çabasını geri çevirmenin işe yaramadığını, düşük çaba gerektiren ayarların kaliteden çok fazla ödün verdiğini söylediğini söylüyor. Alternatif, önemli olan muhakemeyi korurken daha verimli akıl yürüten bir model yetiştirmekti.
İsrafı Eğitmek
Şirketin blog gönderisine göre, Ember-1'in inşası, tamamen Fireworks'ün kendi Sunucusuz Eğitim platformunda yürütülen 50'den fazla eğitim deneyi ve 200'ün üzerinde değerlendirmeden geçti. Ekip, doğruluğunu kaybetmeden akıl yürütmeyi kısaltmak için yeni eğitim algoritmaları geliştirdiğini söylüyor.
Şirketin, akıl yürütmeyi toptan ortadan kaldırmaya çalışmaması dikkat çekicidir. Kimi K3'ün belirgin ayrıntısının bir kısmı, üretken bir öz değerlendirmedir; bir varsayımı tekrar gözden geçirmek, geri bildirime yanıt vermek veya bir sonucu daha önceki bir karara kadar takip etmek, modelin hatalardan kurtulmasına yardımcı olur. Eğitim rejimi, verimsiz döngüleri düzeltirken bu yeteneği korumak için tasarlandı.
Eğitim verileri matematik, kodlama, talimat takibi, konuşma, arama, araç kullanımı ve yazılım mühendisliğini kapsıyor ve hem bağımsız problemleri hem de genişletilmiş çok turlu etkileşimleri kapsıyordu. Fireworks, yalnızca kendi verilerini kullandığını ve müşteri verilerini kullanmadığını söylüyor.
Karşılaştırmalar: Pareto Sınırında veya Yakınında
Maliyet durumunu açıklamak için Fireworks, Kimi K3'ün genel API fiyatlandırmasını kullanarak karşılaştırma başına maliyeti hesapladı - önbelleğe alınmamış bir milyon giriş jetonu başına 3 dolar, önbelleğe alınmış bir milyon giriş jetonu başına 0,30 dolar ve bir milyon çıkış jetonu başına 15 dolar - ve düşük, yüksek ve maksimum muhakeme çabasında Ember-1'i K3 ile karşılaştırdı. Şirket, 50'den fazla test örneğinin bulunduğu her kıyaslamada, Ember-1'in Pareto sınırında veya yakınında bulunduğunu, maliyetin küçük bir kısmı için maksimum eforla K3'le eşleştiğini ve düşük eforla K3'e kesinlikle üstün geldiğini bildiriyor.
Fireworks tarafından bildirildiği üzere, maksimum eforda K3 ile manşet karşılaştırmaları:
| Karşılaştırma | Örnekler | K3 (maksimum efor) | Kor-1 |
|---|---|---|---|
| Terminal Tezgahı 2.1 | 89 | %80,9 | %82,0 |
| SWE tezgahı Doğrulandı | 500 | %93,2 | %92,2 |
| SWE-Etkileşim | 75 | %21,3 | %20,0 |
| DeepSWE 1.1 | 113 | %66,4 | %75,2 |
| τ²-Bench Havayolu | 50 | %64 | %66 |
Fireworks, görev başına maliyet konusunda, Ember-1'in harcamalarını Terminal Bench 2.1'de %51,9, SWE-Interact'ta %32,5, DeepSWE 1.1'de %23,7 ve SWE-bench Verified'da maksimum çabayla K3'e göre %15,5 azalttığını bildirdi; DeepSWE durumunda, şirketin hesaplanan oranlarına göre iş birimi başına 126 dolardan fazla bir fark.
Şirket ayrıca Ember-1'i, Fireworks'ün yeni başlatılan Özel İstihbarat Endeksi aracılığıyla yürüttüğü, 10 uzmanlık alanında 500 klinik vakanın doktor tarafından doğrulanmış bir karşılaştırması olan Doximity's Bedside Bench'te değerlendirdi. Fireworks, Ember-1'in GPT-5.6 Sol, GPT-6 Astra ve Claude Opus 5 dahil olmak üzere hem açık hem de kapalı modellerde görev başına maliyet konusunda yeni bir Pareto sınırı belirlediğini söylüyor. Bu iddia Fireworks'ün kendi endeksinden geliyor ve bağımsız olarak doğrulanmadı.
Canlı Trafik: Daha Az Token, Aynı Skorlar
Karşılaştırmalar bir şeydir; üretim başkadır. Fireworks, iki müşteriyle üretim kodlama iş yükleri üzerinde canlı A/B testleri gerçekleştirdi ve Ember-1'in benzer kalitede görev başına yaklaşık %35 daha az jeton kullandığını bildirdi. Ölçülen bir karşılaştırmada Kimi K3, görev başına 49.300 çıktı tokeni üretirken 0,751 puan alırken, Ember-1 29.900 tokende 0,753 puan aldı; bu, muhakeme tokenlarında %71,3 azalma ve toplam tokenlarda %39 daha az puan aldı. Testlerin ardından bir müşteri, temel modeli tamamen değiştirecek şekilde ölçeğini büyütme planlarıyla Ember-1'i canlı üretime taşıdı.
Model, Fireworks'ün kendi içinde, piyasaya sürülmeden önce sessizce şirketin kendi kodlama iş akışlarına değiştirildi. Takımın en çok gurur duyduğu sonuç: Kimse bunu fark etmedi. Geliştiriciler, önemli ölçüde daha az token tüketirken, geçişi fark etmeden çalışmalarına devam ettiler.
Strateji Olarak Uzmanlaşmış Zeka
Ember-1, Fireworks Research'ün planlı serisinin ilk modelidir ve uzmanların oluşturduğu gerçek dünya görevlerinde açık, kapalı ve özel modelleri karşılaştırmak için bu ayın başlarında tanıtılan bir kıyaslama çalışması olan şirketin Özel İstihbarat Endeksi ile birlikte gelir.
Stratejik oyunun okunması kolaydır. Fireworks, bir sınır modelini sıfırdan eğitmek yerine güçlü bir açık ağırlıklı modeli benimsedi, jeton verimliliğini buna eğitti ve şimdi aynı yeteneği görev başına daha düşük bir maliyetle satıyor. Moonshot gibi laboratuvarların açık ağırlıklı sürümleri yetenek açığını kapatmaya devam ettikçe, çıkarım sağlayıcılar kalıcı farklılaşmanın lider sıralamasından ziyade tamamlanan görev başına maliyette yatabileceğini keşfediyorlar; bu da güçlü eğitim ve hizmet altyapısına sahip şirketlerin lehine bir değişim.
Uyarıları açıkça belirtmeye değer: Yukarıdaki rakamlar Fireworks'ün kendi blogundan, kendi değerlendirmelerinden ve kendi ödeme yapan müşterilerinden gelmektedir. Token tasarruflarının dış iş yüklerinde bağımsız olarak kopyalanması gerçek test olacaktır. Ancak sonuçlar geçerliyse, ileri sınıf bir açık modeli çalıştırmanın en uygun maliyetli yolu, onu daha az düşündürmek olmayabilir; verimli düşünmeyi öğrenmiş bir modeli çalıştırmak olabilir.
---
En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →