推論スタートアップ Fireworks AI 内のモデル チームである Fireworks Research は、Ember-1 を導入しました。これは、同社によれば、Moonshot AI の Kim K3 と同じ答えを生成しながら、発行するトークンの量が約 40% 少ない特殊なモデルです。このモデルは 9 月 23 日に Fireworks のプラットフォームで公開され、ここ数日間、開発者コミュニティで最も議論されているリリースの 1 つとなり、プログラマーが推論トークンが次のコストのフロンティアであるかどうかを議論する中、ハッカー ニュースで数百の賛成票を集めました。
この提案は、モデルの能力ではなく推論のコストによって、チームが出荷できるものを決定するようになっていく中で行われます。エージェントのワークロードが予算を消費するのを目の当たりにしているチームにとって、最新の AI 開発 は 1 つのことを明らかにしました。現在、業界で最もコストがかかる習慣は、フロンティア モデルのトレーニングではなく、フロンティア モデルの実行です。 Ember-1 は、この問題を直接攻撃しようとする Fireworks の試みであり、同社は異常に詳細なベンチマークと製品番号のセットでそれを裏付けました。
思考モデルは考えすぎます
Ember-1 の背後にある中心的な観察は、Kimi K3 のような推論モデルは、生成されたトークンの大部分 (Fireworks によれば、場合によっては 90% 以上) を答えそのものではなく内部推論に費やしているということです。 1 回のリクエストでは高額になります。エージェントのワークロードでは、これがさらに複雑になります。エージェントの会話の各ターンで、以前のすべての推論がモデルにリプレイされるため、コンテキストはターン数に応じてほぼ二次関数的に増加し、初期のターンからの長い推論トレースが再読み込みされ、後続の呼び出しごとに再請求されます。
Fireworks によれば、顧客は Kim K3 のコーディング機能をより低コストで提供したいが、モデルの推論努力を単に拒否するだけでは機能せず、労力の少ない設定では品質が犠牲になりすぎるとのことでした。代替案は、重要な推論を維持しながら、より効率的に推論するモデルをトレーニングすることでした。
無駄を排除するトレーニング
同社のブログ投稿によると、Ember-1 の構築には 50 を超えるトレーニング実験と 200 を超える評価が必要で、すべて Fireworks 独自のサーバーレス トレーニング プラットフォーム上で実行されました。同チームは、精度を損なうことなく推論を短縮するために、途中で新しいトレーニングアルゴリズムを開発したと述べている。
注目すべきは、同社が推論を完全に排除しようとしたわけではないということである。 Kimi K3 の明らかな冗長さの一部は、生産的な内省です。仮定を再検討したり、フィードバックに応答したり、結果を以前の決定まで遡ったりすることは、モデルが間違いから回復するのに役立ちます。トレーニング計画は、非生産的なループを削減しながら、その能力を維持するように設計されました。
トレーニング データは数学、コーディング、指示に従って、会話、検索、ツールの使用、ソフトウェア エンジニアリングに及び、スタンドアロンの問題と拡張されたマルチターン インタラクションの両方をカバーしました。 Fireworks は、自社のデータのみを使用し、顧客データは使用していないと述べています。
ベンチマーク: パレートフロンティア上またはその近く
コストを検証するために、Fireworks は Kim K3 のパブリック API 価格設定 (キャッシュされていない入力トークン 100 万個あたり 3 ドル、キャッシュされた入力トークン 100 万個あたり 0.30 ドル、出力トークン 100 万個あたり 15 ドル) を使用してベンチマークごとのコストを計算し、低、高、最大の推論労力で Ember-1 と K3 を比較しました。同社は、50 を超えるテスト サンプルを含むすべてのベンチマークにわたって、Ember-1 がパレート フロンティアまたはその近くに位置し、数分の 1 のコストで最大の労力で K3 に匹敵し、低労力では K3 を厳密に支配していると報告しています。
Fireworks が報告した、最大の努力での K3 とのヘッドラインの比較:
|ベンチマーク |サンプル | K3 (最大努力値) |エンバー-1 |
|---|---|---|---|
|ターミナルベンチ 2.1 | 89 | 80.9% | 82.0% |
| SWE ベンチ検証済み | 500 | 93.2% | 92.2% |
| SWE-Interact | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-ベンチ航空会社 | 50 | 64% | 66% |
Fireworks は、タスクあたりのコストについて、Ember-1 は、最大の労力で K3 と比較して、ターミナル ベンチ 2.1 で 51.9%、SWE-Interact で 32.5%、DeepSWE 1.1 で 23.7%、SWE-bench Verified で 15.5% の支出を削減したと報告しています。DeepSWE の場合、会社の計算レートでは作業単位あたり 126 ドル以上の差があります。
同社はまた、Doximity の Bedside Bench で Ember-1 を評価しました。Doximity の Bedside Bench は、Fireworks が新しく立ち上げた Specialized Intelligence Index を通じて実行している、10 の専門分野にわたる 500 件の臨床症例の医師検証済みのベンチマークです。そこで Fireworks は、Ember-1 は GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 を含むオープン モデルとクローズド モデルの両方にわたってタスクあたりのコストに関して新たなパレートの限界を設定したと述べています。この主張は Fireworks 独自のインデックスから来ており、独立して検証されていません。
ライブトラフィック: 少ないトークン、同じスコア
ベンチマークはひとつのことです。生産は別です。 Fireworks は、2 人の顧客を対象に本番コーディング ワークロードに対してライブ A/B テストを実施し、Ember-1 は同等の品質でタスクあたりのトークン使用量が約 35% 少ないと報告しました。ある測定された比較では、タスクあたり 49,300 個の出力トークンを生成した際の Kim K3 のスコアは 0.751 だったのに対し、Ember-1 は 29,900 個のトークンで 0.753 でした。これは推論トークンが 71.3% 減少し、総トークン数が 39% 減少しました。テストの後、ある顧客は Ember-1 を運用環境に移行し、基本モデルを完全に置き換えるためにスケールアップする計画を立てました。
Fireworks 自体の内部では、モデルは発売前に密かに会社独自のコーディング ワークフローに置き換えられました。チームが最も誇りに思っているのは、誰も気づかなかった結果だという。開発者は、トークンの消費量を大幅に減らしながら、スイッチを検出することなく作業を続行しました。
戦略としての特化したインテリジェンス
Ember-1 は、Fireworks Research が計画しているシリーズの最初のモデルであり、専門家が作成した現実世界のタスクに関してオープン モデル、クローズド モデル、特殊モデルを比較するために今月初めに導入されたベンチマークの取り組みである同社の Specialized Intelligence Index とともに登場します。
戦略的なプレーが読みやすい。 Fireworks は、フロンティア モデルをゼロからトレーニングするのではなく、強力なオープンウェイト モデルを採用し、トークン効率をトレーニングして、現在は同じ機能をタスクあたりのコストを低く抑えて販売しています。 Moonshot のようなラボからの無差別リリースが能力のギャップを埋め続ける中、推論プロバイダーは、永続的な差別化がリーダーボードの地位ではなく、完了したタスクあたりのコストにある可能性があることに気づき始めています。これは、強力なトレーニングとサービス提供インフラストラクチャを備えた企業に有利な変化です。
注意点ははっきりと述べておく価値があります。上記の数字は、Fireworks 自身のブログ、独自の評価、および独自の料金を払っている顧客から得たものです。外部ワークロードでのトークン節約の独立したレプリケーションが実際のテストになります。しかし、結果が維持される場合、フロンティアクラスのオープンモデルを実行するための最も費用対効果の高い方法は、もはや思考力を低下させることではなく、効率的に考えることを学習したモデルを実行することになるかもしれません。
---
最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→