추론 스타트업 Fireworks AI의 모델 팀인 Fireworks Research는 Moonshot AI의 Kimi K3와 동일한 답변을 생성하면서 약 40% 더 적은 토큰을 방출하는 전문 모델인 Ember-1을 도입했습니다. 이 모델은 9월 23일 Fireworks 플랫폼에 출시되었으며 지난 며칠 동안 개발자 커뮤니티에서 가장 많이 논의된 릴리스 중 하나가 되었으며, 코더들이 추론 토큰이 다음 비용 경계선인지에 대해 토론하면서 Hacker News에서 수백 개의 찬성 투표를 받았습니다.
모델 기능이 아닌 추론 청구서가 점점 더 팀이 출시할 수 있는 것을 결정하는 순간에 피치가 나옵니다. 에이전트 워크로드가 예산을 소비하는 것을 지켜보는 팀의 경우 최신 AI 개발을 통해 한 가지 분명한 사실이 드러났습니다. 현재 업계에서 가장 비용이 많이 드는 습관은 프론티어 모델을 교육하는 것이 아니라 이를 실행하는 것입니다. Ember-1은 이 문제를 직접적으로 공격하려는 Fireworks의 시도이며 회사는 매우 상세한 벤치마크 및 생산 수치 세트를 통해 이를 뒷받침했습니다.
생각하는 모델은 너무 많이 생각합니다
Ember-1의 핵심 관찰은 Kimi K3와 같은 추론 모델이 생성된 토큰의 대부분(Fireworks에 따르면 때로는 90% 이상)을 답변 자체가 아닌 내부 추론에 소비한다는 것입니다. 단일 요청으로는 비용이 많이 듭니다. 에이전트 워크로드에서는 에이전트 대화가 끝날 때마다 모든 사전 추론이 모델에 다시 재생되므로 컨텍스트는 차례 수에 따라 대략 2차적으로 증가하고 초기 턴의 긴 추론 추적은 모든 후속 호출에서 다시 읽고 다시 청구됩니다.
Fireworks는 고객들이 더 낮은 비용으로 Kimi K3의 코딩 기능을 원하지만 단순히 모델의 추론 노력을 무시하는 것은 효과가 없다고 말했습니다. 낮은 노력 설정으로 인해 품질이 너무 많이 저하되었습니다. 대안은 중요한 추론을 유지하면서 보다 효율적으로 추론하는 모델을 훈련하는 것이었습니다.
폐기물 제거 훈련
회사 블로그 게시물에 따르면 Ember-1 구축에는 50회 이상의 교육 실험과 200회 이상의 평가가 이루어졌으며 전적으로 Fireworks의 자체 서버리스 교육 플랫폼에서 실행되었습니다. 팀은 정확성을 잃지 않으면서 추론을 단축하기 위해 새로운 훈련 알고리즘을 개발했다고 밝혔습니다.
특히 회사는 추론을 도매로 없애려고 노력하지 않았습니다. Kimi K3의 명백한 장황함 중 일부는 생산적인 자기 성찰입니다. 즉, 가정을 재검토하고 피드백에 응답하거나 결과를 이전 결정으로 추적하는 것은 모델이 실수를 복구하는 데 도움이 됩니다. 훈련 방식은 비생산적인 루프를 제거하면서 해당 능력을 유지하도록 설계되었습니다.
교육 데이터는 수학, 코딩, 지침 따르기, 대화, 검색, 도구 사용 및 소프트웨어 엔지니어링을 포괄하며 독립형 문제와 확장된 다중 회전 상호 작용을 모두 포괄합니다. Fireworks는 자체 데이터만 사용했으며 고객 데이터는 사용하지 않았다고 밝혔습니다.
벤치마크: 파레토 프론티어 또는 그 근처
비용을 고려하기 위해 Fireworks는 Kimi K3의 공개 API 가격(캐시되지 않은 입력 토큰 백만 개당 3달러, 캐시된 입력 토큰 백만 개당 0.30달러, 출력 토큰 백만 개당 15달러)을 사용하여 벤치마크당 비용을 계산하고 낮음, 높음 및 최대 추론 노력에서 Ember-1을 K3와 비교했습니다. 50개 이상의 테스트 샘플이 포함된 모든 벤치마크에서 회사는 Ember-1이 파레토 경계 또는 그 근처에 위치하여 적은 비용으로 최대 노력으로 K3를 일치시키고 낮은 노력으로 K3를 엄격하게 압도한다고 보고합니다.
Fireworks에서 보고한 최대 노력 K3와의 헤드라인 비교:
| 벤치마크 | 샘플 | K3(최대 노력) | 엠버-1 |
|---|---|---|---|
| 터미널 벤치 2.1 | 89 | 80.9% | 82.0% |
| SWE-벤치 인증됨 | 500 | 93.2% | 92.2% |
| SWE-상호작용 | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-벤치항공 | 50 | 64% | 66% |
작업당 비용에 대해 Fireworks는 Ember-1이 최대 노력 시 K3에 비해 Terminal Bench 2.1에서 51.9%, SWE-Interact에서 32.5%, DeepSWE 1.1에서 23.7%, SWE-bench Verified에서 15.5% 지출을 줄였다고 보고합니다. DeepSWE의 경우 회사 계산 요율로 작업 단위당 126달러 이상의 차이가 있습니다.
또한 회사는 Fireworks가 새로 출시한 Specialized Intelligence Index를 통해 실행하는 10개 전문 분야에 걸쳐 500개 임상 사례에 대한 의사가 검증한 벤치마크인 Doximity의 Bedside Bench에서 Ember-1을 평가했습니다. Fireworks는 Ember-1이 GPT-5.6 Sol, GPT-6 Astra 및 Claude Opus 5를 포함하여 개방형 모델과 폐쇄형 모델 모두에서 작업당 비용에 대한 새로운 파레토 한계를 설정했다고 말합니다. 이러한 주장은 Fireworks의 자체 색인에서 나온 것이며 독립적으로 검증되지 않았습니다.
실시간 트래픽: 더 적은 수의 토큰, 동일한 점수
벤치마크는 한 가지입니다. 생산은 또 다른 것입니다. Fireworks는 프로덕션 코딩 워크로드에 대해 두 명의 고객을 대상으로 라이브 A/B 테스트를 실행했으며 Ember-1은 비슷한 품질에서 작업당 약 35% 더 적은 토큰을 사용했다고 보고했습니다. 측정된 한 비교에서 Kimi K3는 작업당 49,300개의 출력 토큰을 생성하는 동안 0.751점을 얻었고, Ember-1은 29,900개의 토큰에서 0.753점을 얻었습니다. 이는 추론 토큰이 71.3% 감소하고 총 토큰이 39% 감소한 것입니다. 테스트 후 한 고객은 Ember-1을 실제 생산으로 전환하여 기본 모델을 완전히 교체하기 위해 확장할 계획을 세웠습니다.
Fireworks 내부에서는 모델이 출시되기 전에 회사 자체 코딩 작업 흐름으로 조용히 교체되었습니다. 팀이 가장 자랑스러워하는 결과는 아무도 눈치 채지 못했다는 것입니다. 개발자들은 훨씬 적은 양의 토큰을 소비하면서 스위치를 감지하지 않고 작업을 수행했습니다.
전략으로서의 전문지능
Ember-1은 Fireworks Research에서 계획된 시리즈의 첫 번째 모델이며 전문가가 만든 실제 작업에 대한 개방형, 폐쇄형 및 특수 모델을 비교하기 위해 이달 초 도입된 벤치마킹 노력인 회사의 전문 지능 지수와 함께 출시됩니다.
전략적인 플레이는 읽기 쉽습니다. Fireworks는 처음부터 프론티어 모델을 교육하는 대신 강력한 개방형 모델을 채택하고 토큰 효율성을 교육했으며 이제 동일한 기능을 작업당 더 낮은 비용으로 판매하고 있습니다. Moonshot과 같은 연구소의 개방형 릴리스가 계속해서 기능 격차를 줄임에 따라 추론 제공업체는 내구성 있는 차별화가 리더보드 위치보다는 완료된 작업당 비용에 있을 수 있다는 사실을 발견하고 있습니다. 이는 강력한 교육 및 서비스 인프라를 갖춘 회사에 유리한 변화입니다.
주의 사항은 명확하게 언급할 가치가 있습니다. 위의 수치는 Fireworks의 자체 블로그, 자체 평가 및 유료 고객에서 나온 것입니다. 외부 작업 부하에 대한 토큰 절약을 독립적으로 복제하는 것이 실제 테스트가 될 것입니다. 그러나 결과가 유지된다면, 최첨단 개방형 모델을 실행하는 가장 비용 효율적인 방법은 더 이상 생각을 적게 하는 것이 아니라 효율적으로 생각하는 방법을 학습한 모델을 실행하는 것일 수 있습니다.
---
최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →