Fireworks Research, команда моделей у стартапі Fireworks AI, що розробляє висновки, представила Ember-1, спеціалізовану модель, яка, за словами компанії, дає ті самі відповіді, що й Kimi K3 від Moonshot AI, але видає приблизно на 40% менше токенів. Модель була запущена на платформі Fireworks 23 вересня, і за останні кілька днів вона стала одним із найбільш обговорюваних випусків у спільноті розробників, викликавши сотні голосів «за» на Hacker News, коли кодери обговорювали, чи є логічні токени наступною межею витрат.
Подача приходить у той момент, коли рахунки для висновків, а не можливості моделювання все більше вирішують, що команди можуть собі дозволити відправити. Для команд, які спостерігають, як робочі навантаження агентів витрачають бюджети, [останні розробки штучного інтелекту] (https://aibuzzwire.news) прояснили одну річ: зараз найдорожчою звичкою галузі є не навчання передових моделей, а їхнє керування. Ember-1 — це спроба Fireworks напряму вирішити цю проблему, і компанія підкріпила це надзвичайно детальним набором контрольних показників і показників виробництва.
Думаючі моделі забагато думають
Основне спостереження Ember-1 полягає в тому, що такі моделі міркувань, як Kimi K3, витрачають більшість згенерованих токенів — іноді понад 90%, згідно з даними Fireworks — на внутрішні міркування, а не на саму відповідь. На один запит це дорого. У агентських робочих навантаженнях це поєднується: кожен хід розмови агента відтворює всі попередні міркування назад до моделі, тому контекст зростає приблизно квадратично з кількістю ходів, а довгі сліди міркувань із ранніх ходів перечитуються та перераховуються за кожний наступний виклик.
У Fireworks кажуть, що клієнти сказали їм, що їм потрібна можливість кодування Kimi K3 за нижчою ціною, але просто відмова від міркувань моделі не спрацювала — налаштування з низьким зусиллям втратили занадто багато якості. Альтернативою було навчити модель, яка міркувала б ефективніше, зберігаючи аргументацію, яка має значення.
Training the Waste Out
Згідно з публікацією в блозі компанії, для створення Ember-1 було проведено понад 50 навчальних експериментів і понад 200 оцінок, повністю запущених на власній безсерверній навчальній платформі Fireworks. Команда каже, що попутно розробила нові алгоритми навчання, щоб скоротити міркування без втрати точності.
Примітно, що компанія не намагалася усунути міркування оптом. Частина очевидної багатослівності Kimi K3 є продуктивною саморефлексією — перегляд припущень, реагування на відгуки або відстеження результату до попереднього рішення допомагає моделі оговтатися від помилок. Режим навчання був розроблений, щоб зберегти цю здатність під час обрізання непродуктивних петель.
Навчальні дані охоплювали математику, кодування, виконання інструкцій, бесіду, пошук, використання інструментів і розробку програмного забезпечення, охоплюючи як окремі проблеми, так і розширену багатоповоротну взаємодію. У Fireworks стверджують, що використовували лише власні дані, а не дані клієнтів.
Контрольні показники: на межі Парето або поблизу неї
Щоб обґрунтувати вартість, Fireworks обчислила вартість порівняльного тесту, використовуючи загальнодоступну ціну API Kimi K3 — 3 долари США за мільйон некешованих вхідних токенів, 0,30 доларів США за мільйон кешованих вхідних токенів і 15 доларів США за мільйон вихідних токенів — і порівняла Ember-1 із K3 при низьких, високих і максимальних зусиллях міркування. У кожному бенчмарку з більш ніж 50 тестовими зразками компанія повідомляє, що Ember-1 знаходиться на межі Парето або поблизу нього, зрівнявшись з K3 при максимальних зусиллях за невелику частку вартості та суворо домінуючи над K3 при низьких зусиллях.
Заголовок порівняння з K3 при максимальних зусиллях, як повідомляє Fireworks:
| Еталон | Зразки | К3 (максимальне зусилля) | Ембер-1 |
|---|---|---|---|
| Термінальний стенд 2.1 | 89 | 80,9% | 82,0% |
| Перевірений стенд SWE | 500 | 93,2% | 92,2% |
| SWE-Interact | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Bench Airline | 50 | 64% | 66% |
Щодо вартості виконання завдання, Fireworks повідомляє, що Ember-1 скоротив витрати на 51,9% на Terminal Bench 2.1, 32,5% на SWE-Interact, 23,7% на DeepSWE 1.1 і 15,5% на SWE-bench Verified порівняно з K3 при максимальних зусиллях — у випадку DeepSWE різниця становить понад 126 доларів США за одиницю роботи за розрахунками компанії. ставки.
Компанія також оцінила Ember-1 на Doximity's Bedside Bench, перевіреному лікарями тесті 500 клінічних випадків у 10 спеціальностях, який Fireworks перевіряє через свій нещодавно запущений індекс спеціалізованого інтелекту. У Fireworks кажуть, що Ember-1 встановив новий рубіж за Парето щодо вартості виконання завдання як для відкритих, так і для закритих моделей, включаючи GPT-5.6 Sol, GPT-6 Astra та Claude Opus 5. Це твердження походить від власного індексу Fireworks і не було незалежно перевірено.
Живий трафік: менше жетонів, однакові результати
Орієнтири – це одне; виробництво інше. Компанія Fireworks провела живі A/B-тести з двома клієнтами щодо їхніх робочих навантажень із кодування продукції та повідомляє, що Ember-1 використовував приблизно на 35% менше токенів на завдання за порівнянної якості. Під час одного виміряного порівняння Kimi K3 набрав 0,751, генеруючи 49 300 токенів виводу за завдання, проти 0,753 для Ember-1 на 29 900 токенів — на 71,3% менше жетонів аргументації та на 39% менше загальної кількості токенів. Після випробувань один клієнт перевів Ember-1 у реальне виробництво з планами розширити його, щоб повністю замінити базову модель.
У самому Fireworks модель було тихо замінено на власні робочі процеси кодування компанії перед запуском. Результат, яким команда пишається найбільше: ніхто не помітив. Розробники продовжували свою роботу, не виявляючи комутатора, споживаючи при цьому значно менше токенів.
Спеціалізована розвідка як стратегія
Ember-1 є першою моделлю в запланованій серії від Fireworks Research, і вона надходить разом із індексом спеціалізованого інтелекту компанії, бенчмаркінгом, запровадженим на початку цього місяця для порівняння відкритих, закритих і спеціалізованих моделей для завдань реального світу, створених експертами.
Стратегічну п'єсу легко читати. Замість того, щоб тренувати передову модель з нуля, Fireworks взяла потужну відкриту модель, навчила в ній ефективність маркерів і тепер продає ті самі можливості за нижчою ціною за виконання завдання. У той час як відкриті випуски таких лабораторій, як Moonshot, продовжують усувати прогалину в можливостях, постачальники висновків виявляють, що довготривала диференціація може полягати у вартості виконаного завдання, а не в позиції в таблиці лідерів — зміна, яка надає перевагу компаніям із потужною інфраструктурою навчання та обслуговування.
Застереження варто висловити прямо: цифри вище взяті з власного блогу Fireworks, її власних оцінок і її власних платоспроможних клієнтів. Незалежне відтворення економії токенів на зовнішніх навантаженнях стане справжнім випробуванням. Але якщо результати підтвердяться, найбільш економічно ефективним способом запустити відкриту модель передового класу може бути не те, щоб змусити її менше думати — це може бути запуск моделі, яка навчилася мислити ефективно.
---
Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →