Fireworks Research, модельная группа стартапа Fireworks AI, занимающегося логическими выводами, представила Ember-1, специализированную модель, которая, по словам компании, дает те же ответы, что и Kimi K3 от Moonshot AI, но излучает примерно на 40% меньше токенов. Модель была запущена на платформе Fireworks 23 сентября, и за последние несколько дней она стала одним из самых обсуждаемых релизов в сообществе разработчиков, получив сотни голосов на Hacker News, когда программисты обсуждали, станут ли токены рассуждения следующим рубежом затрат.
Это событие происходит в тот момент, когда счета за логические выводы, а не возможности модели, все чаще решают, какие команды могут позволить себе выпускать. Для команд, наблюдающих за тем, как агентские рабочие нагрузки поглощают бюджеты, [последние разработки в области искусственного интеллекта] (https://aibuzzwire.news) прояснили одну вещь: самая дорогая привычка в отрасли сейчас — не обучение передовых моделей, а их запуск. Ember-1 — это попытка Fireworks напрямую решить эту проблему, и компания подкрепила ее необычайно подробным набором контрольных показателей и производственных показателей.
Модели мышления слишком много думают
Основное наблюдение, лежащее в основе Ember-1, заключается в том, что модели рассуждения, такие как Kimi K3, тратят большую часть сгенерированных токенов — иногда более 90%, по данным Fireworks, — на внутренние рассуждения, а не на сам ответ. По одному запросу это дорого. В агентских рабочих нагрузках оно усугубляется: каждый этап разговора агента воспроизводит все предыдущие рассуждения обратно в модель, поэтому контекст увеличивается примерно квадратично с количеством ходов, а длинные следы рассуждений из ранних ходов перечитываются и пересчитываются при каждом последующем вызове.
Fireworks утверждает, что клиенты сказали им, что им нужны возможности кодирования Kimi K3 по более низкой цене, но простое отключение логических усилий модели не сработало — настройки с низкими усилиями теряли слишком много качества. Альтернативой было обучение модели, которая рассуждает более эффективно, сохраняя при этом важные рассуждения.
Тренировка отходов
Согласно сообщению в блоге компании, для создания Ember-1 потребовалось более 50 обучающих экспериментов и более 200 оценок, полностью выполненных на собственной платформе бессерверного обучения Fireworks. Команда утверждает, что разработала новые алгоритмы обучения, позволяющие сократить рассуждения без потери точности.
Примечательно, что компания не попыталась полностью устранить рассуждения. Отчасти кажущаяся многословность Кими К3 связана с продуктивным самоанализом: пересмотр предположения, ответ на обратную связь или отслеживание результата до более раннего решения помогает модели оправиться от ошибок. Режим тренировок был разработан таким образом, чтобы сохранить эту способность и одновременно сократить непродуктивные циклы.
Данные обучения охватывали математику, программирование, выполнение инструкций, разговоры, поиск, использование инструментов и разработку программного обеспечения, охватывая как отдельные задачи, так и расширенные многоходовые взаимодействия. Fireworks заявляет, что использовала только свои собственные данные и не использовала данные клиентов.
Контрольные показатели: на границе Парето или вблизи нее
Чтобы обосновать стоимость, Fireworks рассчитала стоимость каждого эталонного теста, используя цену общедоступного API Kimi K3 — 3 доллара за миллион некэшированных входных токенов, 0,30 доллара за миллион кешированных входных токенов и 15 долларов за миллион выходных токенов — и сравнила Ember-1 с K3 при низких, высоких и максимальных усилиях по рассуждению. Компания сообщает, что во всех тестах с более чем 50 тестовыми образцами Ember-1 находится на границе Парето или около нее, сопоставляя K3 при максимальных усилиях за небольшую часть стоимости и строго доминируя над K3 при небольших усилиях.
Сравнение заголовков с K3 при максимальном усилии, как сообщает Fireworks:
| Бенчмарк | Образцы | К3 (максимальное усилие) | Эмбер-1 |
|---|---|---|---|
| Терминальная скамейка 2.1 | 89 | 80,9% | 82,0% |
| SWE-стенд проверен | 500 | 93,2% | 92,2% |
| SWE-Интеракт | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Бенч Авиакомпания | 50 | 64% | 66% |
Что касается затрат на задачу, Fireworks сообщает, что Ember-1 сократил расходы на 51,9% на Terminal Bench 2.1, на 32,5% на SWE-Interact, на 23,7% на DeepSWE 1.1 и на 15,5% на SWE-bench Verified по сравнению с K3 при максимальных усилиях - в случае DeepSWE разница составляет более 126 долларов за единицу работы по расчетным ставкам компании.
Компания также оценила Ember-1 на Bedside Bench от Doximity, проверенном врачами эталоне, включающем 500 клинических случаев по 10 специальностям, которые Fireworks проводит через свой недавно запущенный индекс Specialized Intelligence Index. Там Fireworks заявляет, что Ember-1 установил новую границу Парето по стоимости задачи как для открытых, так и для закрытых моделей, включая GPT-5.6 Sol, GPT-6 Astra и Claude Opus 5. Это утверждение основано на собственном индексе Fireworks и не прошло независимой проверки.
Живой трафик: меньше токенов, те же результаты
Тесты – это одно; производство другое. Fireworks провела A/B-тесты с двумя клиентами для рабочих нагрузок по кодированию и сообщила, что Ember-1 использовал примерно на 35 % меньше токенов на задачу при сопоставимом качестве. В одном измеренном сравнении Kimi K3 набрал 0,751, генерируя 49 300 токенов вывода за задачу, против 0,753 у Ember-1 с 29 900 токенами — сокращение количества токенов рассуждения на 71,3% и общее количество жетонов на 39%. После испытаний один заказчик запустил Ember-1 в серийное производство, планируя масштабировать его, чтобы полностью заменить базовую модель.
Внутри самой Fireworks перед запуском модель была незаметно включена в собственные рабочие процессы кодирования компании. Результат, которым команда гордится больше всего: никто не заметил. Разработчики продолжили свою работу, не обнаружив переключения, потребляя при этом значительно меньше токенов.
Специализированная разведка как стратегия
Ember-1 — первая модель в запланированной серии от Fireworks Research, и она поставляется вместе с индексом специализированного интеллекта компании — эталонным тестом, представленным ранее в этом месяце для сравнения открытых, закрытых и специализированных моделей при выполнении реальных задач, созданных экспертами.
Стратегическая игра легко читается. Вместо того, чтобы обучать передовую модель с нуля, Fireworks взяла мощную модель с открытым весом, обучила ее эффективности токенов и теперь продает те же возможности по более низкой цене за задачу. В то время как выпуски открытых весов от таких лабораторий, как Moonshot, продолжают сокращать разрыв в возможностях, поставщики логических выводов обнаруживают, что устойчивая дифференциация может заключаться в стоимости выполненной задачи, а не в позиции в таблице лидеров — сдвиг, который благоприятствует компаниям с сильной инфраструктурой обучения и обслуживания.
Предостережения стоит сформулировать прямо: приведенные выше цифры взяты из собственного блога Fireworks, ее собственных оценок и ее собственных платящих клиентов. Независимая репликация сэкономленных токенов на внешние рабочие нагрузки станет настоящим испытанием. Но если результаты оправдаются, то наиболее экономичным способом запустить открытую модель передового класса, возможно, больше будет не заставлять ее меньше думать, а использовать модель, которая научилась мыслить эффективно.
---
Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →