Fireworks Research, l'équipe de modèles au sein de la startup d'inférence Fireworks AI, a présenté Ember-1, un modèle spécialisé qui, selon la société, produit les mêmes réponses que Kimi K3 de Moonshot AI tout en émettant environ 40 % de jetons en moins. Le modèle a été mis en ligne sur la plateforme Fireworks le 23 septembre et est devenu ces derniers jours l'une des versions les plus discutées dans la communauté des développeurs, attirant des centaines de votes positifs sur Hacker News alors que les codeurs débattaient pour savoir si les jetons de raisonnement étaient la prochaine frontière de coûts.
Cette présentation intervient à un moment où les factures d'inférence, et non les capacités de modélisation, décident de plus en plus de ce que les équipes peuvent se permettre de livrer. Pour les équipes qui observent que les charges de travail agents consomment des budgets, les derniers développements de l'IA ont clairement montré une chose : l'habitude la plus coûteuse du secteur à l'heure actuelle n'est pas de former des modèles frontières, mais de les exécuter. Ember-1 est la tentative de Fireworks de s'attaquer directement à ce problème, et la société l'a soutenu avec un ensemble inhabituellement détaillé de chiffres de référence et de production.
Les modèles pensants pensent trop
L'observation principale derrière Ember-1 est que les modèles de raisonnement comme Kimi K3 dépensent la majorité de leurs jetons générés – parfois plus de 90 %, selon Fireworks – en raisonnement interne plutôt qu'en réponse elle-même. Sur une seule demande, cela coûte cher. Dans les charges de travail agentiques, cela s'aggrave : chaque tour de conversation d'un agent rejoue tous les raisonnements antérieurs au modèle, de sorte que le contexte augmente à peu près de façon quadratique avec le nombre de tours, et les longues traces de raisonnement des premiers tours sont relues et refacturées à chaque appel ultérieur.
Fireworks affirme que les clients leur ont dit qu'ils voulaient la capacité de codage du Kimi K3 à moindre coût, mais que le simple fait de baisser l'effort de raisonnement du modèle n'a pas fonctionné - les paramètres à faible effort ont donné trop de qualité. L’alternative était de former un modèle qui raisonne plus efficacement tout en conservant le raisonnement qui compte.
Former les déchets
La construction d'Ember-1 a nécessité plus de 50 expériences de formation et plus de 200 évaluations, entièrement exécutées sur la propre plateforme de formation sans serveur de Fireworks, selon le blog de l'entreprise. L’équipe affirme avoir développé de nouveaux algorithmes d’entraînement en cours de route pour raccourcir le raisonnement sans perdre en précision.
Notamment, l’entreprise n’a pas tenté d’éliminer complètement le raisonnement. Une partie de la verbosité apparente de Kimi K3 est une auto-réflexion productive : revoir une hypothèse, répondre aux commentaires ou retracer un résultat à une décision antérieure aide le modèle à se remettre des erreurs. Le régime d’entraînement a été conçu pour préserver cette capacité tout en supprimant les boucles improductives.
Les données de formation couvraient les mathématiques, le codage, le suivi d'instructions, la conversation, la recherche, l'utilisation d'outils et l'ingénierie logicielle, couvrant à la fois des problèmes autonomes et des interactions multi-tours étendues. Fireworks affirme avoir utilisé uniquement ses propres données et aucune donnée client.
Benchmarks : sur ou à proximité de la frontière de Pareto
Pour justifier le coût, Fireworks a calculé le coût par référence en utilisant la tarification de l'API publique de Kimi K3 (3 $ par million de jetons d'entrée non mis en cache, 0,30 $ par million de jetons d'entrée en cache et 15 $ par million de jetons de sortie) et a comparé Ember-1 à K3 avec un effort de raisonnement faible, élevé et maximum. Pour chaque référence comportant plus de 50 échantillons de test, la société rapporte qu'Ember-1 se situe sur ou à proximité de la frontière de Pareto, correspondant au K3 à effort maximum pour une fraction du coût et dominant strictement le K3 à faible effort.
Les principales comparaisons avec K3 à effort maximum, telles que rapportées par Fireworks :
| Référence | Échantillons | K3 (effort maximum) | Braise-1 |
|---|---|---|---|
| Banc de terminaux 2.1 | 89 | 80,9% | 82,0% |
| Banc SWE Vérifié | 500 | 93,2% | 92,2% |
| SWE-Interagir | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Banc Compagnie aérienne | 50 | 64% | 66% |
En ce qui concerne le coût par tâche, Fireworks rapporte qu'Ember-1 a réduit ses dépenses de 51,9 % sur Terminal Bench 2.1, 32,5 % sur SWE-Interact, 23,7 % sur DeepSWE 1.1 et 15,5 % sur SWE-bench Verified par rapport à K3 avec effort maximum — dans le cas de DeepSWE, une différence de plus de 126 $ par unité de travail aux tarifs calculés par l'entreprise.
La société a également évalué Ember-1 sur le banc de chevet de Doximity, une référence validée par des médecins de 500 cas cliniques dans 10 spécialités que Fireworks utilise via son nouvel indice de renseignement spécialisé. Fireworks affirme qu'Ember-1 a établi une nouvelle frontière de Pareto en matière de coût par tâche dans les modèles ouverts et fermés, notamment GPT-5.6 Sol, GPT-6 Astra et Claude Opus 5. Cette affirmation provient du propre index de Fireworks et n'a pas été vérifiée de manière indépendante.
Trafic en direct : moins de jetons, mêmes scores
Les critères de référence sont une chose ; la production en est une autre. Fireworks a effectué des tests A/B en direct avec deux clients sur leurs charges de travail de codage de production et rapporte qu'Ember-1 a utilisé environ 35 % de jetons en moins par tâche à qualité comparable. Dans une comparaison mesurée, Kimi K3 a obtenu un score de 0,751 tout en générant 49 300 jetons de sortie par tâche, contre 0,753 pour Ember-1 sur 29 900 jetons – soit une réduction de 71,3 % des jetons de raisonnement et 39 % de jetons en moins. À la suite des tests, un client a mis Ember-1 en production réelle avec l'intention de le faire évoluer pour remplacer entièrement le modèle de base.
Au sein même de Fireworks, le modèle a été discrètement intégré aux propres flux de travail de codage de l'entreprise avant son lancement. Le résultat dont l’équipe dit être la plus fière : personne ne l’a remarqué. Les développeurs ont poursuivi leur travail sans détecter le changement tout en consommant beaucoup moins de jetons.
Le renseignement spécialisé comme stratégie
Ember-1 est le premier modèle d'une série prévue par Fireworks Research, et il arrive aux côtés de l'indice d'intelligence spécialisé de la société, un effort d'analyse comparative introduit plus tôt ce mois-ci pour comparer des modèles ouverts, fermés et spécialisés sur des tâches du monde réel créées par des experts.
Le jeu stratégique est facile à lire. Plutôt que de former un modèle frontière à partir de zéro, Fireworks a adopté un modèle ouvert solide, y a entraîné l'efficacité des jetons et vend désormais la même capacité à un coût par tâche inférieur. Alors que les publications ouvertes de laboratoires comme Moonshot continuent de combler l'écart de capacité, les fournisseurs d'inférence découvrent que la différenciation durable peut résider dans le coût par tâche terminée plutôt que dans la position dans le classement – un changement qui favorise les entreprises disposant d'une solide infrastructure de formation et de service.
Les mises en garde méritent d'être clairement énoncées : les chiffres ci-dessus proviennent du propre blog de Fireworks, de ses propres évaluations et de ses propres clients payants. La réplication indépendante des économies de jetons sur les charges de travail externes sera le véritable test. Mais si les résultats se confirment, la manière la plus rentable d’exécuter un modèle ouvert de classe frontière n’est peut-être plus de le faire réfléchir moins, mais plutôt d’exécuter un modèle qui a appris à penser efficacement.
---
Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →