Fireworks Research, el equipo modelo dentro de la startup de inferencia Fireworks AI, presentó Ember-1, un modelo especializado que, según la compañía, produce las mismas respuestas que Kimi K3 de Moonshot AI y emite aproximadamente un 40% menos de tokens. El modelo se lanzó en la plataforma de Fireworks el 23 de septiembre y en los últimos días se ha convertido en uno de los lanzamientos más discutidos en la comunidad de desarrolladores, generando cientos de votos a favor en Hacker News mientras los codificadores debatían si los tokens de razonamiento son la próxima frontera de costos.
La propuesta llega en un momento en el que los proyectos de ley de inferencia, no la capacidad del modelo, deciden cada vez más qué pueden permitirse los equipos. Para los equipos que ven cómo las cargas de trabajo de agentes consumen presupuestos, los últimos desarrollos de IA han dejado una cosa clara: el hábito más caro de la industria en este momento no es entrenar modelos de frontera, sino ejecutarlos. Ember-1 es el intento de Fireworks de atacar ese problema directamente, y la compañía lo respaldó con un conjunto inusualmente detallado de cifras de referencia y producción.
Los modelos pensantes piensan demasiado
La observación central detrás de Ember-1 es que los modelos de razonamiento como Kimi K3 gastan la mayoría de sus tokens generados (a veces más del 90%, según Fireworks) en razonamiento interno en lugar de en la respuesta en sí. Con una sola petición, eso resulta caro. En las cargas de trabajo de agente, esto se agrava: cada turno de una conversación con un agente reproduce todo el razonamiento anterior en el modelo, por lo que el contexto crece aproximadamente de forma cuadrática con el número de turnos, y los largos rastros de razonamiento de los primeros turnos se vuelven a leer y facturar en cada llamada posterior.
Fireworks dice que los clientes les dijeron que querían la capacidad de codificación de Kimi K3 a un costo menor, pero que simplemente rechazar el esfuerzo de razonamiento del modelo no funcionó: las configuraciones de bajo esfuerzo perdían demasiada calidad. La alternativa era entrenar un modelo que razonara de manera más eficiente manteniendo el razonamiento que importa.
Entrenando a eliminar los residuos
La construcción de Ember-1 requirió más de 50 experimentos de capacitación y más de 200 evaluaciones, ejecutadas íntegramente en la propia plataforma Serverless Training de Fireworks, según la publicación del blog de la compañía. El equipo dice que desarrolló nuevos algoritmos de entrenamiento a lo largo del camino para acortar el razonamiento sin perder precisión.
En particular, la empresa no intentó eliminar el razonamiento en su totalidad. Parte de la aparente verbosidad de Kimi K3 es una autorreflexión productiva: revisar una suposición, responder a la retroalimentación o rastrear un resultado hasta una decisión anterior ayuda al modelo a recuperarse de los errores. El régimen de entrenamiento fue diseñado para preservar esa capacidad y al mismo tiempo recortar bucles improductivos.
Los datos de entrenamiento abarcaron matemáticas, codificación, seguimiento de instrucciones, conversación, búsqueda, uso de herramientas e ingeniería de software, y abarcaron tanto problemas independientes como interacciones extendidas de múltiples turnos. Fireworks dice que utilizó sólo sus propios datos y ningún dato de clientes.
Puntos de referencia: en o cerca de la frontera de Pareto
Para justificar el costo, Fireworks calculó el costo por punto de referencia utilizando el precio de la API pública de Kimi K3 (3 dólares por millón de tokens de entrada sin caché, 0,30 dólares por millón de tokens de entrada almacenados en caché y 15 dólares por millón de tokens de salida) y comparó Ember-1 con K3 con un esfuerzo de razonamiento bajo, alto y máximo. En cada punto de referencia con más de 50 muestras de prueba, la compañía informa que Ember-1 se encuentra en o cerca de la frontera de Pareto, igualando a K3 en esfuerzo máximo por una fracción del costo y dominando estrictamente a K3 en esfuerzo bajo.
El titular compara con el K3 al máximo esfuerzo, según informa Fireworks:
| Punto de referencia | Muestras | K3 (esfuerzo máximo) | Ascua-1 |
|---|---|---|---|
| Banco de terminales 2.1 | 89 | 80,9% | 82,0% |
| SWE-bench Verificado | 500 | 93,2% | 92,2% |
| SWE-Interactuar | 75 | 21,3% | 20,0% |
| ProfundoSWE 1.1 | 113 | 66,4% | 75,2% |
| Aerolínea de banco τ² | 50 | 64% | 66% |
En cuanto al costo por tarea, Fireworks informa que Ember-1 redujo el gasto en un 51,9 % en Terminal Bench 2.1, un 32,5 % en SWE-Interact, un 23,7 % en DeepSWE 1.1 y un 15,5 % en SWE-bench Verified en relación con K3 con el esfuerzo máximo; en el caso de DeepSWE, una diferencia de más de $126 por unidad de trabajo según las tarifas calculadas por la compañía.
La compañía también evaluó Ember-1 en Bedside Bench de Doximity, un punto de referencia validado por médicos de 500 casos clínicos en 10 especialidades que Fireworks ejecuta a través de su índice de inteligencia especializada recientemente lanzado. Allí, Fireworks dice que Ember-1 estableció una nueva frontera de Pareto en el costo por tarea en modelos abiertos y cerrados, incluidos GPT-5.6 Sol, GPT-6 Astra y Claude Opus 5. Esa afirmación proviene del propio índice de Fireworks y no ha sido verificada de forma independiente.
Tráfico en vivo: menos tokens, mismas puntuaciones
Los puntos de referencia son una cosa; la producción es otra. Fireworks realizó pruebas A/B en vivo con dos clientes en sus cargas de trabajo de codificación de producción e informa que Ember-1 utilizó aproximadamente un 35 % menos de tokens por tarea con una calidad comparable. En una comparación medida, Kimi K3 obtuvo una puntuación de 0,751 y generó 49.300 tokens de salida por tarea, frente a 0,753 de Ember-1 con 29.900 tokens: una reducción del 71,3 % en los tokens de razonamiento y un 39 % menos de tokens totales. Después de las pruebas, un cliente trasladó Ember-1 a producción real con planes de ampliarlo para reemplazar el modelo base por completo.
Dentro de Fireworks, el modelo se intercambió silenciosamente en los flujos de trabajo de codificación propios de la compañía antes del lanzamiento. El resultado del que el equipo dice estar más orgulloso: nadie se dio cuenta. Los desarrolladores continuaron su trabajo sin detectar el cambio y consumieron sustancialmente menos tokens.
Inteligencia especializada como estrategia
Ember-1 es el primer modelo de una serie planificada de Fireworks Research y llega junto con el Índice de Inteligencia Especializada de la compañía, un esfuerzo de evaluación comparativa presentado a principios de este mes para comparar modelos abiertos, cerrados y especializados en tareas del mundo real creadas por expertos.
El juego estratégico es fácil de leer. En lugar de entrenar un modelo de frontera desde cero, Fireworks tomó un modelo sólido de peso abierto, entrenó en él la eficiencia de los tokens y ahora vende la misma capacidad a un menor costo por tarea. A medida que los lanzamientos abiertos de laboratorios como Moonshot siguen cerrando la brecha de capacidad, los proveedores de inferencias están descubriendo que la diferenciación duradera puede residir en el costo por tarea completada en lugar de en la posición de liderazgo, un cambio que favorece a las empresas con una sólida capacitación e infraestructura de servicio.
Vale la pena exponer claramente las advertencias: las cifras anteriores provienen del propio blog de Fireworks, de sus propias evaluaciones y de sus propios clientes de pago. La replicación independiente de los ahorros simbólicos en cargas de trabajo externas será la verdadera prueba. Pero si los resultados se mantienen, la forma más rentable de ejecutar un modelo abierto de clase frontera tal vez ya no sea hacerlo pensar menos, sino ejecutar un modelo que haya aprendido a pensar de manera eficiente.
---
Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →