¿Qué cambió?
Según la hoja de tarifas publicada por OpenAI y el registro de cambios de API, los precios estándar por millón de tokens ahora dicen:
- GPT-5.6 Luna: entrada de 20 centavos y salida de $1,20, en comparación con $1 y $6: una reducción del 80 %
- GPT-5.6 Terra: $2 y $12, en comparación con $2,50 y $15: un recorte del 20 %
- GPT-5.6 Sol (el buque insignia): $5 y $30, sin cambios
Los tres niveles se lanzaron a disponibilidad general el 9 de julio de 2026 a tarifas más altas, lo que coloca la revisión de precios a solo 21 días de la vida comercial de la familia. Reuters y CNBC confirmaron los recortes, y Axios informó que la reducción más pronunciada recayó en el modelo Luna.
Los recortes fluyen a través de cada nivel de servicio
Las reducciones no se limitan a los precios principales. Fluyen a través de todas las opciones en la hoja de tarifas:
- El procesamiento por lotes y flexible, ambos a la mitad del precio estándar, coloca a Luna en 10 centavos de entrada y 60 centavos de salida por millón de tokens.
- Lecturas de entrada en caché, descuento del 90%, caída a dos centavos por millón de tokens en Luna y 20 centavos en Terra.
- Solicitudes de contexto largo, facturadas al doble de la tasa de entrada y 1,5 veces la producción, aterrizan a 40 centavos y $1,80 para Luna.
Para los equipos que ya dirigen la clasificación masiva, la extracción o los bucles largos de agentes a través de los niveles más baratos, las mismas llamadas ahora cuestan una fracción de lo que costaban el día anterior.
Cómo se comparan los cortes con Anthropic
Con un precio de 20 centavos y 1,20 dólares, Luna ahora rebaja el modelo más barato publicado por Anthropic, Haiku 4.5, aproximadamente cinco veces en entrada y cuatro veces en producción, según la página de precios de Anthropic. La nueva tarifa de Terra se sitúa por debajo de los 3 dólares y 15 dólares que Claude Sonnet 5 está previsto que cobre una vez que su precio de lanzamiento expire el 31 de agosto de 2026.
En la cima de ambas alineaciones, Sol todavía cuesta más en producción que el Opus 5 de Anthropic, que tiene un precio de $5 y $25.
El procesamiento prioritario se convierte en modo rápido
La misma entrada del registro de cambios eliminó el "Procesamiento prioritario" y lo reemplazó con "Modo rápido". Para el modelo insignia Sol, OpenAI dice que el modo Rápido funciona hasta 2,5 veces la velocidad estándar al doble del precio, y el conmutador es compatible con versiones anteriores: las solicitudes ya están etiquetadas para una ruta prioritaria al modo Rápido sin un cambio de código.
Las tarifas en modo rápido son $10 y $60 para Sol, $4 y $24 para Terra, y 40 centavos y $2,40 para Luna. En particular, Anthropic vende el mismo producto con el mismo nombre y los mismos términos, y las dos hojas de tarifas ahora también convergen en la inferencia determinada por región: OpenAI cobra un aumento del 10% en los modelos lanzados a partir del 5 de marzo de 2026 cuando un cliente requiere residencia de datos, mientras que Anthropic factura la inferencia solo en EE. UU. a 1,1 veces su tarifa estándar.
Por qué los niveles más baratos se volvieron más baratos
Un día antes del corte, OpenAI publicó una publicación de ingeniería que describe las optimizaciones en su pila de inferencia. Cinco miembros del personal técnico de la compañía escribieron que Sol, ejecutándose dentro de su herramienta de codificación Codex, reescribió los núcleos de GPU de producción; un trabajo que, según OpenAI, redujo los costos de servicio de un extremo a otro en un 20%. El modelo también rediseñó su propio borrador de modelo de decodificación especulativa a través de cientos de experimentos, un cambio al que se le atribuye un aumento de la eficiencia de generación de tokens en más del 15%.
Esas son las cifras de OpenAI para su propia pila, pero apuntan al mismo centro de costos al que se dirige el recorte de precios: el agente detrás de Codex y ChatGPT. OpenAI limita la salida de la herramienta a 10,000 tokens de forma predeterminada y mantiene el historial visible del modelo como adjunto, por lo que un bucle de agente que reenvía sus instrucciones en cada paso llega al caché de avisos en lugar de pagar tarifas de entrada completas. La compañía cerró la publicación con el compromiso de transmitir "mejoras internas a nuestros usuarios en forma de inteligencia rentable y más ampliamente disponible". La hoja de tarifas llegó un día después.
Socios de la nube y facturación
OpenAI señaló que AWS factura a los compradores que enrutan el tráfico a través de Amazon Bedrock, y esas tarifas pueden diferir de las de su propia tarjeta publicada. A medida que más empresas centralicen el acceso a los modelos a través de un único proveedor de nube, la brecha entre los precios directos de OpenAI y lo que los clientes realmente pagan a través de intermediarios importará tanto como las cifras de los titulares.
Un mercado que cuenta cada token
Los recortes se producen a medida que los compradores de empresas auditan las inferencias sobre el gasto más de cerca que nunca. A principios de semana, los informes documentaron cómo la era del "tokenmaxxing" desenfrenado (aumentar el volumen sin vigilar los costos) se está desvaneciendo a medida que las facturas corporativas de IA aumentan en las principales plataformas. La decisión de OpenAI de traspasar sus ahorros de costos internos a los clientes, en lugar de acumular el margen, es una señal clara de dónde cree que se está librando ahora la batalla competitiva: no en la frontera, donde Sol todavía tiene precios superiores, sino en los niveles baratos y de alto volumen donde realmente vive la mayor parte del tráfico de producción.
Con el precio de Sol sin cambios, la decisión en vivo para los desarrolladores permanece exactamente donde la ha colocado OpenAI desde que se lanzó la familia: qué nivel requiere cada solicitud. La diferencia es que el costo de tomar esa decisión equivocada acaba de caer dramáticamente.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →