Wat is er veranderd
Volgens OpenAI's gepubliceerde tariefkaart en API-changelog luiden de standaardprijzen per miljoen token nu:
- GPT-5.6 Luna: 20 cent invoer en $1,20 uitvoer, lager dan $1 en $6 – een korting van 80%
- GPT-5.6 Terra: $2 en $12, lager dan $2,50 en $15 — een korting van 20%
- GPT-5.6 Sol (het vlaggenschip): $5 en $30, ongewijzigd
Alle drie de niveaus zijn op 9 juli 2026 algemeen beschikbaar tegen de hogere tarieven, waardoor de prijsherziening slechts 21 dagen in het commerciële leven van het gezin plaatsvond. Reuters en CNBC bevestigden beide de bezuinigingen, en Axios meldde dat de sterkste verlaging op het Luna-model viel.
Bezuinigingen stromen door elk serviceniveau
De kortingen zijn niet beperkt tot de hoofdprijzen. Ze doorlopen elke optie op de tariefkaart:
- Batch- en Flex-verwerking, beide de helft van de standaardprijs, brengen Luna op 10 cent input en 60 cent output per miljoen tokens.
- Invoergegevens in cache, korting van 90%, daling naar twee cent per miljoen tokens op Luna en 20 cent op Terra.
- Verzoeken met een lange context, gefactureerd tegen het dubbele van de inputsnelheid en 1,5 keer de output, komen terecht op 40 cent en $ 1,80 voor Luna.
Voor teams die al bulkclassificatie, extractie of lange agentlussen via de goedkopere niveaus routeren, kosten dezelfde oproepen nu een fractie van wat ze een dag eerder deden.
Hoe de bezuinigingen zich verhouden tot Anthropic
Met 20 cent erin en $ 1,20 uit, ondermijnt Luna nu het goedkoopste gepubliceerde model van Anthropic, Haiku 4.5, met ongeveer vijf keer wat betreft input en vier keer wat betreft output, volgens de prijspagina van Anthropic. Het nieuwe tarief van Terra ligt onder de $ 3 en $ 15 die Claude Sonnet 5 volgens plan in rekening zal brengen zodra de introductieprijzen op 31 augustus 2026 vervallen.
Aan de top van beide line-ups kost Sol nog steeds meer aan output dan Anthropic's Opus 5, die geprijsd is op $ 5 en $ 25.
Prioritaire verwerking wordt snelle modus
Dezelfde changelog-invoer heeft "Priority Processing" stopgezet en vervangen door "Fast mode." Voor het vlaggenschip Sol-model zegt OpenAI dat de Fast-modus tot 2,5 keer de standaardsnelheid werkt tegen tweemaal de prijs, en dat de switch achterwaarts compatibel is - verzoeken die al zijn getagd voor prioriteit, worden naar de Fast-modus geleid zonder codewijziging.
De tarieven voor de snelle modus zijn $ 10 en $ 60 voor Sol, $ 4 en $ 24 voor Terra, en 40 cent en $ 2,40 voor Luna. Met name verkoopt Anthropic hetzelfde product onder dezelfde naam en dezelfde voorwaarden, en de twee tariefkaarten komen nu ook samen op basis van regio-vastgezette gevolgtrekkingen: OpenAI brengt een verhoging van 10% in rekening voor modellen die op of na 5 maart 2026 zijn uitgebracht wanneer een klant gegevensresidentie nodig heeft, terwijl Anthropic alleen voor de VS inferentie factureert tegen 1,1 keer het standaardtarief.
Waarom de goedkopere niveaus goedkoper werden
Een dag vóór de cut publiceerde OpenAI een technisch bericht waarin de optimalisaties van de inferentiestapel werden beschreven. Vijf leden van de technische staf van het bedrijf schreven dat Sol, draaiend in de Codex-coderingstool, de productie-GPU-kernels herschreef - werk OpenAI zegt dat de end-to-end servicekosten met 20% zijn verlaagd. Het model heeft ook zijn eigen conceptmodel voor speculatieve decodering opnieuw ontworpen voor honderden experimenten, een verandering die de efficiëntie van het genereren van tokens met meer dan 15% heeft verhoogd.
Dat zijn OpenAI's eigen cijfers voor zijn eigen stack, maar ze wijzen op dezelfde kostenplaats als de prijsverlagingen: het agentenharnas achter Codex en ChatGPT. OpenAI beperkt de uitvoer van de tool standaard tot 10.000 tokens en houdt de voor het model zichtbare geschiedenis alleen bij toevoegingen, zodat een agentlus die zijn instructies bij elke stap opnieuw verzendt, in de promptcache terechtkomt in plaats van de volledige invoertarieven te betalen. Het bedrijf sloot de functie af met de belofte om "verbeteringen onder de motorkap terug te geven aan onze gebruikers in de vorm van breder beschikbare, kostenefficiënte informatie." De tariefkaart volgde een dag later.
Cloudpartners en facturering
OpenAI merkte op dat kopers die verkeer via Amazon Bedrock routeren, worden gefactureerd door AWS, en dat deze tarieven kunnen verschillen van de eigen gepubliceerde kaart. Naarmate meer ondernemingen de toegang tot modellen centraliseren via één enkele cloudleverancier, zal de kloof tussen de directe prijzen van OpenAI en wat klanten daadwerkelijk via tussenpersonen betalen net zo belangrijk worden als de hoofdcijfers zelf.
Een markt die elk token telt
De bezuinigingen komen doordat kopers van bedrijven de gevolgtrekkingen nauwer dan ooit controleren. Eerder deze week documenteerde de rapportage hoe het tijdperk van ongeremde ‘tokenmaxxing’ – het verhogen van het volume zonder op de kosten te letten – aan het vervagen is nu de AI-rekeningen van bedrijven op grote platforms stijgen. Het besluit van OpenAI om de interne kostenbesparingen door te geven aan de klanten, in plaats van de marge te verzilveren, is een duidelijk signaal van waar het denkt dat de concurrentiestrijd nu wordt uitgevochten: niet aan de grens, waar Sol nog steeds premiumprijzen hanteert, maar op de goedkope, hoogvolumeniveaus waar het meeste productieverkeer feitelijk plaatsvindt.
Nu de prijs van Sol ongewijzigd is gebleven, blijft de live beslissing voor ontwikkelaars precies waar OpenAI het heeft neergezet sinds de lancering van de familie: welk niveau elk verzoek vereist. Het verschil is dat de kosten voor het verkeerd nemen van die beslissing zojuist dramatisch zijn gedaald.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →