OpenAI bracht GPT-6.1 Sol op 29 september uit en stopte GPT-6 Sol slechts zeven dagen na het debuut van dat model, volgens het onafhankelijke benchmarkingbedrijf Artificial Analysis. De ruil viel samen met de DevDay-ontwikkelaarsconferentie van het bedrijf, waar CNET meldde dat deelnemers GPT-6.1 Sol onmiddellijk konden gaan gebruiken naast de nieuw gelanceerde Dots-agents en een reeks abonnementswijzigingen.

Een zevendaagse vervanging van vlaggenschip naar vlaggenschip is ongebruikelijk, zelfs volgens de versnelde normen van 2026, en de benchmarks suggereren waarom OpenAI zo snel handelde. Voor voortdurende berichtgeving over modellanceringen, benchmarkgevechten en de prijzenoorlog die daaronder schuilt, volgt [AI Buzz Wire] (https://aibuzzwire.news) de ontwikkelingen die ertoe doen zodra ze zich voordoen.

Een meetbare sprong in zeven dagen

Artificial Analysis meldt dat GPT-6.1 Sol 4 punten behaalt op de Intelligence Index van het bedrijf ten opzichte van GPT-6 Sol, en 5 punten ten opzichte van GPT-5.6 Sol, en slechts 1 punt onder GPT-6 Astra, het meest capabele model van OpenAI, belandt. De evaluatie van het bedrijf combineert redeneren, kenniswerk, wiskunde en agentische taken tot één enkele vergelijkende score.

De subscores laten zien waar de winst zich concentreert. GPT-6.1 Sol verbeterde 4 punten in AA-Briefcase v1.1 en 5 punten in GDPval-AA v2.1, die beide de kennis van agenten testen. Een sprong van 12 punten in Terminal-Bench 4.0 wijst op aanzienlijk betere prestaties in echte terminalomgevingen, terwijl Humanity's Last Exam met 5 punten steeg en GDP.pdf met 6 punten.

Eén getal valt op voor iedereen die modellen gebruikt voor onderzoek: de nauwkeurigheid van AA-Alwetenschap steeg met 8 punten, terwijl het hallucinatiepercentage daalde van 60 procent naar 54 procent. Beide cijfers blijven in absolute termen hoog, maar de reisrichting is van belang voor workflows waarbij een zelfverzekerd fout antwoord erger is dan geen antwoord.

Dezelfde stickerprijs, goedkoper in de praktijk

Wat de prijs betreft, behoudt GPT-6.1 Sol de tariefkaart van GPT-6 Sol van $2 per miljoen inputtokens en $10 per miljoen outputtokens, maar de cache-leeskorting stijgt van 90 procent naar 95 procent. Artificial Analysis merkt op dat de gemengde prijs van GPT-6.1 Sol voor agentische werklasten daarom iets lager is dan die van GPT-6 Sol, waarmee een reeks effectieve prijsverlagingen wordt voortgezet die begon toen GPT-6 Sol werd gelanceerd met een korting van 50 procent op GPT-5.6 Sol.

Het prijstraject is hier het echte verhaal. Binnen een tijdsbestek van twee releases heeft OpenAI de effectieve kosten van zijn middensegment twee keer grofweg gehalveerd, terwijl de kwaliteit elke keer weer omhoog gaat.

Kosten per taak: $ 0,72 versus $ 3,26

De kosten per taak zijn waar de kloof met GPT-6 Astra groot wordt. Bij maximale inspanning pint Artificial Analysis GPT-6.1 Sol op $0,72 per Intelligence Index-taak, minder dan een kwart van de $3,26 van GPT-6 Astra. Ten opzichte van zijn eigen voorganger bedragen de besparingen 31 procent ($1,05 voor GPT-6 Sol), en tegen GPT-5.6 Sol bereiken ze 64 procent ($1,99).

Volgens het bedrijf verlegt elk inspanningsniveau van GPT-6.1 Sol de Pareto-grens op het gebied van kostenefficiëntie – wat betekent dat er voor een bepaald niveau van intelligentie geen goedkopere optie bestaat tussen de modellen die het volgt. Het beeld van de token-efficiëntie is gemengder: GPT-6.1 Sol verbruikt grofweg 10 tot 30 procent meer outputtokens dan GPT-6 Sol op alle inspanningsniveaus, hoewel de instellingen voor lage en gemiddelde inspanning Pareto-optimaal blijven voor token-efficiëntie zodra de hogere intelligentie wordt meegerekend. Bij het coderen behaalde het model 3 punten ten opzichte van GPT-6 Sol bij maximale inspanning op de Coding Agent Index van het bedrijf.

Waarom de zevendaagse ommekeer ertoe doet

De bredere lei van DevDay versterkt hetzelfde beeld. Het rapport van CNET omlijstte de conferentie rond drie dingen die ontwikkelaars meteen konden gebruiken – GPT-6.1 Sol, de Dots-agents en herwerkte abonnementen – in plaats van een vooruitblik op onderzoek op afstand. De boodschap aan ontwikkelaars was vandaag de beschikbaarheid, en niet de mogelijkheid morgen.

Vlaggenschip is dit korte signaal dat de concurrentiedruk is verschoven van trainingsruns naar verfijning na de training en het bedienen van de infrastructuur. Een upgrade op puntniveau die binnen een week wordt verzonden, lijkt meer op een geoptimaliseerd controlepunt en een nieuw prijsoverzicht dan op een nieuw basismodel, en rivalen gedragen zich op dezelfde manier: Google kondigde op 30 september Gemini 4 Argon aan, een grensmodel dat aanvankelijk vertrouwde cyberverdedigers bereikt via zijn Fairwind-programma tegen hetzelfde tokentarief van $ 2/$ 10 per miljoen.

Voor ontwikkelaars volgen uit de geverifieerde cijfers drie praktische lessen. Ten eerste profiteren agentische workloads met intensief hergebruik van caches onmiddellijk van de cachekorting van 95 procent. Ten tweede moeten budgetten het hogere verbruik van tokens modelleren voordat ze migreren, omdat de prijs per token onveranderd blijft, zelfs als het model langer nadenkt. Ten derde blijft Astra het plafond voor taken waarbij het laatste punt van intelligentie een viervoudige kostenpremie waard is. Volgens GPT-6.1 Sol is dit voor het meeste werk niet het geval.

Het voorbehoud is het herhalen waard: deze cijfers zijn afkomstig van één enkele onafhankelijke beoordelaar, hoe rigoureus de methodologie ook is, en indexscores belonen specifieke werklastmixen. Teams met veeleisende werklasten moeten hun eigen evaluaties opnieuw uitvoeren voordat ze het productieverkeer omleiden.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →