OpenAI släppte GPT-6.1 Sol den 29 september och avvecklade GPT-6 Sol bara sju dagar efter den modellens debut, enligt det oberoende benchmarkingföretaget Artificial Analysis. Bytet sammanföll med företagets DevDay utvecklarkonferens, där CNET rapporterade att deltagare kunde börja använda GPT-6.1 Sol omedelbart tillsammans med de nyligen lanserade Dots-agenterna och en uppsättning prenumerationsändringar.
En sju dagar lång flaggskepp-till-flaggskeppsersättning är ovanlig även med de accelererade standarderna från 2026, och riktmärkena antyder varför OpenAI gick snabbt. För kontinuerlig täckning av modelllanseringar, benchmark-strider och priskriget bakom dem, spårar AI Buzz Wire utvecklingen som betyder något när de händer.
Ett mätbart hopp på sju dagar
Artificiell analys rapporterar att GPT-6.1 Sol vinner 4 poäng på företagets Intelligence Index över GPT-6 Sol och 5 poäng över GPT-5.6 Sol, och landar bara 1 poäng under GPT-6 Astra, OpenAI:s mest kapabla modell. Företagets utvärdering blandar resonemang, kunskapsarbete, matematik och agentuppgifter till en enda jämförande poäng.
Delpoängen visar var vinsterna koncentreras. GPT-6.1 Sol förbättrade 4 poäng i AA-Briefcase v1.1 och 5 poäng i GDPval-AA v2.1, som båda testar agentkunskaper. Ett hopp på 12 poäng i Terminal-Bench 4.0 pekar på väsentligt bättre prestanda i riktiga terminalmiljöer, medan Humanity's Last Exam steg 5 poäng och GDP.pdf steg med 6.
En siffra sticker ut för alla som använder modeller för forskning: noggrannheten på AA-Omniscience klättrade med 8 poäng medan hallucinationsfrekvensen sjönk från 60 procent till 54 procent. Båda siffrorna är fortfarande höga i absoluta tal, men färdriktningen har betydelse för arbetsflöden där ett säkert fel svar är värre än inget svar.
Samma klistermärkespris, billigare i praktiken
När det gäller prissättning behåller GPT-6.1 Sol GPT-6 Sols priskort på $2 per miljon inmatade tokens och $10 per miljon output tokens, men cache-läsrabatten stiger från 90 procent till 95 procent. Artificiell analys noterar att GPT-6.1 Sols blandade pris för agentarbetsbelastningar därför är något lägre än GPT-6 Sols, vilket förlänger en rad effektiva prissänkningar som började när GPT-6 Sol lanserades med 50 procent rabatt på GPT-5.6 Sol.
Prissättningsbanan är den verkliga historien här. Inom loppet av två utgåvor har OpenAI ungefär halverat den effektiva kostnaden för sin mid-tier frontier line två gånger, samtidigt som kvaliteten skjutits uppåt varje gång.
Kostnad per uppgift: 0,72 USD mot 3,26 USD
Kostnad per uppgift är där gapet med GPT-6 Astra blir stort. Vid maximal ansträngning fastställer artificiell analys GPT-6.1 Sol till $0,72 per uppgift i Intelligence Index, mindre än en fjärdedel av GPT-6 Astras $3,26. Mot sin egen föregångare är besparingarna 31 procent (1,05 USD för GPT-6 Sol), och mot GPT-5.6 Sol når de 64 procent (1,99 USD).
Enligt företaget skjuter varje ansträngningsnivå av GPT-6.1 Sol ut Pareto-gränsen för kostnadseffektivitet – vilket innebär att det för en given intelligensnivå inte finns något billigare alternativ bland de modeller som den spårar. Bilden av token-effektivitet är mer blandad: GPT-6.1 Sol förbrukar ungefär 10 till 30 procent mer output-tokens än GPT-6 Sol över ansträngningsnivåer, även om dess låga och medelhöga ansträngningsinställningar förblir Pareto-optimala för tokeneffektivitet när den högre intelligensen har tagits med i beräkningen. I kodningen fick modellen 3 poäng över GPT-Agentens index för Gmax-ansträngning Com Index.
Varför den sju dagar långa vändningen är viktig
DevDays bredare skiffer förstärker samma bild. CNET:s rapport ramade in konferensen kring tre saker som utvecklare skulle kunna använda direkt - GPT-6.1 Sol, Dots-agenterna och omarbetade prenumerationsplaner - snarare än en avlägsen forskningsförhandsvisning. Budskapet till utvecklarna var tillgänglighet idag, inte möjlighet imorgon.
Flaggskeppet visar denna korta signal om att konkurrenstrycket har skiftat från träningskörningar till förfining efter träning och betjäningsinfrastruktur. En uppgradering på punktnivå som skickas om en vecka ser mer ut som en optimerad checkpoint och ett nytt prisblad än en grundmodell från början, och rivaler beter sig på samma sätt: Google tillkännagav Gemini 4 Argon den 30 september, en gränsmodell som initialt når betrodda cyberförsvarare genom sitt Fairwind-program med samma ränta på $2/$10.
För utvecklare följer tre praktiska takeaways från de verifierade siffrorna. För det första drar agentiska arbetsbelastningar med tung cacheåteranvändning omedelbart nytta av cachemabatten på 95 procent. För det andra bör budgetar modellera den högre output-tokenförbrukningen innan de migreras, eftersom priset per token är oförändrat även om modellen tänker längre. För det tredje är Astra fortfarande taket för uppgifter där den sista informationspunkten är värd en 4x kostnadspremie – GPT-6.1 Sols fall är att det inte är det för de flesta arbeten.
Förbehållet som är värt att upprepa: dessa siffror kommer från en enda oberoende utvärderare, hur rigorös metodiken än är, och indexpoäng belönar specifika arbetsbelastningsmixar. Team med krävande arbetsbelastningar bör köra om sina egna utvärderingar innan de omdirigerar produktionstrafik.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →