OpenAI trycker tillbaka efter att Anthropics Claude Opus 5 dominerade ARC-AGI-3 benchmark, och publicerade resultat som visar att dess egen GPT-5.6 Sol-modell når 38,3 procent – förutsatt att du använder OpenAI:s föredragna inställningar snarare än den officiella testselen.
Tvisten, som utspelade sig den 30 juli 2026, skär till kärnan i ett växande problem i AI-utvärdering: riktmärken mäter inte längre bara en modell, utan hela den tekniska ställningen som är lindad runt den. För djupare analys av den senaste AI-utvecklingen och modellsläpp, spårar AI Buzz Wire historien.
Siffrorna och fångsten
OpenAI rapporterade att GPT-5.6 Sol når 38,3 procent på ARC-AGI-3, och går förbi Anthropics Claude Opus 5, som fick 30,2 procent efter att tidigare ha fyrdubblat riktmärkets rekord. Förbehållet är betydande: den siffran på 38,3 procent beror på två specifika funktioner i OpenAI:s Responses API.
Den första är Retained Reasoning, som bevarar modellens tankekedja mellan stegen snarare än att kassera den efter varje åtgärd. Den andra är Compaction, som sammanfattar äldre sammanhang istället för att trunkera det, vilket gör att modellen kan fortsätta arbeta med långa problem utan att förlora tidigare resonemang.
Kör igenom ARC Prizes officiella standardiserade sele – som avsiktligt undviker leverantörsspecifika inställningar för att säkerställa jämförelser mellan äpplen och äpplen – GPT-5.6 Sol klarade bara 7,8 procent. Anledningen, hävdar OpenAI, är att den officiella installationen förkastar modellens resonemang efter varje steg, vilket försämrar prestanda för uppgifter som kräver uthålligt tänkande i flera steg.
Ett riktmärke byggt för renhet
ARC-AGI-3 designades av François Chollet och ARC Prize-teamet för att undersöka en modells förmåga att lösa nya resonemangspussel som den aldrig har sett förut - ett test av allmän intelligens snarare än memorerad kunskap. För att hålla jämförelser rättvisa tar den officiella selen medvetet bort leverantörsspecifika funktioner, och mäter rå modellkapacitet i en neutral miljö.
OpenAI:s motargument är att denna neutralitet kan bli ett handikapp. Företaget hävdar att den officiella selen förlitade sig på ett äldre "OpenAI-style completions API" som saknade funktioner som Claude API redan erbjöd, vilket i praktiken satte OpenAI i en strukturell nackdel i förhållande till Anthropic i den ursprungliga jämförelsen.
I huvudsak säger OpenAI: du mätte vår modell med en hand bunden bakom ryggen.
Chollets svar
ARC Prizes medgrundare François Chollet svarade genom att dra en tydlig gräns mellan två typer av testuppsättningar. Selar "skräddarsydda för att lösa benchmark eller som innehåller kunskap om benchmark format" är förbjudna, sa han. Men allmänna API-inställningar "som inte utvecklades för ARC-AGI-3 och som är tillgängliga för alla API-användare" är rättvist spel.
I själva verket medgav Chollet att ARC Prizes egna GPT-5.6 Sol-poäng satte OpenAI i underläge. Han noterade att organisationen har haft "mycket fram och tillbaka med OpenAI om hur man bäst testar sina modeller, särskilt när det gäller komprimering", och välkomnade att företaget "börjar ta reda på svaret."
Chollet flaggade en kvarstående oro. Olika leverantörer som använder olika inställningar skapar vad han kallade "ett potentiellt paritetsproblem" - men han anser att det är acceptabelt "så länge inställningarna och kostnaden är tydligt rapporterade."
Varför detta är viktigt bortom topplistan
Avsnittet understryker en spänning som omformar hur AI-industrin utvärderar framsteg. Eftersom modeller i allt högre grad distribueras genom funktionsrika API:er snarare än som fristående system, suddar gränsen mellan en modells inneboende förmåga och tekniken runt den hela tiden ut. Ett riktmärke som ignorerar byggnadsställningar kan underskatta verkliga prestanda; en som omfamnar det kan belöna företag för att spela testet.
ARC-AGI-3-debatten kommer sannolikt inte att bli den sista. När gränsmodeller samlas nära toppen av etablerade riktmärken, kommer oenighet om vad som räknas som en rättvis mätning - och vars sele får sätta standarden - bara att intensifieras.
Ligg före AI
Vill du följa de brytande AI-nyheterna om modeller, riktmärken och labbet som bygger dem? AI Buzz Wire har dig täckt.
Läs fler AI-nyheter