OpenAI se posouvá zpět poté, co Anthropic's Claude Opus 5 ovládl benchmark ARC-AGI-3 a zveřejnil výsledky, které ukazují, že jeho vlastní model GPT-5.6 Sol dosáhl 38,3 procenta – za předpokladu, že místo oficiálního testovacího svazku použijete preferovaná nastavení OpenAI.
Spor, který se odehrál 30. července 2026, zasahuje do jádra rostoucího problému v hodnocení umělé inteligence: benchmarky již neměří jen model, ale celé technické lešení, které se kolem něj ovine. Pro hlubší analýzu [nejnovějšího vývoje AI] (https://aibuzzwire.news) a vydání modelů sleduje AI Buzz Wire příběh.
Čísla a úlovek
OpenAI oznámila, že GPT-5.6 Sol dosahuje 38,3 procenta na ARC-AGI-3, čímž překonala Anthropic's Claude Opus 5, který dosáhl 30,2 procenta poté, co předtím čtyřnásobně překonal rekord benchmarku. Upozornění je významné: údaj o 38,3 procentech závisí na dvou specifických funkcích OpenAI Responses API.
Prvním je Retained Reasoning, který zachovává myšlenkový řetězec modelu mezi jednotlivými kroky, spíše než jej po každé akci zahazuje. Druhým je Zhutnění, které shrnuje starší kontext namísto jeho zkrácení, což modelu umožňuje pokračovat v práci na dlouhých problémech bez ztráty dřívějšího uvažování.
Proběhněte oficiální standardizovaný svazek ARC Prize – který se záměrně vyhýbá nastavení specifickým pro poskytovatele, aby zajistil srovnání jablek s jablky – GPT-5.6 Sol zvládl pouze 7,8 procenta. Důvodem, tvrdí OpenAI, je to, že oficiální nastavení zahazuje uvažování modelu po každém kroku, čímž snižuje výkon u úkolů, které vyžadují trvalé myšlení ve více krocích.
Benchmark vytvořený pro čistotu
ARC-AGI-3 byl navržen Françoisem Cholletem a týmem ARC Prize, aby prozkoumal schopnost modelu řešit nové logické hádanky, které nikdy předtím neviděl – test obecné inteligence spíše než znalostí zapamatovaných. Aby bylo srovnání spravedlivé, oficiální svazek záměrně odstraňuje funkce specifické pro poskytovatele a měří schopnost surového modelu v neutrálním prostředí.
Protiargument OpenAI je, že tato neutralita se může stát handicapem. Společnost tvrdí, že oficiální svazek se spoléhal na starší „rozhraní API pro dokončení ve stylu OpenAI“, které postrádalo možnosti, které již Claude API nabízelo, což v původním srovnání ve skutečnosti staví OpenAI do strukturální nevýhody oproti Anthropic.
OpenAI v podstatě říká: změřili jste náš model s jednou rukou svázanou za jeho zády.
Cholletova odpověď
Spoluzakladatel ARC Prize François Chollet reagoval tím, že nakreslil jasnou hranici mezi dvěma druhy testovacích nastavení. Postroje „šité na míru pro řešení benchmarku nebo obsahující znalosti o formátu benchmarku“ jsou podle něj mimo limit. Ale obecná nastavení API, „která nebyla vyvinuta pro ARC-AGI-3 a která jsou dostupná všem uživatelům API“, jsou férová hra.
Chollet ve skutečnosti připustil, že vlastní skóre GPT-5.6 Sol od ARC Prize znevýhodnilo OpenAI. Poznamenal, že organizace měla "hodně tam a zpět s OpenAI o tom, jak nejlépe otestovat své modely, zejména s ohledem na zhutňování", a uvítal, že společnost "začala zjišťovat odpověď."
Chollet označil jednu zbývající obavu. Různí poskytovatelé používající různá nastavení vytvářejí to, co nazval „potenciální problém s paritou“, ale považuje to za přijatelné, „pokud jsou nastavení a náklady jasně hlášeny“.
Proč na tom záleží mimo žebříček
Tato epizoda podtrhuje napětí, které mění způsob, jakým průmysl AI hodnotí pokrok. Vzhledem k tomu, že modely jsou stále častěji nasazovány prostřednictvím rozhraní API s bohatými funkcemi spíše než jako samostatné systémy, hranice mezi vlastní schopností modelu a inženýrstvím kolem něj se stále stírá. Benchmark, který ignoruje lešení, může podceňovat výkon v reálném světě; ten, který jej přijme, může odměnit společnosti za hraní testu.
Debata o ARC-AGI-3 pravděpodobně nebude poslední. S tím, jak se hraniční modely seskupují blízko vrcholu zavedených benchmarků, neshody ohledně toho, co se považuje za spravedlivé měření – a na základě čeho stanoví standard – se jen prohloubí.
Udržujte si náskok před AI
Chcete sledovat nejnovější zprávy o AI o modelech, benchmarcích a laboratořích, které je vytvářejí? AI Buzz Wire vás pokryje.
Přečtěte si další zprávy o AI