OpenAI wycofuje się po tym, jak Claude Opus 5 firmy Anthropic zdominował benchmark ARC-AGI-3, publikując wyniki, które pokazują, że jego własny model GPT-5.6 Sol osiągnął 38,3% – pod warunkiem, że użyjesz preferowanych ustawień OpenAI, a nie oficjalnego zestawu testowego.

Spór, który rozegrał się 30 lipca 2026 r., dotyka sedna narastającego problemu w ocenie sztucznej inteligencji: testy porównawcze nie mierzą już tylko modelu, ale całego rusztowania technicznego wokół niego. Aby uzyskać głębszą analizę najnowszych osiągnięć AI i wydań modeli, AI Buzz Wire śledzi tę historię.

Liczby i haczyk

OpenAI poinformowało, że GPT-5.6 Sol osiąga 38,3% w teście ARC-AGI-3, wyprzedzając Claude Opus 5 firmy Anthropic, który uzyskał 30,2% po wcześniejszym czterokrotności rekordu benchmarku. Zastrzeżenie jest istotne: liczba 38,3 procent zależy od dwóch konkretnych funkcji interfejsu API OpenAI Responses.

Pierwsza to Zachowane rozumowanie, które zachowuje łańcuch myślowy modelu pomiędzy krokami, zamiast odrzucać go po każdym działaniu. Drugie to Zagęszczanie, które podsumowuje starszy kontekst zamiast go obcinać, umożliwiając modelowi dalszą pracę nad długimi problemami bez utraty wcześniejszego rozumowania.

Po przeprowadzeniu oficjalnej, standaryzowanej uprzęży ARC Prize, która celowo unika ustawień specyficznych dla dostawcy, aby zapewnić porównanie jabłek z jabłkami, GPT-5.6 Sol uzyskał zaledwie 7,8 procent. Powodem, według OpenAI, jest to, że oficjalna konfiguracja odrzuca rozumowanie modelu po każdym kroku, pogarszając wydajność zadań wymagających ciągłego, wieloetapowego myślenia.

Punkt odniesienia stworzony z myślą o czystości

ARC-AGI-3 został zaprojektowany przez François Cholleta i zespół przyznający nagrodę ARC w celu zbadania zdolności modelu do rozwiązywania nowatorskich zagadek rozumowania, jakiego nigdy wcześniej nie widział – jest to test ogólnej inteligencji, a nie wiedzy zapamiętanej. Aby porównania były uczciwe, oficjalna uprząż celowo usuwa funkcje specyficzne dla dostawcy, mierząc możliwości surowego modelu w neutralnym środowisku.

Kontrargumentem OpenAI jest to, że ta neutralność może stać się przeszkodą. Firma twierdzi, że oficjalne oprogramowanie opierało się na starszym „interfejsie API uzupełniania w stylu OpenAI”, któremu brakowało możliwości oferowanych przez interfejs API Claude, co w pierwotnym porównaniu skutecznie stawiało OpenAI w niekorzystnej sytuacji strukturalnej w porównaniu z Anthropic.

W istocie OpenAI mówi: zmierzyłeś nasz model z jedną ręką związaną z tyłu.

Odpowiedź Cholleta

Współzałożyciel nagrody ARC, François Chollet, w odpowiedzi narysował wyraźną granicę między dwoma rodzajami konfiguracji testowych. Uprzęże „wykonane na zamówienie w celu rozwiązania testu porównawczego lub zawierające wiedzę na temat formatu testu porównawczego” są zabronione, powiedział. Jednak ustawienia API ogólnego przeznaczenia, „które nie zostały opracowane dla ARC-AGI-3 i które są dostępne dla wszystkich użytkowników API”, są uczciwą grą.

W efekcie Chollet przyznał, że własny wynik ARC Prize GPT-5.6 Sol stawia OpenAI w niekorzystnej sytuacji. Zauważył, że organizacja „dużo rozmawiała z OpenAI na temat tego, jak najlepiej testować swoje modele, szczególnie pod kątem zagęszczania” i z zadowoleniem przyjął, że firma „zaczyna znajdować odpowiedź”.

Chollet zasygnalizował jedną pozostałą obawę. Różni dostawcy korzystający z różnych ustawień stwarzają, jak to określił, „potencjalny problem z parytetem”, ale uważa to za akceptowalne, „o ile ustawienia i koszty są wyraźnie podane”.

Dlaczego to ma znaczenie poza tabelą wyników

Odcinek podkreśla napięcie, które zmienia sposób, w jaki branża sztucznej inteligencji ocenia postęp. Ponieważ modele są coraz częściej wdrażane za pośrednictwem bogatych w funkcje interfejsów API, a nie jako samodzielne systemy, granica między nieodłącznymi możliwościami modelu a otaczającą go inżynierią stale się zaciera. Benchmark, który ignoruje rusztowanie, może zaniżać wydajność w świecie rzeczywistym; taki, który go uwzględni, może nagradzać firmy za przetestowanie testu.

Debata ARC-AGI-3 prawdopodobnie nie będzie ostatnią. W miarę jak pionierskie modele skupiają się w pobliżu szczytów ustalonych punktów odniesienia, nieporozumienia dotyczące tego, co uznaje się za rzetelny pomiar i czyja wiązka wyznacza standardy, będą się tylko nasilać.

Wyprzedź sztuczną inteligencję

Chcesz śledzić najnowsze wiadomości o sztucznej inteligencji na temat modeli, testów porównawczych i laboratoriów je tworzących? AI Buzz Wire zapewni Ci wsparcie.

Przeczytaj więcej aktualności na temat sztucznej inteligencji