OpenAI відступає після того, як Claude Opus 5 від Anthropic домінував у тесті ARC-AGI-3, опублікувавши результати, які показують, що його власна модель GPT-5.6 Sol досягає 38,3 відсотка — за умови, що ви використовуєте бажані налаштування OpenAI, а не офіційний тестовий пакет.

Суперечка, яка розгорнулася 30 липня 2026 року, врізається в суть зростаючої проблеми в оцінці штучного інтелекту: еталонні показники більше не вимірюють лише модель, а весь технічний каркас, обернутий навколо неї. Для глибшого аналізу [останніх розробок штучного інтелекту] (https://aibuzzwire.news) і випусків моделей AI Buzz Wire стежить за цією історією.

Цифри та заковика

OpenAI повідомила, що GPT-5.6 Sol досягає 38,3 відсотка на ARC-AGI-3, обійшовши Claude Opus 5 від Anthropic, який набрав 30,2 відсотка після того, як раніше в чотири рази перевищив рекорд тесту. Важливе застереження: ця цифра в 38,3 відсотка залежить від двох особливостей OpenAI Responses API.

Перший — це Збережене міркування, яке зберігає ланцюжок думок моделі між кроками, а не відкидає його після кожної дії. Другий — Compaction, який узагальнює старий контекст замість його скорочення, що дозволяє моделі продовжувати працювати над довгими проблемами, не втрачаючи попередні міркування.

Пройшовши через офіційну стандартизовану систему ARC Prize, яка навмисно уникає налаштувань постачальника, щоб забезпечити порівняння між яблуками, GPT-5.6 Sol впорався лише на 7,8 відсотка. Причина, стверджує OpenAI, полягає в тому, що офіційні налаштування відкидають міркування моделі після кожного кроку, погіршуючи продуктивність у завданнях, які вимагають постійного багатоетапного мислення.

Тест, створений для чистоти

ARC-AGI-3 був розроблений Франсуа Шолле та командою ARC Prize, щоб перевірити здатність моделі вирішувати незвичайні головоломки, яких вона ніколи раніше не бачала — це тест загального інтелекту, а не завчених знань. Щоб порівняння були справедливими, офіційний пакет навмисно видаляє специфічні функції постачальника, вимірюючи можливості необробленої моделі в нейтральному середовищі.

Контраргумент OpenAI полягає в тому, що цей нейтралітет може стати недоліком. Компанія стверджує, що офіційний джгут ґрунтувався на старішому «API завершення у стилі OpenAI», якому бракувало можливостей, які вже пропонував Claude API, що фактично поставило OpenAI у структурний недолік порівняно з Anthropic у початковому порівнянні.

По суті, OpenAI каже: ви виміряли нашу модель з однією рукою, зв’язаною за спиною.

Відповідь Шолле

Співзасновник ARC Prize Франсуа Шолле відповів, провівши чітку межу між двома типами тестових установок. За його словами, джгути, «створені на замовлення для вирішення бенчмарку або які містять інформацію про формат бенчмарку», заборонені. Але налаштування API загального призначення, «які не були розроблені для ARC-AGI-3 і які доступні для всіх користувачів API», є чесною грою.

По суті, Шолле визнав, що оцінка ARC Prize GPT-5.6 Sol поставила OpenAI у невигідне становище. Він зазначив, що організація «багато спілкувалася з OpenAI про те, як найкраще тестувати свої моделі, особливо щодо ущільнення», і привітав компанію, яка «почала шукати відповідь».

Шолле звернув увагу на одну проблему. Різні провайдери, які використовують різні налаштування, створюють те, що він назвав «потенційною проблемою паритету», але він вважає це прийнятним, «якщо чітко вказано налаштування та вартість».

Чому це важливо за межами таблиці лідерів

Цей епізод підкреслює напругу, яка змінює те, як індустрія ШІ оцінює прогрес. Оскільки моделі все частіше розгортаються за допомогою багатофункціональних API, а не як автономні системи, межа між властивими можливостями моделі та розробкою навколо неї продовжує розмиватися. Еталонний тест, який ігнорує скелети, може занижувати продуктивність у реальному світі; той, який охоплює його, може винагородити компанії за те, що вони пройшли тест.

Дебати ARC-AGI-3 навряд чи будуть останніми. У міру того, як граничні моделі згруповуються біля вершини встановлених контрольних показників, розбіжності щодо того, що вважається справедливим вимірюванням — і чия система встановлює стандарт — лише посилюватимуться.

Будьте попереду ШІ

Хочете стежити за найновішими новинами штучного інтелекту про моделі, тести та лабораторії, які їх створюють? AI Buzz Wire допоможе вам.

Читати більше новин AI