OpenAI сопротивляется после того, как Claude Opus 5 от Anthropic доминировал в тесте ARC-AGI-3, публикуя результаты, которые показывают, что его собственная модель GPT-5.6 Sol набрала 38,3 процента — при условии, что вы используете предпочтительные настройки OpenAI, а не официальное тестовое оборудование.
Спор, развернувшийся 30 июля 2026 года, затрагивает суть растущей проблемы в оценке ИИ: тесты больше не измеряют просто модель, а весь технический каркас, окружающий ее. Для более глубокого анализа последних разработок в области искусственного интеллекта и выпусков моделей AI Buzz Wire отслеживает историю.
Числа и подвох
OpenAI сообщила, что GPT-5.6 Sol достигает 38,3 процента по ARC-AGI-3, опередив Claude Opus 5 от Anthropic, который набрал 30,2 процента после того, как ранее в четыре раза превысил рекорд теста. Предостережение является существенным: эта цифра в 38,3 процента зависит от двух конкретных особенностей OpenAI Responses API.
Первый — это Сохраненное рассуждение, которое сохраняет цепочку мыслей модели между шагами, а не отбрасывает ее после каждого действия. Второй вариант — Сжатие, который суммирует старый контекст, а не усекает его, что позволяет модели продолжать работу над длинными задачами, не теряя при этом более ранние рассуждения.
Пройдя через официальный стандартизированный пакет ARC Prize, который намеренно избегает настроек, специфичных для поставщика, чтобы обеспечить сравнение яблок с яблоками, GPT-5.6 Sol набрал всего 7,8 процента. Причина, как утверждает OpenAI, заключается в том, что официальная установка отбрасывает рассуждения модели после каждого шага, снижая производительность при выполнении задач, требующих устойчивого многоэтапного мышления.
Эталон чистоты
ARC-AGI-3 был разработан Франсуа Шолле и командой ARC Prize, чтобы проверить способность модели решать новые логические головоломки, с которыми она никогда раньше не сталкивалась — это проверка общего интеллекта, а не заученных знаний. Чтобы сравнение было справедливым, официальная программа намеренно исключает функции, специфичные для поставщика, и измеряет возможности необработанной модели в нейтральной среде.
Контраргумент OpenAI заключается в том, что эта нейтральность может стать помехой. Компания утверждает, что официальная система опиралась на более старый «API завершения в стиле OpenAI», которому не хватало возможностей, которые уже предлагал Claude API, что фактически ставило OpenAI в структурное невыгодное положение по сравнению с Anthropic в исходном сравнении.
По сути, OpenAI говорит: вы измерили нашу модель, заложив одну руку за спину.
Ответ Шолле
Соучредитель ARC Prize Франсуа Шолле в ответ провел четкую грань между двумя типами тестовых установок. По его словам, средства, «созданные специально для решения тестов или содержащие информацию о формате тестов», запрещены. Но настройки API общего назначения, «которые не были разработаны для ARC-AGI-3 и доступны всем пользователям API», являются честной игрой.
По сути, Шолле признал, что собственная оценка ARC Prize GPT-5.6 Sol ставит OpenAI в невыгодное положение. Он отметил, что организация «много обсуждала с OpenAI вопрос о том, как лучше всего тестировать их модели, особенно в отношении уплотнения», и приветствовал, что компания «начинает искать ответ».
Шолле отметил еще одно беспокойство. Разные провайдеры, использующие разные настройки, создают то, что он назвал «потенциальной проблемой паритета», но он считает это приемлемым, «при условии, что настройки и стоимость четко указаны».
Почему это важно за пределами таблицы лидеров
Этот эпизод подчеркивает напряженность, которая меняет то, как индустрия искусственного интеллекта оценивает прогресс. Поскольку модели все чаще развертываются с помощью многофункциональных API, а не как отдельные системы, грань между присущими модели возможностями и инженерными решениями вокруг нее продолжает стираться. Тест, игнорирующий строительные леса, может занизить реальную производительность; тот, кто его примет, может вознаградить компании за то, что они прошли тест.
Дебаты по ARC-AGI-3 вряд ли будут последними. По мере того, как передовые модели группируются в верхней части установленных эталонов, разногласия по поводу того, что считать справедливым измерением и чье оборудование будет устанавливать стандарт, будут только усиливаться.
Будьте впереди ИИ
Хотите следить за последними новостями об искусственном интеллекте о моделях, тестах и лабораториях, их создающих? AI Buzz Wire поможет вам.
Читать больше новостей об искусственном интеллекте