Согласно результатам, опубликованным в среду фондом ARC Prize Foundation, GPT-6 Astra от OpenAI опубликовала самые современные результаты ARC-AGI-3, эталона абстрактного мышления, предназначенного для измерения агентского интеллекта. Модель набрала 62,7% в тесте Semi-Private, установленном в стандартном пакете Foundation, и 99,9% при оценке с использованием адаптера провайдера, который сохраняет внутреннее состояние рассуждений модели между запросами.
Результаты были получены через день после того, как OpenAI начала поэтапное внедрение Astra, флагманской модели, которую компания назвала началом новой эры. Для читателей, пытающихся следить за тем, как меняются торговые показатели Frontier Labs, на странице [последние разработки в области искусственного интеллекта] (https://aibuzzwire.news) отслеживаются все основные релизы по мере их появления.
Две упряжи, два совершенно разных результата
Разрыв между двумя главными показателями Astra — самая важная деталь в отчете. ARC Prize оценивает агентов в разных вариантах, и каждый из них меняет то, что разрешено делать модели, в своем собственном контексте.
В стандартной конфигурации модель может переносить заметки, которые она хочет сохранить, во время работы в среде. При такой настройке Astra при максимальных усилиях по рассуждению набрала 62,7% при общей стоимости оценочного прогона в 26 098 долларов. С другой стороны, использование той же системы с отключенным рассуждением дало всего 35,2%, но стоило дороже — 49 791 доллар — потому что для достижения прогресса модели требовалось гораздо больше действий.
Использование адаптера поставщика более щедро: оно сохраняет непрозрачное состояние рассуждений модели между запросами и использует сжатие для более длительных разговоров, позволяя Astra повторно использовать предыдущую работу. В этом случае Astra набрала 99,9% при высоких усилиях по рассуждению за 18 817 долларов и 98,6% при максимальных усилиях за 17 332 доллара. Даже самый низкий уровень рассуждения достиг 96,7%.
Другими словами, разница между частичной оценкой и почти идеальной заключается не только в чистом потенциале — она заключается в том, какая часть рабочего состояния модели сохраняется между этапами.
Победить людей по эффективности действий
ARC-AGI-3 построен на новой абстрактной пошаговой игровой среде. Агенты должны исследовать мир без инструкций, делать выводы о том, как устроен мир, определять цели на основе скудных вознаграждений и планировать многоэтапные действия. Среды откалиброваны таким образом, чтобы люди могли решить 100% из них, что делает человеческую производительность базовым уровнем, по которому можно сравнивать эталонные показатели.
Astra не просто справилась с большинством уровней — она решила их эффективно. По данным ARC Prize, модель использовала меньше действий, чем средний протестированный человек на 96% уровней, превзойдя базовый уровень человека по эффективности действий во всем наборе.
Экономика сравнения очевидна. Участникам испытаний на людях платили 115 долларов за 90-минутную сессию плюс 5 долларов за завершенную игру, что составляло примерно 12,78 долларов за попытку игры. Полный оценочный запуск Astra стоит пятизначную сумму, в зависимости от конфигурации. Но ARC Prize отметила противоречивую особенность: более высокие усилия по рассуждению обычно обходятся дешевле, потому что Astra решает игры за меньшее количество действий, уменьшая общее количество вызовов моделей и сжигаемых жетонов за один прогон.
Модель, создающая собственный язык
Помимо оценок, ARC Prize подчеркнула качественное поведение, которое наблюдала команда. Astra последовательно превращала незнакомую среду в компактные символические модели мира, представляя игровую механику как логические правила и разрабатывая собственную специфичную для предметной области стенографию для отслеживания состояния и планирования действий.
Именно для исследования этого навыка и был разработан ARC-AGI-3. В то время как предыдущие поколения тестов проверяли плавность рассуждений над новыми шаблонами, третье поколение проверяет, может ли агент исследовать, моделировать, ставить цели и выполнять планы в средах, которые он никогда не видел — компоненты, которые ARC Prize перечисляет как исследование, моделирование, постановку целей, а также планирование и исполнение.
Фон эпохи AGI
Результаты тестов были получены на фоне максимальной риторики со стороны самой OpenAI. На пресс-брифинге перед запуском в четверг президент компании Грег Брокман заявил, что «небезосновательно чувствовать, что мы сейчас живем в эпоху AGI», однако не сделал официального заявления, согласно репортажу The New Stack о запуске. Он описал AGI как «концепцию миссии или духовную концепцию», а не как контрактный триггер.
Исследователь OpenAI Эйдан Кларк сказал, что Astra была крупнейшим обучающим запуском компании на сегодняшний день — первым, прошедшим предварительное обучение на более чем 100 000 графических процессорах на площадке Stargate в Техасе, — и первым выпуском OpenAI, в котором более ранние модели играли значительную роль в контроле за процессом обучения. Доступ остается поэтапным: развертывание начинается с корпоративных клиентов в программе Daybreak, с доступностью Plus, Pro, Business и Enterprise, а также доступом к API и AWS, обещанным в ближайшие дни.
Звездочка в счете
Осторожность необходима по нескольким направлениям. Производительность Astra ARC-AGI-3 во многом зависит от конфигурации жгутов, как показывают два заголовка, а специальные жгуты, сохраняющие состояние модели, постоянно становятся предметом разногласий в спорах о тестах производительности. В анализе запуска, проведенном New Stack, отмечается, что Astra «демонстрирует большие успехи в решении специализированных задач, но стоит дороже и явно не лидирует в пакете кодирования» — напоминание о том, что тесты агентных головоломок и повседневные коммерческие рабочие нагрузки измеряют разные вещи.
Сама премия ARC описывает это упражнение как измерение «остаточного разрыва» между нынешним ИИ и ОИИ, определяя ОИИ как способность приобретать любые навыки, которые может человек, так же эффективно, как человек. Почти идеальный результат при благоприятных условиях сам по себе не закрывает этот разрыв. А при цене от 17 000 до 50 000 долларов за одну оценку только лаборатории с хорошими ресурсами могут позволить себе провести тест в таком масштабе — хотя данные о затратах ARC Prize показывают, что более разумное обоснование может фактически сократить счет.
Почему это важно
Эффективность действий — это действительно новая ось сравнения. Модель, которая решает каждый уровень, но тратит на это тысячи вызовов, менее полезна — и более дорога — чем та, которая действует так, как это сделала Astra: сознательно исследует, сжимает то, что узнает, и действует на основе этого. Какой бы ни был вывод по поводу дебатов об AGI, данные премии ARC показывают, что пограничные агенты теперь сравнивают людей не только в том, могут ли они решать новые проблемы, но и в том, насколько экономически они их решают.
Будьте впереди ИИ
Каждый результат тестов, запуск модели и дебаты по безопасности отслеживаются по мере их появления — подробнее новости AI →
