Исследователи Nvidia создали систему агентов, которая позволила Claude Opus 5 от Anthropic получить идеальный результат в 100 % в ARC-AGI-3, одном из самых требовательных тестов интерактивного мышления в области искусственного интеллекта, — используя ту же самую модель, которая набирает 30 %, когда работает сама по себе. Результат, опубликованный в пятницу в техническом блоге Nvidia, является убедительным доказательством того, что программное обеспечение, созданное для передовой модели, имеет такое же значение, как и сама модель. Для тех, кто следит за [последними разработками в области ИИ] (https://aibuzzwire.news), это знаменует собой сдвиг в том, где на самом деле находится конкурентное преимущество в агентном ИИ.

Система называется AVO, сокращение от Agentic Variation Operations, и это подход Nvidia к универсальной архитектуре для автономных агентов с большим горизонтом действия — ИИ, который может выполнять задачу часами или днями вместо того, чтобы отвечать на единственную подсказку. В общедоступном наборе ARC-AGI-3 AVO зафиксировала оценку RHAE 100,00 во всех 25 игровых средах, пройдя все 183 уровня в 6624 действиях среды, используя Claude Opus 5 в качестве внутренней модели.

Что на самом деле тестирует ARC-AGI-3

ARC-AGI-3 — это интерактивный тест на рассуждение, созданный фондом ARC Prize. Агент попадает в незнакомую игровую среду без каких-либо инструкций, каких-либо установленных правил и какой-либо поставленной цели. Ему приходится исследовать методом проб и ошибок, делать выводы о том, как работает окружающая среда, выяснять, что означает «победа», а затем действовать достаточно эффективно, чтобы продвигаться через все более сложные уровни.

Показатель оценки эталонного теста, относительная эффективность действий человека (RHAE), сочетает в себе выполнение задачи с тем, как мало действий агент тратит впустую по сравнению с людьми, играющими впервые. Это делает его жестоким испытанием на устойчивую автономию: агент должен помнить то, чему он научился, восстанавливаться после ошибок и тщательно планировать свои действия на протяжении всего запуска.

Заголовок Nvidia приобретает контекст благодаря сравнению. VISTA, предыдущая система прямого взаимодействия, в которой также использовался Claude Opus 5, прошла те же 183 общедоступных уровня в 7542 действиях с окружающей средой. Согласно сообщению в блоге Nvidia, AVO потребовалось примерно на 12% меньше действий для завершения работы.

От ядер графического процессора к неизвестным играм

AVO не был создан для головоломок. Nvidia впервые продемонстрировала архитектуру оптимизации ядра графического процессора — области, в которой небольшие изменения кода могут непредсказуемым образом нарушить корректность, поведение памяти и пропускную способность. В одном исследовании ядра внимания AVO работал непрерывно в течение семи дней, исследовал более 500 направлений оптимизации и зафиксировал 40 версий ядра. В системах NVIDIA DGX B200 полученные многоголовочные ядра превзошли cuDNN до 3,5% и FlashAttention-4 до 10,5%. Затем агент адаптировал свое развитое ядро ​​для групповых запросов примерно за 30 минут дополнительной автономной работы.

Тот же основной цикл — проверка, планирование, реализация, тестирование, оценка — был затем использован в ARC-AGI-3, с изменением только интерфейса задачи. Два механизма перенесены. Первый — это постоянная память, в которой хранятся предыдущие реализации, результаты оценки, выходные данные компилятора и профилировщика, а также накопленные рассуждения, поэтому агент может возобновить работу из текущего состояния, а не перестраивать контекст с нуля. Второй — это супервайзер, второй агент, который наблюдает за общей траекторией и вмешивается, когда прогресс останавливается.

Супервизор — это прорыв

TechCrunch, который взял интервью у Аделя Эль Халлака из Nvidia, вице-президента по продуктам подразделения искусственного интеллекта компании, выделил руководителя как наиболее важный компонент. «Это похоже на то, как генеральный директор подталкивает агента, когда он сбивается с направления или начинает исследовать путь, который может привести в тупик, или повторно исследовать путь, по которому он шел ранее», — сказал изданию Эль Халлак.

Разрыв в производительности очевиден. Тестирование Nvidia показало, что Claude Opus 5 без сложного оборудования набрал 30% баллов по ARC-AGI-3 — лучший результат среди протестированных голых моделей, но далеко не полный. Модели OpenAI набрали менее 10% в тесте, и в прошлом месяце компания опубликовала собственное исследование, показывающее, что настройка всего двух настроек проводки утроила ее баллы. Ни одна модельная конфигурация не приблизилась к 100%, достигнутому AVO.

Примечательно, что конфигурация AVO работала только в текстовом режиме: каждое наблюдение предоставлялось в виде точной текстовой сетки размером 64x64, без отправки в модель изображений или токенов изображений. Сила рассуждений исходила из цикла вокруг модели, а не из мультимодального восприятия.

Почему отрасль делает ставку на ремни безопасности

Это открытие появилось на фоне волны доказательств того, что узким местом для автономного ИИ в настоящее время является агентская инфраструктура, а не возможности сырой модели. В июле компания Databricks опубликовала сравнительное исследование, показывающее, что эта система существенно влияет как на производительность, так и на стоимость. «Вы можете выбрать одну и ту же модель, но с разными ремнями безопасности, и вы получите значительно больше затрат, если используете неправильный ремень безопасности», — сказал TechCrunch генеральный директор Databricks Али Годси. «Это само по себе может увеличить ваши затраты в 2 раза».

Эль Халлак сформулировал более широкую аргументацию Nvidia с точки зрения открытости. «Мы считаем, что наличие открытого стека агентов, где вы можете контролировать все оборудование, инфраструктуру и среду выполнения, — это то, что нам необходимо для развития экосистемы и ее безопасности», — сказал он. Nvidia имеет технологии открытого размера под своим брендом NeMo, а исследование AVO описано в статье на arXiv.

Тест с историей

ARC-AGI-3 стал горячей точкой в соперничестве пограничных лабораторий. OpenAI ранее заявляла о высоких результатах своей модели GPT-5.6 Sol в тесте, обращая внимание на используемые настройки оценки. Результат Nvidia в каком-то смысле обходит эту дискуссию — она не претендует на более умную модель, а лишь на более хорошо спроектированный агент на базе существующей.

Послание для разработчиков и предприятий, создающих агентные продукты, прямое: выбор модели по-прежнему имеет значение, но теперь от проектирования системы зависит, обеспечит ли передовая модель передовые результаты. По словам Nvidia, оценка модели — это не то же самое, что оценка агента, и таблицы тестов 2026 года все больше вознаграждают инженеров, которые строят леса.

Будьте впереди ИИ

Архитектура агентов развивается быстрее, чем когда-либо, и разрыв между хорошим и плохим оборудованием теперь измеряется в контрольных точках и реальных долларах. Подписывайтесь на AI Buzz Wire, чтобы получать ежедневные, проверенные источники материалы об исследованиях, тестах и ​​выпусках продуктов в области искусственного интеллекта.

Читать больше новостей об исследованиях ИИ →