Дослідники Nvidia створили агентну систему, яка підштовхнула Claude Opus 5 від Anthropic до ідеальних 100% результатів на ARC-AGI-3, одному з найвимогливіших тестів інтерактивного мислення в штучному інтелекті — використовуючи ту саму модель, яка набрала 30% результатів, коли вона працює самостійно. Результат, опублікований у п’ятницю в технічному блозі Nvidia, є найпереконливішим доказом того, що програмне забезпечення, обернуте навколо передової моделі, має таке ж значення, як і сама модель. Для тих, хто стежить за [останніми розробками штучного інтелекту] (https://aibuzzwire.news), це знаменує зміну того, де насправді живе конкурентна перевага агентського штучного інтелекту.
Система називається AVO, скорочення від Agentic Variation Operators, і Nvidia являє собою архітектуру загального призначення для автономних агентів з довгою перспективою — штучного інтелекту, який може виконувати завдання годинами або днями замість того, щоб відповідати на єдину підказку. У загальнодоступному наборі ARC-AGI-3 AVO зафіксувала 100,00 балів RHAE у всіх 25 ігрових середовищах, пройшовши всі 183 рівні в 6624 діях середовища, використовуючи Claude Opus 5 як базову модель.
Що насправді перевіряє ARC-AGI-3
ARC-AGI-3 — це інтерактивний тест міркування, створений фондом ARC Prize. Агент потрапляє в незнайоме середовище, схоже на гру, без інструкцій, правил і мети. Він має досліджувати шляхом проб і помилок, робити висновки, як працює середовище, з’ясовувати, що означає «перемога», а потім діяти достатньо ефективно, щоб прогресувати через дедалі складніші рівні.
Відносна ефективність людських дій (RHAE) тесту оцінки поєднує виконання завдань із тим, скільки дій агент витрачає даремно порівняно з гравцями, які вперше вступають у гру. Це робить його жорстоким випробуванням стійкої автономії: агент повинен запам’ятати те, що він навчився, оговтатися від помилок і ретельно планувати свої дії протягом усього циклу.
Заголовна цифра Nvidia отримує контекст із порівняння. VISTA, попередня система прямої взаємодії, яка також використовувала Claude Opus 5, завершила ті самі 183 загальнодоступні рівні в 7542 діях середовища. Відповідно до публікації в блозі Nvidia, AVO потрібно було приблизно на 12% менше дій, щоб завершити роботу.
Від ядер GPU до невідомих ігор
AVO створено не для головоломок. Nvidia вперше продемонструвала архітектуру оптимізації графічного ядра, домену, де невеликі зміни коду можуть порушити правильність, поведінку пам’яті та пропускну здатність непередбачуваним чином. В одному дослідженні ядра уваги AVO працював безперервно протягом семи днів, вивчив понад 500 напрямків оптимізації та зафіксував 40 версій ядра. У системах NVIDIA DGX B200 отримані багатоголові ядра уваги перевершили cuDNN на 3,5% і FlashAttention-4 на 10,5%. Потім агент адаптував своє вдосконалене ядро до уваги згрупованих запитів приблизно за 30 хвилин додаткової автономної роботи.
Той самий основний цикл — перевірка, планування, впровадження, тестування, оцінка — потім було вказано на ARC-AGI-3 зі зміненим лише інтерфейсом завдання. Перенесено два механізми. Перший — це постійна пам’ять, у якій зберігаються попередні реалізації, результати оцінки, результати компілятора та профайлера, а також накопичені міркування, тому агент може відновити свій поточний стан, а не перебудовувати контекст з нуля. Другий — супервізор, другий агент, який стежить за загальною траєкторією та втручається, коли прогрес зупиняється.
Керівник - це прорив
TechCrunch, який опитав Аделя Ель Халлака з Nvidia, віце-президента відділу штучного інтелекту компанії, виділив супервайзера як найважливіший інгредієнт. «Це діє майже як генеральний директор, коли він підштовхує агента, коли він збивається з напрямку або починає досліджувати шлях, який може завести в глухий кут, або заново досліджувати шлях, яким він йшов раніше», — сказав виданню Ель Халлак.
Розрив у продуктивності суттєвий. Тестування Nvidia показало, що Claude Opus 5 без складного джгута зміг отримати 30% балів за ARC-AGI-3 — найкращий результат серед тестованих моделей без використання, але далеко не повний результат. Моделі OpenAI набрали менше 10% результатів тестування, і минулого місяця компанія опублікувала власне дослідження, яке показало, що налаштування лише двох налаштувань джгута потроює її результати. Жодна модельна конфігурація не наблизилася до 100%, яких досягла AVO.
Примітно, що конфігурація AVO працювала лише в текстовому режимі: кожне спостереження надавалося як точна текстова сітка 64x64, без зображень або маркерів зображень, надісланих до моделі. Сила міркування походить від циклу навколо моделі, а не від мультимодального сприйняття.
Чому індустрія робить ставку на джгути
Цей висновок з’являється на тлі хвилі доказів того, що зараз вузьким місцем для автономного ШІ є агентська інфраструктура, а не можливості сирої моделі. У липні компанія Databricks опублікувала порівняльний аналіз, який показує, що джгут кардинально впливає як на продуктивність, так і на вартість. «Ви можете вибрати ту саму модель, але різні джгути, і ви отримаєте значно більше витрат, якщо використаєте неправильний джгут», — сказав TechCrunch генеральний директор Databricks Алі Годсі. «Це може вдвічі збільшити вашу вартість».
Ель Халлак сформулював ширший аргумент Nvidia з точки зору відкритості. «Ми віримо, що відкритий стек агентів — де ви маєте контроль над мережею, інфраструктурою, середою виконання — це те, що потрібно для нас, щоб просувати екосистему вперед і безпечно», — сказав він. Nvidia має відкриті частини технології джгута під своїм брендом NeMo, а дослідження AVO задокументовано в статті на arXiv.
Тест з історією
ARC-AGI-3 став точкою спалаху в суперництві передових лабораторій. Раніше OpenAI заявляв про високі результати для своєї моделі GPT-5.6 Sol на тесті, привертаючи увагу до використовуваних налаштувань оцінювання. Результат Nvidia обходить цю дискусію в одному сенсі — він не претендує на розумнішу модель, лише на краще розроблений агент навколо існуючої.
Повідомлення розробникам і підприємствам, що створюють агентські продукти, є прямим: вибір моделі все ще має значення, але дизайн системи тепер вирішує, чи забезпечує гранична модель передові результати. Як стверджує Nvidia, оцінка моделі — це не те ж саме, що оцінка агента — і порівняльні таблиці 2026 року все більше винагороджують інженерів, які будують риштування.
Будьте попереду ШІ
Архітектури агентів розвиваються швидше, ніж будь-коли, і розрив між хорошим і поганим тепер вимірюється в контрольних балах і реальних доларах. Слідкуйте за новинами AI Buzz Wire, щоб щоденно перевіряти висвітлення досліджень штучного інтелекту, контрольних тестів і випусків продуктів.
Читати більше новин про дослідження ШІ →