Naukowcy z firmy Nvidia zbudowali system agentów, dzięki któremu Claude Opus 5 firmy Anthropic osiągnął doskonały wynik 100% w ARC-AGI-3, jednym z najbardziej wymagających testów porównawczych interaktywnego rozumowania w sztucznej inteligencji, używając tego samego modelu, który uzyskuje 30% punktów, gdy działa samodzielnie. Wyniki, opublikowane w piątek na blogu technicznym Nvidii, stanowią najmocniejszy jak dotąd dowód na to, że oprogramowanie oparte na pionierskim modelu ma równie duże znaczenie jak sam model. Dla każdego, kto śledzi najnowsze osiągnięcia w zakresie sztucznej inteligencji, oznacza to zmianę w tym, gdzie tak naprawdę kryje się przewaga konkurencyjna w agentycznej sztucznej inteligencji.

System nazywa się AVO, co jest skrótem od Agentic Variation Operators, i stanowi rozwinięcie przez Nvidię architektury ogólnego przeznaczenia dla autonomicznych agentów o długim horyzoncie czasowym – sztucznej inteligencji, która może wykonywać zadanie godzinami lub dniami, zamiast odpowiadać na pojedyncze monity. Na publicznym zestawie ARC-AGI-3 firma AVO odnotowała wynik 100,00 RHAE we wszystkich 25 środowiskach gier, ukończywszy wszystkie 183 poziomy w 6624 działaniach środowiskowych, używając Claude Opus 5 jako modelu zaplecza.

Co właściwie testuje ARC-AGI-3

ARC-AGI-3 to interaktywny test wnioskowania stworzony przez fundację ARC Prize. Agent zostaje wrzucony do nieznanego, przypominającego grę środowiska, bez instrukcji, bez ustalonych zasad i bez określonego celu. Musi badać metodą prób i błędów, wyciągać wnioski, jak działa środowisko, dowiedzieć się, co oznacza „zwycięstwo”, a następnie działać wystarczająco skutecznie, aby przejść przez coraz trudniejsze poziomy.

Wskaźnik punktacji testu porównawczego, względna efektywność ludzkich działań (RHAE), łączy wykonanie zadania z liczbą działań, które agent marnuje w porównaniu z graczami, którzy grają na ludziach po raz pierwszy. To sprawia, że ​​jest to brutalny test trwałej autonomii: agent musi pamiętać, czego się nauczył, naprawiać błędy i ostrożnie planować swoje działania na przestrzeni całego cyklu.

Numer nagłówka Nvidii zyskuje kontekst dzięki porównaniu. VISTA, poprzednia uprząż do bezpośredniej interakcji, która korzystała również z Claude Opus 5, ukończyła te same 183 poziomy publiczne w 7542 działaniach na rzecz ochrony środowiska. Z wpisu na blogu Nvidii wynika, że ​​AVO potrzebowało około 12% mniej działań, aby zakończyć zadanie.

Od jąder GPU do nieznanych gier

AVO nie zostało zbudowane z myślą o łamigłówkach. Nvidia jako pierwsza zademonstrowała architekturę optymalizacji jądra procesora graficznego – domeny, w której niewielkie zmiany w kodzie mogą w nieprzewidywalny sposób zakłócić poprawność, zachowanie pamięci i przepustowość. W jednym badaniu skupionym na jądrze AVO działało nieprzerwanie przez siedem dni, zbadało ponad 500 kierunków optymalizacji i zatwierdziło 40 wersji jądra. W systemach NVIDIA DGX B200 powstałe wielogłowicowe jądra uwagi przewyższały cuDNN nawet o 3,5% i FlashAttention-4 nawet o 10,5%. Następnie agent dostosował swoje rozwinięte jądro do obsługi zapytań grupowych w ciągu około 30 minut dodatkowej autonomicznej pracy.

Ta sama podstawowa pętla – inspekcja, planowanie, wdrażanie, testowanie, ocena – została następnie skierowana na ARC-AGI-3, ze zmienionym jedynie interfejsem zadań. Przeniesiono dwa mechanizmy. Pierwszą z nich jest pamięć trwała, w której przechowywane są wcześniejsze implementacje, wyniki ewaluacji, dane wyjściowe kompilatora i profilera oraz skumulowane rozumowanie, dzięki czemu agent może wznowić działanie od bieżącego stanu, zamiast odbudowywać kontekst od zera. Drugi to przełożony, drugi agent, który obserwuje ogólną trajektorię i interweniuje, gdy postęp się zatrzyma.

Przełożony to przełom

TechCrunch, który przeprowadził wywiad z Adelem El Hallakiem z Nvidii, wiceprezesem ds. produktu w dziale AI firmy, podkreślił, że najważniejszym składnikiem jest osoba nadzorująca. „To prawie jak dyrektor generalny, szturchać agenta, gdy zbacza z wyznaczonego kierunku lub zaczyna eksplorować ścieżkę, która może prowadzić do ślepego zaułka, albo ponownie badać ścieżkę, którą wcześniej kroczył” – powiedział El Hallak publikacji.

Różnica w wydajności jest wyraźna. Testy przeprowadzone przez firmę Nvidia wykazały, że Claude Opus 5 bez wyrafinowanej uprzęży uzyskał 30% wynik w teście ARC-AGI-3 — najlepszy wynik wśród testowanych samych modeli, ale nie osiągnął pełnego wyniku. Modele OpenAI uzyskały wynik poniżej 10% w teście porównawczym, a firma opublikowała w zeszłym miesiącu własne badanie pokazujące, że modyfikacja zaledwie dwóch ustawień uprzęży potroiła ten wynik. Żadna konfiguracja obejmująca tylko model nie była w stanie zbliżyć się do 100% wydajności osiągniętej przez firmę AVO.

Warto zauważyć, że konfiguracja AVO działała wyłącznie w trybie tekstowym: każda obserwacja została dostarczona w postaci dokładnej siatki tekstowej o wymiarach 64x64, bez żadnych obrazów ani tokenów obrazów wysyłanych do modelu. Siła rozumowania pochodziła z pętli wokół modelu, a nie z percepcji multimodalnej.

Dlaczego branża stawia na uprzęże

Odkrycie to wpisuje się w falę dowodów na to, że infrastruktura agentów, a nie możliwości surowego modelu, stanowi obecnie wąskie gardło dla autonomicznej sztucznej inteligencji. W lipcu firma Databricks opublikowała badania porównawcze, które wykazały, że uprząż dramatycznie wpływa zarówno na wydajność, jak i koszty. „Możesz wybrać ten sam model, ale różne uprzęże, a jeśli użyjesz niewłaściwej uprzęży, poniesiesz znacznie większe koszty” – powiedział TechCrunch, dyrektor generalny Databricks, Ali Ghodsi. „To samo w sobie może podwoić Twoje koszty”.

El Hallak sformułował szerszą argumentację Nvidii w kategoriach otwartości. „Wierzymy, że posiadanie otwartego stosu agentów — nad całą wiązką, infrastrukturą i środowiskiem wykonawczym — jest tym, czego potrzebujemy, abyśmy mogli bezpiecznie i bezpiecznie rozwijać ekosystem” – powiedział. Nvidia oferuje elementy technologii uprzęży o otwartych rozmiarach pod marką NeMo, a badania AVO udokumentowano w artykule na temat arXiv.

Punkt odniesienia z historią

ARC-AGI-3 stał się punktem zapalnym w rywalizacji laboratoriów granicznych. OpenAI poprzednio uzyskało dobre wyniki dla swojego modelu GPT-5.6 Sol w teście porównawczym, szczegółowo analizując zastosowane ustawienia oceny. Wynik Nvidii w pewnym sensie omija tę debatę — nie domaga się mądrzejszego modelu, a jedynie lepiej zaprojektowanego agenta opartego na już istniejącym.

Przesłanie dla programistów i przedsiębiorstw tworzących produkty agentowe jest bezpośrednie: wybór modelu nadal ma znaczenie, ale projekt systemu decyduje teraz, czy model pionierski zapewni pionierskie wyniki. Jak twierdzi Nvidia, ocena modelu to nie to samo, co ocena agenta — a tabele porównawcze z roku 2026 w coraz większym stopniu nagradzają inżynierów budujących rusztowanie.

Wyprzedź sztuczną inteligencję

Architektury agentów rozwijają się szybciej niż kiedykolwiek, a różnicę między dobrą a złą uprzężą mierzy się obecnie w punktach odniesienia i realnych dolarach. Śledź AI Buzz Wire, aby codziennie otrzymywać zweryfikowane źródła relacji z badań nad sztuczną inteligencją, testów porównawczych i premier produktów.

Przeczytaj więcej aktualności z badań nad sztuczną inteligencją →