Výzkumníci společnosti Nvidia vytvořili systém agentů, který posunul Anthropic's Claude Opus 5 k dokonalému 100% skóre na ARC-AGI-3, jednom z nejnáročnějších interaktivních testů uvažování v AI – pomocí stejného modelu, který má skóre 30 %, když běží sám. Výsledek, zveřejněný v pátek na technickém blogu Nvidia, je zatím nejsilnějším důkazem toho, že na softwaru omotaném kolem hraničního modelu záleží stejně jako na modelu samotném. Pro každého, kdo sleduje [nejnovější vývoj AI] (https://aibuzzwire.news), to znamená posun v tom, kde konkurenční výhoda v agentní AI skutečně žije.
Systém se nazývá AVO, což je zkratka pro Agentic Variation Operators, a je to způsob, jakým Nvidia převzala univerzální architekturu pro autonomní agenty s dlouhým horizontem – AI, která může zůstat na úkolu hodiny nebo dny namísto odpovědi na jedinou výzvu. Na veřejném setu ARC-AGI-3 zaznamenalo AVO skóre 100,00 RHAE ve všech 25 herních prostředích a dokončilo všech 183 úrovní v 6 624 akcích prostředí s použitím Claude Opus 5 jako svého backendového modelu.
Co ARC-AGI-3 vlastně testuje
ARC-AGI-3 je interaktivní měřítko uvažování vytvořené nadací ARC Prize. Agent je vržen do neznámého prostředí podobného hře bez pokynů, bez stanovených pravidel a bez stanoveného cíle. Musí prozkoumat pomocí pokusů a omylů, odvodit, jak funguje prostředí, zjistit, co znamená „vítězství“, a pak jednat dostatečně efektivně, aby postupovalo přes postupně těžší úrovně.
Bodovací metrika benchmarku, Relative Human Action Efficiency (RHAE), kombinuje dokončení úkolu s tím, jak málo akcí agent plýtvá ve srovnání s novými lidskými hráči. To z něj dělá brutální test trvalé autonomie: agent si musí pamatovat, co se naučil, zotavit se z chyb a pečlivě rozpočítat své akce na celý běh.
Titulkové číslo Nvidie získává kontext ze srovnání. VISTA, předchozí postroj s přímou interakcí, který také používal Claude Opus 5, dokončil stejných 183 veřejně nastavených úrovní v 7 542 akcích prostředí. AVO potřebovalo k dokončení práce zhruba o 12 % méně akcí, podle blogového příspěvku Nvidie.
Od jader GPU k neznámým hrám
AVO nebylo stavěno pro hádanky. Nvidia poprvé demonstrovala architekturu na optimalizaci jádra GPU, což je doména, kde malé změny kódu mohou narušit správnost, chování paměti a propustnost nepředvídatelnými způsoby. V jedné studii zaměřené na jádro AVO běželo nepřetržitě sedm dní, prozkoumalo více než 500 optimalizačních směrů a provedlo 40 verzí jádra. Na systémech NVIDIA DGX B200 výsledná vícehlavá jádra pozornosti překonala cuDNN až o 3,5 % a FlashAttention-4 až o 10,5 %. Agent poté upravil své vyvinuté jádro na pozornost seskupených dotazů během asi 30 minut dodatečné autonomní práce.
Stejná základní smyčka – inspekce, plán, implementace, testování, vyhodnocení – byla poté nasměrována na ARC-AGI-3, pouze se změnilo rozhraní úlohy. Převzaty dva mechanismy. První je perzistentní paměť, která ukládá předchozí implementace, výsledky hodnocení, výstupy kompilátoru a profileru a nashromážděné uvažování, takže agent může pokračovat ve svém aktuálním stavu a nemusí znovu vytvářet kontext od nuly. Druhý je supervizor, druhý agent, který sleduje celkovou trajektorii a zasáhne, když se pokrok zastaví.
Vedoucí je průlom
TechCrunch, který vedl rozhovor s Adelem El Hallakem ze společnosti Nvidia, viceprezidentem pro produkt v oddělení umělé inteligence společnosti, vyzdvihl supervizora jako nejdůležitější složku. "Chová se to skoro jako generální ředitel, který postrčí agenta, když sejde ze směru nebo začne prozkoumávat cestu, která by mohla vést do slepé uličky, nebo znovu prozkoumat cestu, kterou předtím prošel," řekl El Hallak publikaci.
Rozdíl ve výkonu je výrazný. Testování společnosti Nvidia zjistilo, že Claude Opus 5 bez sofistikovaného kabelového svazku dosáhl 30% skóre na ARC-AGI-3 – nejlepší výsledek mezi testovanými holými modely, ale zdaleka se neblíží plnému provozu. Modely OpenAI dosáhly v benchmarku méně než 10 % a společnost minulý měsíc zveřejnila svůj vlastní výzkum, který ukázal, že vyladění pouhých dvou nastavení svazku ztrojnásobilo její skóre. Žádná konfigurace pouze pro model se nepřiblížila 100 %, kterých dosáhlo AVO.
Je pozoruhodné, že konfigurace AVO běžela pouze v textové modalitě: každé pozorování bylo dodáno jako přesná textová mřížka 64x64, bez obrázků nebo obrazových tokenů zasílaných do modelu. Síla uvažování pocházela ze smyčky kolem modelu, nikoli z multimodálního vnímání.
Proč průmysl sází na postroje
Zjištění přistálo uprostřed vlny důkazů, že aktuálním úzkým hrdlem autonomní umělé inteligence je infrastruktura agentů, nikoli schopnost hrubého modelu. Společnost Databricks v červenci zveřejnila srovnávací výzkum, který ukazuje, že kabeláž dramaticky ovlivňuje výkon i náklady. „Můžete si vybrat stejný model, ale různé postroje, a pokud použijete nesprávný postroj, získáte výrazně vyšší náklady,“ řekl TechCrunch generální ředitel Databricks Ali Ghodsi. "To samo o sobě může zdvojnásobit vaše náklady."
El Hallak zarámoval širší argument Nvidie z hlediska otevřenosti. "Věříme, že máme otevřený zásobník agentů - kde máte kontrolu nad kabelem, napříč infrastrukturou, napříč běhovým prostředím - je to, co potřebujeme k tomu, abychom uvedli ekosystém kupředu a bezpečně," řekl. Nvidia má pod svou značkou NeMo otevřené kusy technologie svazků a výzkum AVO je zdokumentován v článku na arXiv.
Benchmark s historií
ARC-AGI-3 se stal bodem vzplanutí v rivalitě mezi laboratořemi. OpenAI již dříve u svého modelu GPT-5.6 Sol v benchmarku vykázala dobré výsledky, přičemž zkoumala použitá nastavení hodnocení. Výsledek společnosti Nvidia tuto debatu v jednom smyslu obchází – nenárokuje si chytřejší model, pouze lépe vyvinutý agent kolem stávajícího.
Zpráva pro vývojáře a podniky vytvářející agentské produkty je přímá: na výběru modelu stále záleží, ale o tom, zda hraniční model přinese hraniční výsledky, nyní rozhoduje návrh systému. Jak říká Nvidia, hodnocení modelu není totéž jako hodnocení agenta – a benchmarkové tabulky z roku 2026 stále více odměňují inženýry, kteří staví lešení.
Udržujte si náskok před AI
Architektury agentů se pohybují rychleji než kdy jindy a propast mezi dobrým a špatným svazkem se nyní měří v referenčních bodech a skutečných dolarech. Sledujte AI Buzz Wire pro každodenní pokrytí výzkumu AI, srovnávacích testů a uvádění produktů na trh s ověřeným zdrojem.
Přečtěte si další zprávy o výzkumu AI →