Peneliti Nvidia wis mbangun sistem agen sing nyurung Anthropic's Claude Opus 5 menyang skor 100% sing sampurna ing ARC-AGI-3, salah sawijining pathokan penalaran interaktif sing paling nuntut ing AI - nggunakake model sing padha kanthi skor 30% nalika mlaku dhewe. Asil kasebut, diterbitake dina Jumuah ing Blog Teknis Nvidia, minangka bukti sing paling kuat manawa piranti lunak sing dibungkus ing model perbatasan penting kaya model kasebut. Kanggo sapa wae sing nglacak perkembangan AI paling anyar, iki nandhani owah-owahan ing ngendi keuntungan kompetitif ing AI agenik sejatine urip.
Sistem kasebut diarani AVO, singkatan saka Agentic Variation Operators, lan iki minangka arsitektur tujuan umum Nvidia kanggo agen otonomi jangka panjang - AI sing bisa tetep tugas nganti pirang-pirang jam utawa dina tinimbang mangsuli pitakon siji. Ing pesawat umum ARC-AGI-3, AVO nyathet skor 100,00 RHAE ing kabeh 25 lingkungan game, ngrampungake kabeh 183 level ing 6,624 tumindak lingkungan nggunakake Claude Opus 5 minangka model backend.
Apa ARC-AGI-3 Sejatine Tes
ARC-AGI-3 minangka patokan penalaran interaktif sing digawe dening yayasan ARC Prize. Agen dilebokake ing lingkungan sing ora pati ngerti, kaya game tanpa instruksi, ora ana aturan, lan ora ana tujuan. Sampeyan kudu njelajah liwat nyoba lan kesalahan, nyimpulake cara kerjane lingkungan, ngerteni apa tegese "menang", banjur tumindak kanthi efisien kanggo maju liwat tingkat sing luwih angel.
Metrik pemarkahan benchmark, Relative Human Action Efficiency (RHAE), nggabungake tugas rampung karo sawetara tumindak sing dibuang agen relatif marang pemain manungsa sing sepisanan. Iki ndadekake tes otonomi sing terus-terusan: agen kudu ngelingi apa sing disinaoni, pulih saka kesalahan, lan ngetrapake tumindak kasebut kanthi ati-ati sajrone kabeh.
Nomer judhul Nvidia entuk konteks saka perbandingan. VISTA, sabuk interaksi langsung sadurunge sing uga nggunakake Claude Opus 5, ngrampungake 183 level umum sing padha ing 7,542 tumindak lingkungan. AVO mbutuhake udakara 12% luwih sithik kanggo ngrampungake proyek kasebut, miturut kiriman blog Nvidia.
Saka Kernel GPU nganti Game Ora Dikenal
AVO ora dibangun kanggo teka-teki. Nvidia pisanan nduduhake arsitektur ing optimasi GPU-kernel, domain ngendi owah-owahan kode cilik bisa break bener, prilaku memori, lan throughput ing cara ranyono. Ing siji sinau fokus-kernel, AVO mlaku terus-terusan suwene pitung dina, njelajah luwih saka 500 arah optimasi, lan nindakake 40 versi kernel. Ing sistem NVIDIA DGX B200, kernel perhatian multihead sing diasilake ngluwihi cuDNN nganti 3,5% lan FlashAttention-4 nganti 10,5%. Agen kasebut banjur ngadaptasi kernel sing wis ngalami évolusi kanggo diklompokaké-query manungsa waé ing babagan 30 menit karya otonom tambahan.
Daur ulang inti sing padha - mriksa, ngrancang, ngleksanakake, nguji, ngevaluasi - banjur ditunjuk ing ARC-AGI-3 kanthi mung antarmuka tugas sing diganti. Loro mekanisme digawa liwat. Sing pisanan yaiku memori sing terus-terusan, sing nyimpen implementasine sadurunge, asil evaluasi, output compiler lan profiler, lan akumulasi pertimbangan, supaya agen bisa nerusake saka kahanan saiki tinimbang mbangun konteks saka awal. Kapindho minangka supervisor, agen kapindho sing nonton lintasan sakabèhé lan campur tangan nalika kemajuan mandheg.
Supervisor Iku Terobosan
TechCrunch, sing wawancara karo Nvidia's Adel El Hallak, wakil presiden produk ing unit AI perusahaan, nyorot supervisor minangka bahan sing paling penting. "Sampeyan meh tumindak kaya CEO kanggo nudge agen nalika metu saka arah utawa wiwit njelajah dalan sing bisa mimpin menyang buntu, utawa njelajah maneh dalan sing sadurunge wis mlaku," El Hallak marang publikasi.
Longkangan kinerja punika stark. Pengujian Nvidia nemokake yen Claude Opus 5 tanpa sabuk sing canggih bisa entuk skor 30% ing ARC-AGI-3 - asil paling apik ing antarane model telanjang sing diuji, nanging ora ana ing ngendi wae. Model OpenAI wis ngetung ing ngisor 10% ing pathokan, lan perusahaan kasebut nerbitake riset dhewe ing wulan kepungkur sing nuduhake manawa mung nggawe rong setelan sabuk tikel kaping telu. Ora ana konfigurasi mung model sing cedhak karo 100% sing digayuh AVO.
Utamane, konfigurasi AVO mlaku kanthi modalitas mung teks: saben pengamatan diwenehake minangka kothak teks 64x64 sing pas, tanpa gambar utawa token gambar sing dikirim menyang model kasebut. Daya nalar teka saka loop watara model, ora saka persepsi multimodal.
Apa Industri Betting ing Harnesses
Penemuan kasebut ana ing tengah gelombang bukti yen infrastruktur agen, dudu kemampuan model mentah, minangka kemacetan saiki kanggo AI otonom. Databricks nerbitake riset benchmarking ing wulan Juli sing nuduhake manawa sabuk kasebut mengaruhi kinerja lan biaya. "Sampeyan bisa milih model sing padha nanging sabuk sing beda, lan sampeyan entuk biaya sing luwih akeh yen sampeyan nggunakake sabuk sing salah," ujare CEO Databricks Ali Ghodsi marang TechCrunch. "Sing dhewe bisa 2x biaya sampeyan."
El Hallak nggawe argumentasi Nvidia babagan keterbukaan. "Kita yakin duwe tumpukan agen sing mbukak - ing ngendi sampeyan duwe kontrol ing sabuk, ing prasarana, ing runtime - yaiku sing dibutuhake supaya ekosistem maju lan aman," ujare. Nvidia duwe teknologi sabuk ukuran mbukak ing merek NeMo, lan riset AVO didokumentasikake ing kertas ing arXiv.
Patokan Kanthi Sejarah
ARC-AGI-3 wis dadi flashpoint ing saingan frontier-lab. OpenAI sadurunge ngaku asil kuwat kanggo model GPT-5.6 Sol ing pathokan, teken nliti liwat setelan evaluasi digunakake. Asil Nvidia ngindhari debat kasebut ing siji pangertèn - ora ngaku model sing luwih pinter, mung agen sing direkayasa luwih apik ing saubengé sing wis ana.
Pesen kanggo pangembang lan perusahaan sing nggawe produk agen langsung: pilihan model isih penting, nanging desain sistem saiki mutusake manawa model perbatasan bakal ngasilake asil sing luwih dhisik. Kaya sing dicritakake Nvidia, ngevaluasi model ora padha karo ngevaluasi agen - lan tabel pathokan 2026 tambah akeh menehi penghargaan marang para insinyur sing mbangun perancah.
Tetep Ahead saka AI
Arsitektur agen obah luwih cepet tinimbang sadurunge, lan longkangan antarane sabuk apik lan ala saiki diukur ing TCTerms pathokan lan dolar nyata. Tindakake AI Buzz Wire kanggo saben dina, liputan sing diverifikasi sumber babagan riset AI, tolok ukur, lan peluncuran produk.
Waca liyane warta riset AI →