Penyelidik Nvidia telah membina sistem ejen yang mendorong Anthropic's Claude Opus 5 kepada skor 100% sempurna pada ARC-AGI-3, salah satu penanda aras penaakulan interaktif yang paling menuntut dalam AI — menggunakan model yang sama yang mendapat markah 30% apabila ia berjalan sendiri. Hasilnya, yang diterbitkan pada hari Jumaat di Blog Teknikal Nvidia, adalah bukti paling kukuh bahawa perisian yang melilit model sempadan penting seperti model itu sendiri. Bagi sesiapa sahaja yang menjejaki perkembangan AI terbaharu, ia menandakan peralihan di mana kelebihan daya saing dalam AI agen sebenarnya hidup.
Sistem ini dipanggil AVO, singkatan untuk Agentic Variation Operators, dan ia adalah pandangan Nvidia mengenai seni bina tujuan umum untuk ejen autonomi ufuk panjang — AI yang boleh kekal dalam tugas selama berjam-jam atau hari dan bukannya menjawab satu gesaan. Pada set awam ARC-AGI-3, AVO merekodkan skor 100.00 RHAE merentas semua 25 persekitaran permainan, melengkapkan kesemua 183 peringkat dalam 6,624 tindakan persekitaran menggunakan Claude Opus 5 sebagai model belakangnya.
Apa yang Diuji Sebenarnya ARC-AGI-3
ARC-AGI-3 ialah penanda aras penaakulan interaktif yang dicipta oleh yayasan Hadiah ARC. Seorang ejen dijatuhkan ke dalam persekitaran yang tidak dikenali, seperti permainan tanpa arahan, tiada peraturan yang dinyatakan dan tiada matlamat yang dinyatakan. Ia perlu meneroka melalui percubaan dan kesilapan, membuat kesimpulan bagaimana persekitaran berfungsi, memikirkan maksud "menang", dan kemudian bertindak dengan cekap untuk maju melalui tahap yang semakin sukar.
Metrik pemarkahan penanda aras, Kecekapan Tindakan Manusia Relatif (RHAE), menggabungkan penyiapan tugas dengan berapa sedikit tindakan yang dibazirkan ejen berbanding dengan pemain manusia kali pertama. Ini menjadikannya ujian kejam terhadap autonomi yang berterusan: ejen mesti mengingati perkara yang dipelajarinya, pulih daripada kesilapan dan menganggarkan tindakannya dengan berhati-hati sepanjang keseluruhan larian.
Nombor tajuk Nvidia mendapat konteks daripada perbandingan. VISTA, abah-abah interaksi langsung sebelum ini yang turut menggunakan Claude Opus 5, menyelesaikan 183 tahap set awam yang sama dalam 7,542 tindakan persekitaran. AVO memerlukan kira-kira 12% kurang tindakan untuk menyelesaikan kerja, menurut catatan blog Nvidia.
Daripada Kernel GPU kepada Permainan Tidak Diketahui
AVO tidak dibina untuk teka-teki. Nvidia mula-mula menunjukkan seni bina pada pengoptimuman kernel GPU, domain di mana perubahan kod kecil boleh memecahkan ketepatan, tingkah laku memori dan daya pemprosesan dengan cara yang tidak dapat diramalkan. Dalam satu kajian inti perhatian, AVO berjalan secara berterusan selama tujuh hari, meneroka lebih daripada 500 arah pengoptimuman dan komited 40 versi kernel. Pada sistem NVIDIA DGX B200, kernel perhatian berbilang kepala yang terhasil mengatasi cuDNN sehingga 3.5% dan FlashAttention-4 sehingga 10.5%. Ejen itu kemudian menyesuaikan kernelnya yang berkembang kepada perhatian pertanyaan terkumpul dalam kira-kira 30 minit kerja autonomi tambahan.
Gelung teras yang sama — memeriksa, merancang, melaksanakan, menguji, menilai — kemudiannya dihalakan pada ARC-AGI-3 dengan hanya antara muka tugasan yang diubah. Dua mekanisme terbawa-bawa. Yang pertama ialah ingatan berterusan, yang menyimpan pelaksanaan terdahulu, hasil penilaian, output pengkompil dan pemprofil, dan penaakulan terkumpul, supaya ejen boleh menyambung semula dari keadaan semasa dan bukannya membina semula konteks dari awal. Yang kedua ialah penyelia, ejen kedua yang memerhati trajektori keseluruhan dan campur tangan apabila kemajuan terhenti.
Penyelia Adalah Kejayaan
TechCrunch, yang menemu bual Adel El Hallak Nvidia, naib presiden produk dalam unit AI syarikat, menyerlahkan penyelia sebagai bahan yang paling penting. "Ia hampir bertindak seperti Ketua Pegawai Eksekutif untuk mendorong ejen apabila ia terkeluar dari arah atau mula meneroka laluan yang mungkin membawa kepada jalan buntu, atau meneroka semula laluan yang pernah dilaluinya sebelum ini," kata El Hallak kepada penerbitan itu.
Jurang prestasi adalah ketara. Ujian Nvidia mendapati bahawa Claude Opus 5 tanpa abah-abah yang canggih berjaya memperoleh skor 30% pada ARC-AGI-3 — hasil terbaik dalam kalangan model kosong yang diuji, tetapi tidak hampir sama sekali. Model OpenAI telah mendapat markah di bawah 10% pada penanda aras, dan syarikat itu menerbitkan penyelidikannya sendiri pada bulan lepas menunjukkan bahawa tweak hanya dua tetapan abah-abah meningkatkan tiga kali ganda markahnya. Tiada konfigurasi model sahaja yang hampir 100% yang dicapai oleh AVO.
Terutama, konfigurasi AVO dijalankan dalam modaliti teks sahaja: setiap pemerhatian dibekalkan sebagai grid teks 64x64 tepat, tanpa imej atau token imej dihantar kepada model. Kuasa penaakulan datang dari gelung di sekeliling model, bukan dari persepsi multimodal.
Mengapa Industri Bertaruh pada Harness
Penemuan itu berlaku di tengah-tengah gelombang bukti bahawa infrastruktur ejen, bukan keupayaan model mentah, adalah kesesakan semasa untuk AI autonomi. Databricks menerbitkan penyelidikan penanda aras pada bulan Julai yang menunjukkan bahawa abah-abah memberi kesan secara mendadak kepada prestasi dan kos. "Anda boleh memilih model yang sama tetapi abah-abah yang berbeza, dan anda mendapat lebih banyak kos jika anda menggunakan abah-abah yang salah," kata Ketua Pegawai Eksekutif Databricks Ali Ghodsi kepada TechCrunch. "Itu sendiri boleh 2x ganda kos anda."
El Hallak merangka hujah Nvidia yang lebih luas dari segi keterbukaan. "Kami percaya dengan mempunyai timbunan ejen terbuka - di mana anda mempunyai kawalan merentas abah-abah, merentas infrastruktur, merentas masa jalan - adalah perkara yang diperlukan untuk kami membawa ekosistem ke hadapan dan selamat," katanya. Nvidia mempunyai kepingan teknologi abah-abah bersaiz terbuka di bawah jenama NeMonya, dan penyelidikan AVO didokumenkan dalam kertas mengenai arXiv.
Penanda Aras Dengan Sejarah
ARC-AGI-3 telah menjadi titik kilat dalam persaingan makmal sempadan. OpenAI sebelum ini mendakwa keputusan kukuh untuk model GPT-5.6 Sol pada penanda aras, menarik perhatian terhadap tetapan penilaian yang digunakan. Keputusan Nvidia mengetepikan perdebatan itu dalam satu segi — ia tidak menuntut model yang lebih pintar, hanya ejen yang direka dengan lebih baik di sekeliling model yang sedia ada.
Mesej untuk pembangun dan perusahaan membina produk agen adalah secara langsung: pemilihan model masih penting, tetapi reka bentuk sistem kini memutuskan sama ada model sempadan menyampaikan hasil sempadan. Seperti yang dinyatakan oleh Nvidia, menilai model tidak sama dengan menilai ejen — dan jadual penanda aras 2026 semakin memberi ganjaran kepada jurutera yang membina perancah.
Kekal Mendahului AI
Seni bina ejen bergerak lebih pantas berbanding sebelum ini, dan jurang antara abah-abah yang baik dan buruk kini diukur dalam mata penanda aras dan dolar sebenar. Ikuti AI Buzz Wire untuk mendapatkan liputan harian yang disahkan sumber bagi penyelidikan AI, penanda aras dan pelancaran produk.
Baca lebih banyak berita penyelidikan AI →