Nvidia araştırmacıları, Anthropic'in Claude Opus 5'ini, kendi başına çalıştığında %30 puan alan aynı modeli kullanarak, yapay zekadaki en zorlu etkileşimli akıl yürütme ölçütlerinden biri olan ARC-AGI-3'te %100'lük mükemmel bir puana ulaştıran bir aracı sistem oluşturdular. Cuma günü Nvidia Teknik Blogunda yayınlanan sonuç, bir sınır modelinin etrafına sarılmış yazılımın, modelin kendisi kadar önemli olduğunun şimdiye kadarki en güçlü kanıtıdır. En son yapay zeka gelişmelerini takip eden herkes için bu, ajansal yapay zekanın rekabet avantajının gerçekte yaşadığı yerde bir değişime işaret ediyor.

Sistem, Ajan Varyasyon Operatörleri'nin kısaltması olan AVO olarak adlandırılıyor ve Nvidia'nın uzun ufuklu otonom aracılar için genel amaçlı bir mimariyi benimsiyor - tek bir istemi yanıtlamak yerine saatlerce veya günlerce görevde kalabilen yapay zeka. ARC-AGI-3 genel setinde AVO, 25 oyun ortamının tamamında 100,00 RHAE puanı kaydetti ve arka uç modeli olarak Claude Opus 5'i kullanarak 6.624 ortam eyleminde 183 seviyenin tamamını tamamladı.

ARC-AGI-3 Aslında Neyi Test Ediyor?

ARC-AGI-3, ARC Ödülü vakfı tarafından oluşturulan etkileşimli bir akıl yürütme ölçütüdür. Bir temsilci, hiçbir talimatın, belirtilen kuralların ve belirtilen bir amacın olmadığı, alışılmadık, oyun benzeri ortamlara bırakılır. Deneme yanılma yoluyla keşfetmeli, ortamın nasıl çalıştığını anlamalı, "kazanmanın" ne anlama geldiğini anlamalı ve daha sonra giderek daha zor seviyelere ilerlemek için yeterince verimli hareket etmelidir.

Karşılaştırmanın puanlama ölçüsü olan Göreceli İnsan Eylem Verimliliği (RHAE), görev tamamlamayı temsilcinin ilk kez insan oyunculara göre ne kadar az eylem harcadığı ile birleştirir. Bu, onu sürdürülebilir özerkliğin acımasız bir sınavı haline getiriyor: Temsilcinin öğrendiklerini hatırlaması, hatalarından kurtulması ve tüm çalışma boyunca eylemlerini dikkatli bir şekilde bütçelendirmesi gerekiyor.

Nvidia'nın başlık numarası bir karşılaştırmadan bağlam kazanıyor. Claude Opus 5'i de kullanan önceki bir doğrudan etkileşim donanımı olan VISTA, 7.542 çevre eyleminde aynı 183 genel ayarlı seviyeyi tamamladı. Nvidia'nın blog gönderisine göre AVO'nun işi bitirmek için yaklaşık %12 daha az eyleme ihtiyacı vardı.

GPU Çekirdeklerinden Bilinmeyen Oyunlara

AVO bulmacalar için tasarlanmamıştır. Nvidia, mimariyi ilk olarak küçük kod değişikliklerinin doğruluğu, bellek davranışını ve verimi öngörülemeyen şekillerde bozabileceği bir alan olan GPU çekirdeği optimizasyonunda gösterdi. Bir dikkat çekirdeği çalışmasında AVO yedi gün boyunca sürekli olarak çalıştı, 500'den fazla optimizasyon yönünü araştırdı ve 40 çekirdek sürümünü kullanıma sundu. NVIDIA DGX B200 sistemlerinde ortaya çıkan çok başlı dikkat çekirdekleri, cuDNN'den %3,5'e kadar ve FlashAttention-4'ten %10,5'e kadar daha iyi performans gösterdi. Aracı daha sonra yaklaşık 30 dakikalık ek otonom çalışmayla gelişmiş çekirdeğini gruplandırılmış sorgu dikkatine uyarladı.

Aynı temel döngü (teftiş, planlama, uygulama, test etme, değerlendirme) daha sonra yalnızca görev arayüzü değiştirilerek ARC-AGI-3'e yönlendirildi. İki mekanizma devredildi. Birincisi, önceki uygulamaları, değerlendirme sonuçlarını, derleyici ve profil oluşturucu çıktılarını ve birikmiş akıl yürütmeyi depolayan kalıcı bellektir, böylece aracı, bağlamı sıfırdan yeniden oluşturmak yerine mevcut durumundan devam edebilir. İkincisi, genel gidişatı izleyen ve ilerleme durduğunda müdahale eden ikinci bir ajan olan bir süpervizördür.

Süpervizör Atılımdır

Şirketin yapay zeka biriminde üründen sorumlu başkan yardımcısı olan Nvidia'nın Adel El Hallak'ıyla röportaj yapan TechCrunch, denetçiyi en önemli bileşen olarak vurguladı. El Hallak, yayına şöyle konuştu: "Acente yön değiştirdiğinde veya çıkmaza yol açabilecek bir yolu keşfetmeye başladığında ya da daha önce yürüdüğü bir yolu yeniden keşfetmeye başladığında temsilciyi dürtmek neredeyse bir CEO gibi davranıyor."

Performans farkı çok ciddi. Nvidia'nın testleri, gelişmiş bir donanıma sahip olmayan Claude Opus 5'in ARC-AGI-3'te %30'luk bir skor elde ettiğini ortaya çıkardı; bu, test edilen çıplak modeller arasında en iyi sonuçtu, ancak tam çalışmaya yakın değildi. OpenAI'nin modelleri kıyaslamada %10'un altında puan aldı ve şirket geçen ay kendi araştırmasını yayınladı ve sadece iki kablo demeti ayarını değiştirmenin puanlarını üç katına çıkardığını gösterdi. Hiçbir yalnızca model konfigürasyonu, AVO'nun ulaştığı %100'e yaklaşamadı.

Özellikle, AVO konfigürasyonu salt metin modunda çalışıyordu: her gözlem, modele hiçbir görüntü veya görüntü belirteci gönderilmeden, tam 64x64 metin ızgarası olarak sağlandı. Akıl yürütme gücü, çok modlu algıdan değil, modelin etrafındaki döngüden geliyordu.

Endüstri Neden Emniyet Kemerlerine Önem Veriyor?

Bu bulgu, otonom yapay zeka için mevcut darboğazın ham model yeteneği değil, aracı altyapısı olduğuna dair bir kanıt dalgasının ortasında ortaya çıkıyor. Databricks, Temmuz ayında koşumun hem performansı hem de maliyeti önemli ölçüde etkilediğini gösteren kıyaslama araştırmasını yayınladı. Databricks CEO'su Ali Ghodsi, TechCrunch'a "Aynı modeli ancak farklı kayışları seçebilirsiniz ve yanlış kablo demeti kullanırsanız önemli ölçüde daha fazla maliyet elde edersiniz" dedi. "Bunun kendisi maliyetinizi 2 katına çıkarabilir."

El Hallak, Nvidia'nın daha geniş argümanını açıklık açısından çerçeveledi. "Ekosistemin ileri ve güvenli bir şekilde ilerlemesi için gereken şeyin, donanım üzerinde, altyapı genelinde ve çalışma süresi boyunca kontrole sahip olduğunuz açık bir aracı yığınına sahip olmanın gerekli olduğuna inanıyoruz" dedi. Nvidia, NeMo markası altında açık boyutlu donanım teknolojisine sahip ve AVO araştırması arXiv ile ilgili bir makalede belgeleniyor.

Geçmişi Olan Bir Karşılaştırma

ARC-AGI-3, sınır laboratuarı rekabetinde bir parlama noktası haline geldi. OpenAI daha önce GPT-5.6 Sol modeli için kıyaslamada güçlü sonuçlar elde ettiğini ve kullanılan değerlendirme ayarlarının incelendiğini iddia etmişti. Nvidia'nın sonucu bir anlamda bu tartışmayı atlatıyor; daha akıllı bir model iddia etmiyor, yalnızca mevcut bir modelin etrafında daha iyi tasarlanmış bir aracı olduğunu iddia ediyor.

Ajansal ürünler geliştiren geliştiriciler ve kuruluşlar için mesaj doğrudandır: model seçimi hâlâ önemlidir, ancak artık sistem tasarımı, bir sınır modelinin sınır sonuçları sağlayıp sağlamadığına karar vermektedir. Nvidia'nın belirttiği gibi, bir modeli değerlendirmek bir aracıyı değerlendirmekle aynı şey değil ve 2026'nın kıyaslama tabloları, iskeleyi kuran mühendisleri giderek daha fazla ödüllendiriyor.

Yapay Zekanın Önünde Olun

Aracı mimarileri her zamankinden daha hızlı hareket ediyor ve iyi bir donanım ile kötü bir donanım arasındaki fark artık kıyaslama noktaları ve gerçek dolarlarla ölçülüyor. Yapay zeka araştırmalarının, karşılaştırmaların ve ürün lansmanlarının günlük, kaynak doğrulamalı kapsamı için AI Buzz Wire'ı takip edin.

Daha fazla yapay zeka araştırma haberini okuyun →