OpenAI'nin GPT-6 Astra'sı, ARC Ödül Vakfı tarafından Çarşamba günü yayınlanan sonuçlara göre, ajansal zekayı ölçmek için tasarlanan soyut akıl yürütme kriteri olan ARC-AGI-3'e ilişkin son teknoloji sonuçları yayınladı. Model, temelin Standart donanımı kapsamındaki kıyaslama Yarı Özel setinde %62,7 puan aldı ve talepler arasında modelin dahili akıl yürütme durumunu koruyan Sağlayıcı Adaptör donanımıyla değerlendirildiğinde %99,9 puan aldı.
Sonuçlar, OpenAI'nin şirketin yeni bir dönemin başlangıcı olarak çerçevelediği amiral gemisi modeli Astra'nın aşamalı olarak piyasaya sürülmesinden bir gün sonra geldi. Sınır laboratuvarlarının ticaret kriterleri darbe alırken puanlarını korumaya çalışan okuyucular için, en son yapay zeka gelişmeleri sayfası her önemli sürümü gerçekleştiği anda takip ediyor.
İki Koşum, İki Çok Farklı Skor
Astra'nın iki manşet rakamı arasındaki fark rapordaki en önemli detay. ARC Ödülü, aracıları farklı koşullar altında değerlendirir ve her biri, modelin kendi bağlamıyla yapmasına izin verilen şeyleri değiştirir.
Standart donanım kapsamında bir model, bir ortamda çalışırken saklamayı seçtiği notları iletebilir. Bu kurulumla, maksimum akıl yürütme çabasında Astra, değerlendirme çalışması için toplam 26.098 ABD doları maliyetle %62,7 puan aldı. Diğer tarafta, aynı donanımın muhakeme kapalıyken çalıştırılması yalnızca %35,2 üretirken, daha fazla maliyete (49.791 dolar) sahipti çünkü modelin ilerleme kaydetmek için çok daha fazla eyleme ihtiyacı vardı.
Sağlayıcı Adaptör donanımı daha cömerttir: modelin istekler arasındaki opak akıl yürütme durumunu korur ve daha uzun konuşmalar için sıkıştırmayı kullanarak Astra'nın önceki çalışmasını yeniden kullanmasına olanak tanır. Bu koşum takımı altında Astra, yüksek muhakeme çabasında 18.817 dolar karşılığında %99,9, maksimum çabada ise 17.332 dolar karşılığında %98,6 puan aldı. En düşük muhakeme ayarı bile %96,7'ye ulaştı.
Başka bir deyişle, kısmi puan ile mükemmele yakın puan arasındaki fark yalnızca ham yetenek değildir; modelin çalışma durumunun adımlar arasında ne kadarının hayatta kaldığıdır.
Eylem Verimliliği Konusunda İnsanları Geride Bırakmak
ARC-AGI-3 yeni, soyut, sıra tabanlı oyun ortamları üzerine inşa edilmiştir. Temsilciler talimat olmadan keşfetmeli, dünyanın nasıl çalıştığını anlamalı, seyrek ödüllerden hedefleri belirlemeli ve çok adımlı eylemler planlamalıdır. Ortamlar, insanların sorunları %100 çözebileceği şekilde kalibre edilmiştir; bu da insan performansını, kıyaslama ölçütünün temel noktası haline getirir.
Astra sadece çoğu seviyeyi çözmekle kalmadı, aynı zamanda onları verimli bir şekilde çözdü. ARC Ödülü'ne göre model, seviyelerin %96'sında ortalama test edilen insandan daha az eylem kullandı ve set genelinde eylem verimliliği açısından insan temel çizgisini aştı.
Karşılaştırmanın ekonomisi çok keskin. İnsan testi katılımcılarına 90 dakikalık oturum başına 115 dolar artı tamamlanan oyun başına 5 dolar ödendi; bu da denenen oyun başına yaklaşık 12,78 dolara denk geliyor. Tam bir Astra değerlendirme çalışmasının maliyeti, konfigürasyona bağlı olarak beş rakamlıdır. Ancak ARC Ödülü mantık dışı bir soruna dikkat çekti: Daha fazla akıl yürütme çabası genellikle daha az maliyetliydi çünkü Astra, oyunları daha az eylemle çözerek çalıştırma başına yakılan toplam model çağrıları ve jeton sayısını azalttı.
Kendi Dilini Oluşturan Bir Model
ARC Ödülü, puanların ötesinde ekibin gözlemlediği niteliksel bir davranışın altını çizdi. Astra, alışılmadık ortamları sürekli olarak kompakt sembolik dünya modellerine dönüştürdü; oyun mekaniğini mantıksal kurallar olarak temsil etti ve durumu ve plan eylemlerini izlemek için kendi alana özgü kısa yolu geliştirdi.
ARC-AGI-3'ün araştırmak için tasarladığı beceri tam olarak budur. Karşılaştırmalı değerlendirmenin önceki nesilleri, yeni modeller üzerinde akıcı akıl yürütmeyi test ederken, üçüncü nesil, bir aracının daha önce hiç görmediği ortamlarda keşfedip modelleyemeyeceğini, hedefler belirleyip uygulayamayacağını ve ARC Ödülü listelerinin keşif, modelleme, hedef belirleme ve planlama ve yürütme olarak sıralanan bileşenlerini test edip edemeyeceğini test eder.
AGI Çağının Arka Planı
Karşılaştırma sonuçları, OpenAI'nin azami söyleminin ortasında geldi. The New Stack'ın lansmanla ilgili haberine göre, perşembe günkü lansmandan önce düzenlenen basın toplantısında şirket başkanı Greg Brockman, "şu anda AGI çağında olduğumuzu hissetmenin mantıksız olmadığını" söylerken, resmi bir beyanda bulunmadan durdu. AGI'yi sözleşmeye dayalı bir tetikleyiciden ziyade bir "misyon kavramı veya manevi kavram" olarak tanımladı.
OpenAI araştırmacısı Aidan Clark, Astra'nın şirketin bugüne kadarki en büyük eğitim çalışması olduğunu (Texas'taki Stargate tesisinde 100.000'den fazla GPU üzerinde önceden eğitilen ilk eğitim) ve önceki modellerin eğitim sürecinin denetlenmesinde önemli bir rol oynadığı ilk OpenAI sürümü olduğunu söyledi. Erişim aşamalı olarak kalır: Dağıtım, Daybreak programındaki kurumsal müşterilerle başlar; Plus, Pro, Business ve Enterprise kullanılabilirliğinin yanı sıra önümüzdeki günlerde API ve AWS erişimi de söz konusudur.
Puandaki Yıldız İşareti
Birkaç açıdan dikkatli olunması gerekir. Astra'nın ARC-AGI-3 performansı, iki başlık numarasının da gösterdiği gibi büyük ölçüde donanım konfigürasyonuna bağlıdır ve model durumunu koruyan özel donanımlar, kıyaslama anlaşmazlıklarında yinelenen bir tartışma noktası olmuştur. New Stack'in lansmanla ilgili analizi, Astra'nın "özel görevlerde büyük kazanımlar sağladığını, ancak üstün bir performans sergilediğini ve kodlama paketine açıkça liderlik etmediğini" belirtti; bu, ajansal bulmaca kıyaslamalarının ve günlük ticari iş yüklerinin farklı şeyleri ölçtüğünün bir hatırlatıcısıdır.
ARC Ödülü'nün kendisi, egzersizi mevcut yapay zeka ile YGZ arasındaki "geriye kalan boşluğu" ölçmek olarak çerçeveliyor ve AGI'yi, bir insanın yapabileceği herhangi bir beceriyi, bir insan kadar verimli bir şekilde elde etme yeteneği olarak tanımlıyor. Uygun koşullar altında mükemmele yakın bir puan bu farkı tek başına kapatmaz. Ve değerlendirme çalışması başına 17.000 ila 50.000 ABD Doları arasında, yalnızca iyi kaynaklara sahip laboratuvarlar bu ölçekte karşılaştırmalı değerlendirmeyi gerçekleştirebilir; ancak ARC Ödülü'nün maliyet verileri, daha akıllı akıl yürütmenin aslında faturayı küçültebileceğini gösteriyor.
Neden Önemlidir
Eylem verimliliği gerçekten yeni bir karşılaştırma eksenidir. Her seviyeyi çözen ancak bunu yaparken binlerce çağrıyı boşa harcayan bir model, Astra'nın burada yaptığı gibi davranan bir modelden daha az kullanışlıdır ve daha pahalıdır: kasıtlı olarak keşfetmek, öğrendiklerini sıkıştırmak ve buna göre hareket etmek. AGI tartışması hakkında ne sonuca varılırsa sonuçlansın, ARC Ödülü verileri sınır ajanlarının artık insanlarla yalnızca yeni sorunları çözüp çözemeyecekleri konusunda değil, aynı zamanda bunları ne kadar ekonomik çözdükleri konusunda da eşleştirdiklerini gösteriyor.
Yapay Zekanın Önünde Kalın
Her kıyaslama sonucu, model lansmanı ve güvenlik tartışması gerçekleştikçe takip ediliyor — daha fazla yapay zeka haberini okuyun →
