OpenAI, Anthropic'in Claude Opus 5'inin ARC-AGI-3 testinde üstünlük kurmasının ardından geri adım atıyor ve kendi GPT-5.6 Sol modelinin yüzde 38,3'e ulaştığını gösteren sonuçlar yayınlıyor - resmi test donanımı yerine OpenAI'nin tercih ettiği ayarları kullanmanız şartıyla.
30 Temmuz 2026'da sona eren anlaşmazlık, yapay zeka değerlendirmesinde giderek büyüyen bir sorunun özüne iniyor: kıyaslamalar artık yalnızca bir modeli ölçmüyor, onun etrafına sarılmış tüm teknik iskeleyi ölçüyor. AI Buzz Wire, en son AI gelişmelerinin ve model sürümlerinin daha derin analizi için hikayeyi takip ediyor.
Sayılar ve Yakalama
OpenAI, GPT-5.6 Sol'un ARC-AGI-3'te yüzde 38,3'e ulaştığını ve daha önce kıyaslama rekorunu dört katına çıkardıktan sonra yüzde 30,2 puan alan Anthropic'in Claude Opus 5'ini geride bıraktığını bildirdi. Bu uyarı önemli: Bu yüzde 38,3 rakamı, OpenAI'nin Yanıt API'sinin iki spesifik özelliğine bağlı.
Bunlardan ilki, modelin düşünce zincirini her eylemden sonra atmak yerine adımlar arasında koruyan Alıkonulan Akıl Yürütme'dir. İkincisi, eski bağlamı kısaltmak yerine özetleyen Sıkıştırma'dır; bu, modelin daha önceki akıl yürütmeyi kaybetmeden uzun sorunlar üzerinde çalışmaya devam etmesine olanak tanır.
Elmalar ve elmalar arasında karşılaştırmalar sağlamak için sağlayıcıya özel ayarlardan kasıtlı olarak kaçınan ARC Ödülü'nün resmi standartlaştırılmış donanımını çalıştırdığınızda GPT-5.6 Sol yalnızca yüzde 7,8'i başardı. OpenAI'ye göre bunun nedeni, resmi kurulumun her adımdan sonra modelin mantığını bir kenara atması ve sürekli çok adımlı düşünme gerektiren görevlerdeki performansın içini boşaltması.
Saflık İçin Geliştirilmiş Bir Karşılaştırma Ölçütü
ARC-AGI-3, François Chollet ve ARC Ödülü ekibi tarafından, bir modelin daha önce hiç görülmemiş yeni akıl yürütme bulmacalarını çözme yeteneğini araştırmak için tasarlandı; bu, ezberlenmiş bilgiden ziyade genel zeka testidir. Karşılaştırmaların adil olmasını sağlamak için resmi donanım, sağlayıcıya özgü özellikleri kasıtlı olarak ortadan kaldırarak ham model kapasitesini tarafsız bir ortamda ölçer.
OpenAI'nin karşı argümanı ise bu tarafsızlığın bir engel haline gelebileceği yönünde. Şirket, resmi donanımın, Claude API'nin halihazırda sunduğu yeteneklerden yoksun olan eski bir "OpenAI tarzı tamamlama API'sine" dayandığını ve orijinal karşılaştırmada OpenAI'yi Anthropic'e göre yapısal olarak dezavantajlı bir konuma getirdiğini iddia ediyor.
OpenAI özünde şunu söylüyor: Modelimizi bir eliniz arkadan bağlıyken ölçtünüz.
Chollet'nin Yanıtı
ARC Ödülü kurucu ortağı François Chollet, iki tür test kurulumu arasında net bir çizgi çizerek yanıt verdi. Kendisi, "karşılaştırmayı çözmek için özel olarak yapılmış veya kıyaslama formatı hakkında bilgi içeren" koşum takımlarının sınırsız olduğunu söyledi. Ancak "ARC-AGI-3 için geliştirilmemiş ve tüm API kullanıcılarının kullanımına açık olan" genel amaçlı API ayarları adil bir oyundur.
Aslında Chollet, ARC Ödülü'nün kendi GPT-5.6 Sol puanının OpenAI'yi dezavantajlı konuma getirdiğini kabul etti. Kuruluşun "modellerini, özellikle de sıkıştırma açısından en iyi şekilde nasıl test edebilecekleri konusunda OpenAI ile birçok kez karşılıklı görüştüğünü" belirtti ve şirketin "cevabını bulmaya başlamasını" memnuniyetle karşıladı.
Chollet geriye kalan endişelerden birini işaretledi. Farklı ayarları kullanan farklı sağlayıcılar, kendisinin "potansiyel eşitlik sorunu" olarak adlandırdığı durumu yaratıyor; ancak kendisi, "ayarlar ve maliyet açıkça bildirildiği sürece" bunun kabul edilebilir olduğunu düşünüyor.
Liderlik Sıralamasının Ötesinde Bu Neden Önemli?
Bölüm, yapay zeka endüstrisinin ilerlemeyi değerlendirme biçimini yeniden şekillendiren bir gerilimin altını çiziyor. Modeller, bağımsız sistemler yerine zengin özelliklere sahip API'ler aracılığıyla giderek daha fazla dağıtıldıkça, bir modelin doğal yeteneği ile etrafındaki mühendislik arasındaki çizgi bulanıklaşmaya devam ediyor. Yapı iskelesini göz ardı eden bir kıyaslama, gerçek dünya performansını olduğundan düşük gösterebilir; bunu benimseyen bir şirket, testi oynadıkları için şirketleri ödüllendirebilir.
ARC-AGI-3 tartışmasının son olması pek olası değil. Sınır modelleri, belirlenmiş kriterlerin en üst sıralarında kümelendikçe, neyin adil bir ölçüm olarak kabul edildiği ve kimin emniyet kemerinin standardı belirleyeceği konusundaki anlaşmazlıklar daha da yoğunlaşacak.
Yapay Zekanın Önünde Olun
Modeller, kıyaslamalar ve bunları oluşturan laboratuvarlar hakkındaki son dakika yapay zeka haberlerini takip etmek ister misiniz? AI Buzz Wire yanınızda.
Daha fazla AI haberini okuyun