Kıyaslama firması Yapay Analiz, 4 Eylül 2026'da İstihbarat Endeksi'nin 4.2 sürümünü yayınladı. Bu sürüm, sınırdaki yapay zeka modellerinin nasıl ölçüldüğünü yeniden düzenleyen geçici bir güncellemedir. Yeni liderlik tablosuna göre, Anthropic'in Claude Fable 5.1'i en üst sırada yer alırken, OpenAI'nin GPT-6 Astra'sı, GPT-5.6 Sol'a göre dört puanlık bir artışla ikinci sırada yer alıyor.
Güncelleme, Index v4'ün Ocak ayında piyasaya sürülmesinden sadece sekiz ay sonra geldi; bu, firmanın son sınır sürümlerinin hızına atfettiği alışılmadık derecede hızlı bir geri dönüş. Şirket duyurusunda, "Geçtiğimiz haftalarda sınır çok hızlı hareket ederken, Endeksimizin her zamanki gibi güncel ve yararlı kalmasını sağlamak için acil bir ara güncelleme sunmanın önemli olduğunu düşünüyoruz" diye yazdı.
Başlık sıralaması
Yayınlanan sonuçlara göre Anthropic'in Claude Fable 5.1'i Endeksin başında yer alırken, onu GPT-5.6 Sol'a göre dört puan artışla OpenAI'nin GPT-6 Astra takip ediyor. Meta, sıralamada üçüncü en güçlü laboratuvar olarak yer alıyor ve onu SpaceXAI, Moonshot/Kimi, Z.AI ve Google takip ediyor.
Anthropic ve OpenAI de güncellenmiş maliyet verimliliği resmini paylaşıyor: Meta ve Z.AI ile birlikte iki şirket, Endeksin "Görev Başına Maliyet" Pareto sınırını işgal ediyor; bu, şu anda başka hiçbir laboratuvarın tamamlanan görev başına aynı fiyata kesinlikle daha iyi zeka sunmadığı anlamına geliyor.
Jeton verimliliği konusunda Yapay Analiz, GPT-6 Astra'nın "istihbarat sınırına yakın hemen hemen tüm diğer modellerden daha verimli" olduğunu ve Claude Fable 5.1, Grok 4.5 ve Gemini 3.5 Flash-Lite'ın eğrinin her iki ucunda yer aldığını buldu. Bununla birlikte firma, tamamlayıcı bir analizde Astra'nın düşük token kullanımının yüksek fiyatlar tarafından ağır bastığını belirtti; bu da ham verimlilik ve toplam maliyetin her zaman birlikte hareket etmediğini hatırlatıyor.
v4.2'de neler değişti
En önemli yapısal değişiklik, kıyaslama oyunlarına karşı kasıtlı bir baskıdır. Endeksin ağırlığının yüzde kırkı artık özel, uzun süreli test setlerinden geliyor (v4.1'deki payın iki katı), AA-Briefcase, AA-Omniscience ve CritPt çözümleri de dahil. Firma bu rakamın Index v5'te daha da artacağını söyledi.
Güncellemeyi destekleyen iki yeni değerlendirme:
- AA-Evrak Çantası, özel bir test seti ile şirket içi temsilcilik bilgi çalışması kıyaslaması. Modeller, her biri çok sayıda bağlantılı görev ve binlerce girdi kaynağı dosyası içeren çok haftalık profesyonel projeler üzerinde değerlendirilir ve doğrulanabilir görev başarısını, analitik kaliteyi ve sunum kalitesini kapsayan değerlendirme listesi puanlaması ve ikili karşılaştırma kombinasyonu yoluyla derecelendirilir.
- GDP.pdf, profesyonel belgeler genelinde tek dönüşlü akıl yürütmeyi test eden Surge AI tarafından oluşturulmuştur: 4.592 sayfalık metin, tablo, grafik ve dipnotlara dağıtılmış kanıtlarla birlikte, on alanı kapsayan 100 PDF. Yanıtlar, uzmanların yazdığı 1.275 atomik kritere göre derecelendirilir ve Tüm Geçiş Oranı başlığı, yalnızca her kriter karşılandığında bir göreve kredi verir.
Uzun süredir devam eden bir kriter kullanımdan kalkıyor: Lisansüstü seviyedeki bilimsel muhakeme testi olan GPQA Diamond, sınır modelleri tarafından etkili bir şekilde doyurulduğu için kaldırıldı.
Firma aynı zamanda derecelendirme altyapısını da yükselterek yeni bir derecelendirme sistemi istemi ve düzeltilmiş cevap anahtarlarıyla AA-LCR v1.1'i piyasaya sürdü, GDPval-AA v2 ve AA-Briefcase için Elo ölçeğini yeniden sabitleyerek yeni modeller geldikçe derecelendirmelerin sabit kalmasını sağladı ve yavaş ama doğru kodun artık başarısızlık olarak sayılmaması için SciCode'un derecelendirme sanal alanlarını güçlendirdi.
Yeni testler neyi ortaya koyuyor?
Yeni değerlendirmelerin sonuçları, sınır laboratuvarlarının gerçekte nerede durduğuna dair daha ayrıntılı bir resim sunuyor.
AA-Briefcase'de Anthropic'in Claude Fable 5.1 ve Opus 5'i önde, ardından OpenAI'nin GPT-6 Astra'sı ve Meta'nın Muse Spark 1.3'ü geliyor. GPT-6 Astra, aynı değerlendirmede GPT-5.6 Sol'un kabaca 85 Elo puanı üzerinde puan alıyor; bu, birbirini izleyen OpenAI nesilleri arasında önemli bir sıçrama.
GDP.pdf'de tablo tersine dönüyor: OpenAI %33,2 Tüm Geçiş Oranıyla GPT-6 Astra ile önde, onu %28,2 ile GPT-5,6 Sol ve %26,2 ile Claude Fable 5.1 izliyor. Farklılık, Anthropic'in modelleri genel Endeks ve aracılı çalışma görevlerine öncülük etse bile, çok geniş bağlamlarda uzun belge sentezinin OpenAI'nin en yeni modeli için göreceli bir güç olmaya devam ettiğini gösteriyor.
Özel test setleri neden önemlidir?
Uzatılmış değerlendirmeye doğru kayma, yapay zeka kıyaslamasında daha geniş bir güvenilirlik sorununu yansıtıyor. Modeller daha fazla halka açık test verisi tükettikçe, laboratuvarlar ve bağımsız gözlemciler, iyi bilinen kıyaslamalardaki manşet puanlarının gerçek yetenekten ziyade ezberlemeyi veya hedeflenen eğitimi yansıttığı konusunda giderek daha fazla endişe duymaya başladı. Yapay Analiz, test setlerinin giderek artan bir kısmını özel tutarak ve bunlara daha fazla ağırlık vererek, herkese açık skor tablolarının kaybetmekte olduğu sinyalini korumaya çalışıyor.
Firma, Index v5'in unsurlarını "aylardır" oluşturduğunu ve son dönemdeki büyük model lansmanları sırasında Endeksi sabit tutmak için güncellemeleri kasıtlı olarak ertelediğini söyledi. Geçici v4.2 sürümünün ötesinde, v5 geçişini tamamlarken yakın gelecekte daha fazla artımlı güncelleme planlamaktadır.
Sınır modeller arasında seçim yapan alıcılar için v4.2'nin pratik çıkarımı, pazarın zirvesinin Anthropic ve OpenAI arasında iki atlı bir yarış olarak kalması ve Meta'nın aradaki farkı kapatması ve oyunlara dirençli olacak şekilde tasarlanan değerlendirmelerin artık sıralama çalışmasını daha fazla yapmasıdır. Model seçimi kararlarını takip eden kullanıcılar, v5'in kullanıma sunulması yaklaştıkça en son yapay zeka gelişmelerini takip edebilir.
Yapay Zekanın Önünde Olun
Bunun gibi kıyaslama güncellemeleri, sektörün ilerlemeyi nasıl değerlendirdiğini yeniden şekillendiriyor. Daha fazla AI haberini okuyun ve piyasaya sürülen her modelden bir adım önde olun.
Daha fazla AI haberini okuyun →