Bağımsız kıyaslama firması Artificial Analysis'e göre OpenAI, GPT-6.1 Sol'u 29 Eylül'de piyasaya sürdü ve GPT-6 Sol'u, modelin ilk çıkışından sadece yedi gün sonra kullanımdan kaldırdı. Takas, CNET'in katılımcıların yeni başlatılan Dots aracıları ve bir dizi abonelik değişikliğinin yanı sıra GPT-6.1 Sol'u hemen kullanmaya başlayabileceklerini bildirdiği şirketin DevDay geliştirici konferansıyla aynı zamana denk geldi.
Yedi günlük amiral gemisinden amiral gemisine geçiş, 2026'nın hızlandırılmış standartlarına göre bile alışılmadık bir durum ve kıyaslamalar OpenAI'nin neden hızlı hareket ettiğini gösteriyor. Model lansmanları, kıyaslama kavgaları ve bunların altındaki fiyat savaşları hakkında sürekli bilgi edinmek için AI Buzz Wire, önemli olan gelişmeleri gerçekleştikleri anda takip ediyor.
Yedi günde ölçülebilir bir sıçrama
Yapay Analiz, GPT-6.1 Sol'un firmanın Zeka Endeksi'nde GPT-6 Sol'a göre 4 puan, GPT-5.6 Sol'a göre ise 5 puan kazanarak OpenAI'nin en yetenekli modeli olan GPT-6 Astra'nın sadece 1 puan altına indiğini bildirdi. Firmanın değerlendirmesi akıl yürütmeyi, bilgi çalışmasını, matematik ve eylemli görevleri tek bir karşılaştırmalı puanda harmanlıyor.
Alt puanlar kazanımların nerede yoğunlaştığını gösteriyor. GPT-6.1 Sol, AA-Briefcase v1.1'de 4 puan ve GDPval-AA v2.1'de 5 puan iyileştirdi; bunların her ikisi de etkin bilginin işe yaradığını test ediyor. Terminal-Bench 4.0'daki 12 puanlık artış, gerçek terminal ortamlarında maddi olarak daha iyi performansa işaret ederken, Humanity's Last Exam 5 puan ve GDP.pdf 6 puan yükseldi.
Araştırma için modelleri kullanan herkesin dikkatini çeken bir rakam var: AA-Omniscience'ın doğruluğu 8 puan artarken halüsinasyon oranı yüzde 60'tan yüzde 54'e düştü. Her iki rakam da mutlak anlamda yüksek olmaya devam ediyor, ancak kendinden emin bir yanlış cevabın hiç cevap vermemekten daha kötü olduğu iş akışları için seyahatin yönü önemlidir.
Aynı etiket fiyatı, pratikte daha ucuz
Fiyatlandırma konusunda, GPT-6.1 Sol, GPT-6 Sol'un ücret listesini milyon giriş jetonu başına 2 ABD doları ve milyon çıkış jetonu başına 10 ABD doları olarak tutuyor ancak önbellek okuma indirimi yüzde 90'dan yüzde 95'e çıkıyor. Yapay Analiz, GPT-6.1 Sol'un ajansal iş yükleri için karma fiyatının bu nedenle GPT-6 Sol'unkinden biraz daha düşük olduğunu ve bu durumun GPT-6 Sol'un GPT-5.6 Sol'a göre yüzde 50 indirimle piyasaya sürülmesiyle başlayan etkili fiyat indirimleri serisini genişlettiğini belirtiyor.
Fiyatlandırma yörüngesi buradaki gerçek hikayedir. İki sürüm arasında OpenAI, orta seviye sınır hattının etkin maliyetini iki kez kabaca yarıya indirirken, her seferinde kaliteyi yukarı doğru itti.
Görev başına maliyet: 0,72 ABD dolarına karşılık 3,26 ABD doları
Görev başına maliyet, GPT-6 Astra ile arasındaki farkın belirginleştiği noktadır. Yapay Analiz, maksimum çabayla GPT-6.1 Sol'u İstihbarat Endeksi görevi başına 0,72 ABD dolarına sabitliyor; bu, GPT-6 Astra'nın 3,26 ABD dolarının dörtte birinden daha az. Önceki modele göre tasarruf yüzde 31 (GPT-6 Sol için 1,05 dolar) ve GPT-5,6 Sol ile karşılaştırıldığında yüzde 64'e (1,99 dolar) ulaşıyor.
Firmaya göre, GPT-6.1 Sol'un her çaba seviyesi maliyet verimliliği Pareto sınırını zorluyor; bu da belirli bir zeka seviyesi için takip ettiği modeller arasında daha ucuz bir seçeneğin bulunmadığı anlamına geliyor. Token verimliliği tablosu daha karışık: GPT-6.1 Sol, çaba seviyeleri genelinde GPT-6 Sol'a kıyasla kabaca yüzde 10 ila 30 daha fazla çıktı tokeni tüketiyor, ancak düşük ve orta efor ayarları, yüksek zeka hesaba katıldığında token verimliliği için Pareto-optimum olmaya devam ediyor. Kodlamada model, firmanın Kodlama Aracısı Endeksi'nde maksimum çabayla GPT-6 Sol'a göre 3 puan kazandı.
Yedi günlük geri dönüş neden önemlidir?
DevDay'in daha geniş listesi aynı tabloyu güçlendiriyor. CNET'in raporu, konferansın çerçevesini uzak bir araştırma önizlemesi yerine geliştiricilerin hemen kullanabileceği üç şey (GPT-6.1 Sol, Dots aracıları ve yeniden işlenmiş abonelik planları) etrafında çerçeveledi. Geliştiricilere verilen mesaj, yarınki olasılık değil, bugün kullanılabilirlikti.
Amiral gemisi kadansları, rekabet kısıtlamasının eğitim çalışmalarından eğitim sonrası iyileştirme ve altyapı hizmetine kaydığını gösteren bu kısa sinyali veriyor. Bir hafta içinde gönderilen puan düzeyindeki yükseltme, sıfırdan temel modelden ziyade optimize edilmiş bir kontrol noktasına ve yeni bir fiyat tablosuna benziyor ve rakipler de aynı şekilde davranıyor: Google, 30 Eylül'de, Fairwind Programı aracılığıyla güvenilir siber savunuculara aynı milyon token başına 2 ABD Doları/10 ABD Doları oranında ulaşan bir sınır modeli olan Gemini 4 Argon'u duyurdu.
Geliştiriciler için, doğrulanan rakamlardan üç pratik sonuç çıkıyor. İlk olarak, yoğun önbellek yeniden kullanımına sahip aracılı iş yükleri, yüzde 95'lik önbellek indiriminden anında yararlanır. İkincisi, model daha uzun süre düşünse bile token başına fiyat değişmediğinden, bütçelerin geçişten önce daha yüksek çıktı token tüketimini modellemesi gerekir. Üçüncüsü, Astra, son istihbarat noktasının 4 kat maliyet primi değerinde olduğu görevler için tavan olmaya devam ediyor; GPT-6.1 Sol'un durumu çoğu iş için öyle değil.
Tekrarlamaya değer bir uyarı: Bu rakamlar, metodolojisi ne kadar titiz olursa olsun, tek bir bağımsız değerlendiriciden gelmektedir ve endeks puanları belirli iş yükü karışımlarını ödüllendirmektedir. Zorlu iş yüklerine sahip ekipler, üretim trafiğini yeniden yönlendirmeden önce kendi değerlendirmelerini yeniden çalıştırmalıdır.
---
Yapay Zekanın Önünde OlunEn son yapay zeka haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →