OpenAI'nin GPT-6 Astra'sı rekoruna sıra dışı bir ödül daha ekledi: Valve'ın ikonik birinci şahıs bilinmez Portalı'nın tam oynanışı, 24 saatten kısa bir sürede otonom olarak tamamlandı ve toplam hesaplama maliyeti 571,18 Dolar oldu. Verge, 6 Eylül 2026'da bu dönüm noktasını bildirdi ve ön modeli oyuna bağlayan ve gerisini onun halletmesine izin veren, cosyblaze olarak bilinen bir kullanıcıya itibar etti.

Portal, yaşına rağmen bir yapay zeka ajanı için zorlu bir sınavdır. Valve tarafından 2007'de piyasaya sürülen oyun, oyuncuların bir portal silahı kullanarak mekansal bulmacalar hakkında akıl yürütmesini gerektiriyor; bu, rutin olarak sezgilere meydan okuyan test odalarından geçmek için duvarlarda, zeminlerde ve tavanlarda bağlantılı açıklıklar yaratıyor. Dayanılacak bir savaş eziyeti ve takip edilecek bir görev işareti yok; her oda aslında bir fizik bilmecesidir. Sınır modellerinin nasıl stres testine tabi tutulduğunu takip eden okuyucular için bu çalışma, Yapay Zeka geliştirme haberimiz için canlı bir giriş niteliğindedir.

Demo Videolardan Tam Tamamlanmaya

Koşu birdenbire ortaya çıkmadı. 6 Eylül'ün başlarında, GPT-6 Astra'nın Portal'ı oynadığını gösteren bir YouTube videosu Hacker News'te yayınlandı ve modelin oyunu "otonom olarak tamamladığını" belirten bir takip gönderisi gün geçtikçe dikkatleri üzerine çekti. Verge'nin raporu ayrıntıları doğruladı: Oyunun tamamı, 24 saatten kısa bir sürede, hesaplamada 600 dolardan daha az bir ücret karşılığında tamamlandı ve şüpheciler için oyunun yoğunlaştırılmış bir videosu yayınlandı.

Verge, tasarının çevresel boyutunu hesaplamaktan kendini alamadı ve bu koşunun veri merkezi soğutmasında muhtemelen küçük bir yüzme havuzunun suyu kadar su tükettiğini belirtti. Bu, ajanslı oyun yayınlarının kullanıcı için ucuz, ancak gezegen için ücretsiz olmadığının alaycı bir hatırlatıcısıdır.

2007'nin Bilmecesi Neden Ciddi Bir Karşılaştırmadır

Beating Portal, ARC-AGI veya SWE-bench gibi planlanmış bir kıyaslama değildir ve kısmen yankı bulmasının nedeni de budur. Oyun, tarihsel olarak insanları yapay zeka sistemlerinden ayıran becerileri tam olarak gerektiriyor:

  • Uzaysal akıl yürütme. Çözümler, bir portal çıkışının oyuncunun vücudunu nereye fırlatacağını tahmin etmeyi gerektirir; bu, ajanları yıllardır tuzağa düşüren üç boyutlu fizik akıl yürütmesidir.
  • Uzun ufuklu planlama. Odalar birden fazla adımı zincirler; Son adımın başarısız olması genellikle sıranın baştan tekrarlanması anlamına gelir.
  • El ele tutuşmadan başarısızlıktan ders almak. Hiçbir ipucu yok. Temsilci, deneme yanılma yoluyla oyunun kurallarını çıkarmalı ve ardından bunları yeni odalara genelleştirmelidir.

Bu yılın başlarında, OpenAI'nin GPT-6 Astra'sı, etkensel muhakemeye odaklanan ARC-AGI-3 kriterlerini geride bıraktı ve model, bilgisayar kullanım yetenekleri, yani yazılım arayüzlerini bir kişinin yapacağı gibi çalıştırma yeteneği açısından dikkatleri üzerine çekti. Portal koşusu aynı becerilerin eğlenceli ama gerçek bir gösterimidir: algı, planlama ve kontrol, insan müdahalesi olmadan saatlerce gerçekleştirilir.

Daha Geniş Bir Dalganın Parçası

Bu koşu aynı zamanda yapay zeka oyunlarının 2026'da geldiği noktanın da bir işareti. Karşılaştırma puanları artık kültürel kilometre taşlarıyla aynı alanı paylaşıyor: Bach koroları oluşturan modeller, el yazısı düzeltme tanıma testlerini geçen modeller ve bir zamanlar "bilgisayarlar bunu asla yapmayacak" ifadesinin yerine geçen oyunları tamamlayan modeller. Her geçiş eski bir kesinliği ortadan kaldırır ve bir sonraki geçişin ne olacağı sorusunu gündeme getirir.

Bunun pratik sonuçları da var. Cozyblaze'in kurulumunun Portal'ı yönlendirmesine olanak tanıyan döngünün aynısı (birkaç yüz dolarlık bir maliyetle ekran görüntülerinin alınması, kararların verilmesi) yazılım testi, robot teknolojisi ve bilgisayar kullanım asistanları için üretilen döngüdür. Tam bir oyun deneyimi için oyunun fiziğini akılda tutabilen bir model, prensipte, daha kısa bağlamlı sistemleri yenen uzun, karmaşık yazılım görevlerini yerine getirebilen bir modeldir.

Ancak şimdilik çözüm daha basit. Bir yapay zeka, oyun dünyasının en sevilen bulmacalarından birini, yaklaşık yeni bir GPU depozitosu fiyatına baştan sona yendi ve videoyu yayınladı. Aperture Science'ın test odaları insanların kendilerini akıllı hissetmelerini sağlamak için tasarlandı. Bu hafta sonu bir modelin akıcı görünmesini sağladılar.

Koşu Nasıl Karşılandı?

Yanıt, genel olarak AI oyunlarındaki dönüm noktalarını takip etti: önce inanmama, sonra video, sonra kabul etme. Hacker News'te bu çalışma, kurulumun nasıl çalıştığını ve bunun ajansal yapay zeka hakkında ne ifade ettiğini anlatan sürekli bir yorumcu akınına yol açtı; birçoğu, toplam faturanın, birçok kişinin böyle bir çalışmanın maliyetinin tahmin ettiğinden daha düşük olduğunu belirtti. Tamamlamanın özet videosu, şüphecilere iddiayı kendilerinin doğrulaması için bir yol verdi; bu, çoğu kıyaslama sonucunun sunduğundan daha fazlasıdır.

Aynı zamanda daha önce gelen kilometre taşları ile karşılaştırmayı da davet etti. Oyun, masa oyunlarından gerçek zamanlı stratejiye ve açık uçlu sanal alanlara kadar onlarca yıldır alanın halka açık deneme alanı olarak hizmet etti. Ne zaman bir oyun başarısız olsa, argüman değişiyor: Günümüzün şüphecileri, bu başarının dar kapsamlı, uzmanlaşmış veya genelleştirilemeyecek bir şekilde uzmanlaşmış olduğu konusunda ısrar ediyor. Portal'ın bu tarih içinde çalışmasını dikkate değer kılan şey, kurulumun ne kadar sıradan olduğuydu: oyun için özel olarak eğitilmiş özel bir araştırma sistemi yerine, ticari olarak satılan bir sınır modeli, bir tüketici oyunu ve birkaç yüz dolarlık bilgi işlem.

---

Yapay Zekanın Önünde Olun

En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →