TypeSafe AI girişiminin yüksek lisans dışı "karar modeli" olan Jev, projenin web sitesine göre, Pallet Town'dan Hall of Fame'e 37 saat 40 dakikalık bir oyun süresinde yaklaşık 1,65 $ toplam hesaplama maliyetiyle savaşarak Pokémon Red'i tamamladı.

Geliştirici Christian Mathiesen tarafından oluşturulan çalışma, belirteçler ve maliyetler sergilenerek canlı olarak yayınlandı ve GitHub'da açık kaynaklı olarak yayınlandı. Hafta sonu Hacker News'in ön sayfasına çıktı, yüzlerce olumlu oy aldı ve yapay zeka ajanlarının geleceği hakkında neler söylediğine dair canlı bir tartışma yaşandı. Tom's Hardware bu başarıyı aktardı ve geleneksel sohbet robotlarının aylarca durduğu yerde LLM olmayan bir motorun başarılı olduğunu ve Claude Opus 5'in modele çıkmaz sokaklarda koçluk yaptığını belirtti.

Sayılarla Koşu

Projenin kendi takibinden elde edilen istatistikler, bu çalışmanın bir yapay zeka sistemi için ne kadar sıra dışı olduğunu gösteriyor:

  • Toplam süre: 37 saat 40 dakika
  • Alınan kararlar: 16.150
  • Giriş jetonları: yaklaşık 39,2 milyon
  • Toplam Jev maliyeti: yaklaşık 1,65$
  • Tipik karar süresi: 0,4 saniye
  • Rakiplerin savaştığı sayı: yaklaşık 1.660
  • Takım silmeleri: 16
  • Elit Dört deneme: 15
  • En zorlu bölüm: Zafer Yolu

Son Hall of Fame takımı: 83. seviyedeki Charizard, Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) ve Primeape (29) tarafından destekleniyor.

Ekonomi manşet oldu. Bir kahve fiyatından daha ucuza verilen on altı bin karar, uzun oturumlarda onlarca doları token olarak harcayabilen LLM tabanlı oyun oynama acenteleriyle çarpıcı bir tezat oluşturuyor. Mathiesen, Jev'in hızlı karar verebileceği ancak henüz Doom oynayacak kadar hızlı olmadığı sonucuna vardıktan sonra Pokémon'u seçtiğini söyledi.

Pokémon Red Yapay Zeka İçin Neden Zor?

Pokémon Red, ajan yapay zeka için beklenmedik bir referans noktası haline geldi. 1996 Game Boy klasiği, uzun ufuklu bir planlama gerektirir: Seviyeleri aşmak, altı kişilik bir grubu yönetmek, labirent benzeri mağaralarda haritasız gezinmek ve önemli bir öğe kaçırıldığında geriye doğru iz sürmek. Dil modeli ajanları tarihsel olarak çevrelerde dolaşmış, mağaralarda sıkışıp kalmış ve gereksiz eylemlere muazzam bütçeler harcamıştır.

Jev temelde farklı bir yaklaşım benimsiyor. Model, metin üretmek yerine doğrudan kalibre edilmiş kararları döndürür; TypeSafe AI'nin büyük modellerin kasıtlı, dil ağırlıklı akıl yürütmesine "Sistem Bir" alternatifi olarak pazarladığı bir tasarım. Tom's Hardware'in modelle ilgili daha önceki haberine göre şirket, Jev'in karar görevlerinde LLM alternatiflerinden yaklaşık 193 kat daha hızlı ve 445 kat daha ucuz olduğunu iddia ediyor.

Geliştiricinin kabul ettiği asıl nokta, Jev'in yardıma ihtiyacı olduğuydu. Tom's Hardware'e göre Claude Opus 5, karar modeline çıkmaz sokaklar üzerinden koçluk yaptı; bu, büyük bir dil modelinin stratejik rehberlik sağladığı, hızlı ve ucuz modelin ise binlerce bireysel kararı yürüttüğü hibrit bir yaklaşımdı. Proje sayfası alaycı bir şekilde Jev'in "sadece bir rehber olduğu için bundan sonra nereye gideceğini bildiğini" belirtiyor.

Yapay Zeka Aracıları İçin Ne İfade Ediyor?

Sonuç, yapay zeka ajanlarının geleceğinin her şeyi yapan dev bir model değil, bir iş bölümü olduğu yönünde büyüyen bir argümanın veri noktasıdır: yüksek frekanslı kararları ele alan hızlı, ucuz, uzmanlaşmış modeller ve daha yavaş akıl yürütme modellerinin yalnızca durum belirsizleştiğinde devreye girmesi.

Robotik, oyun ve gerçek zamanlı kontrol sistemleri (kararların milisaniyeler içinde ulaşması gereken ve bütçelerin sentlerle ölçüldüğü alanlar) için bu mimari çekicidir. Bir depo robotu, oyun oynayan bir NPC veya bir ticaret sistemi, her mikro eylem için 2 saniyelik GPT tarzı gidiş-dönüş yolculuğunu karşılayamaz.

Hacker News'e şüpheyle yaklaşanlar oyunun uyarılarına dikkat çekti: Oyun onlarca yıllık ve kapsamlı bir şekilde belgelendi, koçluk modeli stratejik olarak ağır yükü kaldırdı ve 15 Elit Dört deneme bol miktarda deneme yanılma olduğunu gösteriyor. Bunlar haklı noktalar ama daha ilginç sinyali kaçırıyorlar. Her biri 0,0001 ABD Doları tutarındaki on altı bin iyi karar, otonom temsilcilerin geniş ölçekte çalışacaklarsa ihtiyaç duyduğu maliyet profilinin tam olarak karşılığıdır.

Eski bir OpenAI RLHF araştırmacısı tarafından kurulan TypeSafe AI, Jev'i dil modellerinin yerine geçmekten ziyade tamamlayıcısı olarak konumlandırdı. Pokémon projesi (tüm halka açık kod, yayın ve maliyet dökümü), öncelikli karar yığınının neler yapabileceğinin şimdiye kadarki en canlı gösterimidir.

Kaynak kodunun tamamı GitHub'da mevcuttur ve tamamlanan çalışma, Victory Road'daki tüm silme işlemleri de dahil olmak üzere YouTube'da izlenebilir.

Yapay Zekanın Önünde Olun

En son yapay zeka gelişmeleri için AI Buzz Wire'ı takip edin.

Daha fazla AI haberini okuyun →