Jev, "model keputusan" non-LLM dari startup TypeSafe AI, telah menyelesaikan Pokémon Red — berjuang dari Pallet Town ke Hall of Fame dalam waktu bermain 37 jam 40 menit dengan total biaya komputasi sekitar $1,65, menurut situs web proyek.

Prosesnya, yang dibuat oleh pengembang Christian Mathiesen, disiarkan langsung dengan token dan biaya yang dipajang dan bersumber terbuka di GitHub. Artikel ini muncul di halaman depan Hacker News pada akhir pekan, menarik ratusan suara positif dan diskusi yang meriah tentang apa yang dikatakannya tentang masa depan agen AI. Tom's Hardware meliput pencapaian tersebut, mencatat bahwa mesin non-LLM berhasil ketika chatbot tradisional terhenti selama berbulan-bulan — dan bahwa Claude Opus 5 melatih model tersebut melalui jalan buntu.

Jalankan dengan Angka

Statistik dari pelacakan proyek sendiri menunjukkan betapa tidak lazimnya proses ini untuk sistem AI:

  • Total waktu: 37 jam, 40 menit
  • Keputusan yang diambil: 16.150
  • Token masukan: sekitar 39,2 juta
  • Total biaya Jev: sekitar $1,65
  • Waktu pengambilan keputusan umum: 0,4 detik
  • Lawan yang bertarung: sekitar 1.660
  • Tisu basah tim: 16
  • Percobaan Elite Empat: 15
  • Regangan terberat: Victory Road

Tim Hall of Fame terakhir: Charizard di level 83, didukung oleh Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39), dan Primeape (29).

Ekonomi adalah berita utama. Enam belas ribu keputusan dengan harga kurang dari harga kopi sangat kontras dengan agen permainan berbasis LLM, yang dapat menghabiskan puluhan dolar token dalam sesi yang panjang. Mathiesen mengatakan dia memilih Pokémon setelah menyimpulkan bahwa Jev dapat memutuskan dengan cepat, tetapi belum cukup cepat untuk memainkan Doom.

Mengapa Pokémon Red Sulit untuk AI

Pokémon Red telah menjadi tolok ukur yang tidak terduga untuk AI agen. Game Boy klasik tahun 1996 menuntut perencanaan jangka panjang: menggiling level, mengelola pesta beranggotakan enam orang, menavigasi gua seperti labirin tanpa peta, dan mundur ketika ada item penting yang terlewat. Agen model bahasa secara historis berkeliaran, terjebak di gua, dan menghabiskan anggaran yang sangat besar untuk tindakan yang berlebihan.

Jev mengambil pendekatan yang berbeda secara fundamental. Daripada menghasilkan teks, model ini mengembalikan keputusan yang dikalibrasi secara langsung — sebuah desain yang dipasarkan oleh TypeSafe AI sebagai alternatif "Sistem Satu" terhadap penalaran model besar yang disengaja dan banyak bahasa. Menurut cakupan model Tom's Hardware sebelumnya, perusahaan mengklaim Jev kira-kira 193 kali lebih cepat dan 445 kali lebih murah dibandingkan alternatif LLM dalam tugas pengambilan keputusan.

Tangkapannya, pengembang mengakui, adalah bahwa Jev membutuhkan bantuan. Menurut Tom's Hardware, Claude Opus 5 melatih model keputusan melalui jalan buntu - pendekatan hibrid di mana model bahasa besar memberikan panduan strategis sementara model yang cepat dan murah mengeksekusi ribuan keputusan individual. Halaman proyek dengan masam mencatat bahwa Jev "hanya tahu ke mana harus pergi selanjutnya karena memiliki panduan."

Apa Artinya bagi Agen AI

Hasilnya adalah titik data dalam argumen yang berkembang bahwa masa depan agen AI bukanlah model raksasa yang melakukan segalanya, namun pembagian kerja: model yang cepat, murah, dan terspesialisasi yang menangani keputusan berfrekuensi tinggi, dengan model penalaran yang lebih lambat hanya akan bertindak ketika situasi menjadi ambigu.

Untuk robotika, game, dan sistem kontrol real-time – domain di mana keputusan harus diambil dalam hitungan milidetik dan anggaran diukur dalam sen – arsitektur tersebut menarik. Robot gudang, NPC yang bermain game, atau sistem perdagangan tidak mampu melakukan perjalanan bolak-balik gaya GPT selama 2 detik untuk setiap tindakan mikro.

Mereka yang skeptis terhadap Hacker News menunjukkan kekurangan dari permainan ini: permainan ini sudah berusia puluhan tahun dan didokumentasikan secara menyeluruh, model pelatihan melakukan tugas berat yang strategis, dan 15 percobaan Elite Four menunjukkan banyak percobaan dan kesalahan. Itu adalah poin yang wajar – tetapi mereka kehilangan sinyal yang lebih menarik. Enam belas ribu keputusan bagus dengan harga masing-masing $0,0001 adalah profil biaya yang dibutuhkan agen otonom agar dapat dijalankan dalam skala besar.

TypeSafe AI, yang didirikan oleh mantan peneliti OpenAI RLHF, memposisikan Jev sebagai pelengkap model bahasa, bukan pengganti. Proyek Pokémon - kode, aliran, dan perincian biaya yang bersifat publik - adalah demonstrasi paling jelas tentang apa yang dapat dilakukan oleh tumpukan pengambilan keputusan.

Kode sumber lengkap tersedia di GitHub, dan proses yang telah selesai dapat ditonton di YouTube, termasuk setiap penghapusan di Victory Road.

Tetap Terdepan dalam AI

Ikuti AI Buzz Wire untuk mengetahui perkembangan AI terkini.

Baca berita AI selengkapnya →