Jev, "model keputusan" bukan LLM dari permulaan TypeSafe AI, telah menyelesaikan Pokémon Red — berjuang dari Pallet Town ke Hall of Fame dalam masa 37 jam dan 40 minit permainan dengan jumlah kos pengiraan kira-kira $1.65, menurut laman web projek itu.
Larian, yang dibina oleh pembangun Christian Mathiesen, telah distrim secara langsung dengan token dan kos yang dipamerkan dan sumber terbuka di GitHub. Ia muncul di muka depan Berita Hacker pada hujung minggu, menarik ratusan undian positif dan perbincangan yang meriah tentang apa yang dikatakan tentang masa depan ejen AI. Perkakasan Tom merangkumi pencapaian itu, dengan menyatakan bahawa enjin bukan LLM berjaya di mana chatbot tradisional telah terhenti selama berbulan-bulan — dan Claude Opus 5 melatih model itu melalui jalan buntunya.
Larian oleh Nombor
Statistik daripada penjejakan projek itu sendiri menunjukkan betapa luar biasa larian ini untuk sistem AI:
- Jumlah masa: 37 jam, 40 minit
- Keputusan dibuat: 16,150
- Token input: kira-kira 39.2 juta
- Jumlah kos Jev: kira-kira $1.65
- Masa keputusan biasa: 0.4 saat
- Lawan bertarung: lebih kurang 1,660
- Lap pasukan: 16
- Percubaan Elit Empat: 15
- Regangan paling sukar: Jalan Kemenangan
Pasukan Hall of Fame terakhir: Charizard pada tahap 83, disokong oleh Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39), dan Primeape (29).
Ekonomi adalah tajuk utama. Enam belas ribu keputusan dengan harga kurang daripada harga kopi adalah berbeza dengan ejen permainan berasaskan LLM, yang boleh mencecah puluhan dolar dalam token sepanjang sesi yang panjang. Mathiesen berkata dia memilih Pokémon selepas membuat kesimpulan bahawa Jev boleh membuat keputusan dengan cepat, tetapi belum cukup cepat untuk bermain Doom.
Mengapa Pokémon Red Sukar untuk AI
Pokémon Red telah menjadi penanda aras yang tidak mungkin untuk AI agen. Klasik Game Boy 1996 menuntut perancangan jangka panjang: tahap pengisaran, menguruskan enam parti, menavigasi gua seperti labirin tanpa peta, dan menjejak ke belakang apabila item utama terlepas. Ejen model bahasa secara sejarah telah mengembara dalam kalangan, terperangkap dalam gua dan menghabiskan belanjawan yang besar untuk tindakan yang berlebihan.
Jev mengambil pendekatan yang berbeza secara asasnya. Daripada menjana teks, model ini mengembalikan keputusan yang ditentukur secara langsung — reka bentuk TypeSafe AI telah dipasarkan sebagai alternatif "Sistem Satu" kepada penaakulan berat bahasa yang disengajakan bagi model besar. Menurut liputan awal Tom's Hardware mengenai model itu, syarikat itu mendakwa Jev adalah kira-kira 193 kali lebih pantas dan 445 kali lebih murah daripada alternatif LLM dalam tugas keputusan.
Tangkapan, pemaju mengakui, ialah Jev memerlukan bantuan. Perkakasan Per Tom, Claude Opus 5 melatih model keputusan melalui jalan buntu — pendekatan hibrid di mana model bahasa yang besar menyediakan panduan strategik manakala model yang pantas dan murah melaksanakan beribu-ribu keputusan individu. Halaman projek dengan kecut menyatakan bahawa Jev "hanya tahu ke mana hendak pergi seterusnya kerana ia mempunyai panduan."
Maksudnya untuk Ejen AI
Hasilnya ialah titik data dalam hujah yang semakin berkembang bahawa masa depan ejen AI bukanlah satu model gergasi yang melakukan segala-galanya, tetapi pembahagian kerja: model yang pantas, murah, khusus yang mengendalikan keputusan frekuensi tinggi, dengan model penaakulan yang lebih perlahan hanya melangkah apabila keadaan menjadi samar-samar.
Untuk robotik, permainan dan sistem kawalan masa nyata — domain yang keputusan mesti tiba dalam milisaat dan belanjawan diukur dalam sen — seni bina itu menarik. Robot gudang, NPC yang bermain permainan atau sistem perdagangan tidak mampu melakukan perjalanan pergi balik gaya GPT selama 2 saat untuk setiap tindakan mikro.
Skeptics on Hacker News menunjukkan kaveat larian: permainan ini sudah berusia beberapa dekad dan didokumentasikan dengan teliti, model bimbingan melakukan pengangkatan berat yang strategik, dan 15 percubaan Elite Four menunjukkan banyak percubaan dan kesilapan. Itu adalah mata yang adil — tetapi mereka terlepas isyarat yang lebih menarik. Enam belas ribu keputusan yang baik pada $0.0001 setiap satu adalah persis seperti yang diperlukan oleh ejen autonomi profil kos jika mereka ingin menjalankan pada skala.
TypeSafe AI, yang diasaskan oleh bekas penyelidik OpenAI RLHF, telah meletakkan Jev sebagai pelengkap kepada model bahasa dan bukannya pengganti. Projek Pokémon — pecahan kod, aliran dan kos semua orang awam — ialah demonstrasi yang paling jelas tentang perkara yang boleh dilakukan oleh timbunan keputusan pertama.
Kod sumber penuh tersedia di GitHub, dan larian yang lengkap boleh ditonton di YouTube, termasuk setiap penghapusan di Victory Road.
Kekal Mendahului AIIkuti AI Buzz Wire untuk perkembangan AI terkini.
Baca lebih banyak berita AI →