Jev, "model keputusan" non-LLM saka wiwitan TypeSafe AI, wis ngrampungake Pokémon Red - nglawan dalan saka Pallet Town menyang Hall of Fame sajrone 37 jam lan 40 menit muter kanthi total biaya kira-kira $ 1,65, miturut situs web proyek kasebut.
Run, dibangun dening pangembang Christian Mathiesen, wis stream langsung karo token lan biaya ing tampilan lan mbukak-sumber ing GitHub. Iki ditembak menyang kaca ngarep Hacker News ing akhir minggu, nggambar atusan upvotes lan diskusi sing rame babagan apa sing dikandhakake babagan masa depan agen AI. Tom's Hardware nutupi prestasi kasebut, kanthi nyathet yen mesin non-LLM sukses ing ngendi chatbots tradisional wis mandheg nganti pirang-pirang wulan - lan Claude Opus 5 nglatih model kasebut kanthi cara sing mati.
Run dening Angka
Statistik saka pelacakan proyek kasebut nuduhake kepiye cara sing ora biasa kanggo sistem AI:
- Total wektu: 37 jam, 40 menit
- Pancasan digawe: 16.150
- Token input: kira-kira 39,2 yuta
- Total biaya Jev: bab $ 1,65
- Wektu kaputusan khas: 0,4 detik
- Mungwan perang: udakara 1.660
- Tim wipes: 16
- Elite Four nyoba: 15
- Regangan paling angel: Dalan Kamenangan
Tim Hall of Fame pungkasan: Charizard ing level 83, didhukung dening Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39), lan Primeape (29).
Ekonomi minangka judhul. Nembelas ewu pancasan kanggo kurang saka rega kopi iku kontras striking karo agen game-playing basis LLM, kang bisa ngobong liwat puluhan dolar ing token liwat mau dawa. Mathiesen ujar manawa dheweke milih Pokémon sawise nyimpulake yen Jev bisa mutusake kanthi cepet, nanging durung cukup cepet kanggo muter Doom.
Napa Pokémon Red Iku Hard kanggo AI
Pokémon Red wis dadi pathokan sing ora mungkin kanggo AI agenik. Klasik Game Boy 1996 nuntut perencanaan jangka panjang: tingkat mecah, ngatur pesta enem, navigasi guwa-guwa kaya mbingungake tanpa peta, lan mundur nalika item kunci ora kejawab. Agen model basa wis historis ngumbara ing bunderan, macet ing guwa, lan ngobong anggaran gedhe kanggo tumindak sing berlebihan.
Jev njupuk pendekatan dhasar beda. Tinimbang ngasilake teks, model kasebut ngasilake keputusan sing dikalibrasi langsung - desain TypeSafe AI sing dipasarake minangka alternatif "Sistem Siji" kanggo nalar model gedhe sing disengaja lan abot. Miturut jangkoan model Tom's Hardware sadurungé, perusahaan kasebut ngaku Jev kira-kira 193 kaping luwih cepet lan 445 kaping luwih murah tinimbang alternatif LLM babagan tugas keputusan.
Sing nyekel, pangembang ngakoni, yaiku Jev butuh bantuan. Per Tom's Hardware, Claude Opus 5 nglatih model keputusan kanthi cara sing mati - pendekatan hibrida sing model basa gedhe menehi panuntun strategis nalika model sing cepet lan murah nglakokake ewonan keputusan individu. Kaca project wryly cathetan sing Jev "mung ngerti ngendi kanggo pindhah sabanjuré amarga wis guide."
Apa Tegese kanggo Agen AI
Asil kasebut minangka titik data ing argumentasi sing terus berkembang yen masa depan agen AI ora mung model raksasa sing nindakake kabeh, nanging divisi tenaga kerja: model sing cepet, murah, khusus sing nangani keputusan frekuensi dhuwur, kanthi model penalaran sing luwih alon mung mlebu nalika kahanan dadi ambigu.
Kanggo robotika, game, lan sistem kontrol nyata-wektu - domain ngendi pancasan kudu teka ing milliseconds lan budget diukur ing sen - arsitektur sing narik kawigaten. Robot gudang, NPC sing main game, utawa sistem dagang ora bisa mbayar perjalanan babak gaya GPT 2 detik kanggo saben aksi mikro.
Skeptics ing Hacker News nuding metu caveats roto kang: game wis puluhan taun lawas lan sak tenane nyathet, model kepelatihan nindakake ngangkat abot strategis, lan 15 Elite Four usaha nyaranake akeh nyoba lan kesalahan. Iki minangka titik sing adil - nanging ora kejawab sinyal sing luwih menarik. Nembelas ewu pancasan apik ing $0.0001 saben persis biaya profil otonom agen perlu yen padha tau kanggo mbukak ing skala.
TypeSafe AI, didegake dening mantan peneliti OpenAI RLHF, wis posisi Jev minangka pelengkap kanggo model basa tinimbang panggantos. Proyek Pokémon - kode, stream, lan biaya risak kabeh umum - minangka demonstrasi sing paling jelas babagan apa sing bisa ditindakake tumpukan keputusan.
Kode sumber lengkap kasedhiya ing GitHub, lan run rampung bisa ditonton ing YouTube, kalebu saben wipe ing Victory Road.
Tetep ing ngarep AITindakake AI Buzz Wire kanggo perkembangan AI paling anyar.
Waca liyane warta AI →