Jev ซึ่งเป็น "โมเดลการตัดสินใจ" ที่ไม่ใช่ LLM จากสตาร์ทอัพ TypeSafe AI ได้สร้าง Pokémon Red สำเร็จแล้ว โดยต่อสู้เพื่อเดินทางจาก Pallet Town ไปยัง Hall of Fame ในการเล่น 37 ชั่วโมง 40 นาที ด้วยค่าใช้จ่ายในการคำนวณรวมประมาณ 1.65 ดอลลาร์ ตามเว็บไซต์ของโครงการ

การดำเนินการนี้สร้างโดยนักพัฒนา Christian Mathiesen ได้รับการสตรีมสดด้วยโทเค็นและค่าใช้จ่ายที่จัดแสดงและโอเพ่นซอร์สบน GitHub ในช่วงสุดสัปดาห์ที่ผ่านมา ได้มีการขึ้นหน้าแรกของ Hacker News โดยมีผู้โหวตเห็นด้วยหลายร้อยคน และการอภิปรายอย่างมีชีวิตชีวาเกี่ยวกับสิ่งที่กล่าวไว้เกี่ยวกับอนาคตของตัวแทน AI Tom's Hardware ครอบคลุมความสำเร็จนี้ โดยสังเกตว่ากลไกที่ไม่ใช่ LLM ประสบความสำเร็จโดยที่แชทบอทแบบเดิมหยุดทำงานเป็นเวลาหลายเดือน และ Claude Opus 5 เป็นโค้ชโมเดลนี้ผ่านทางตัน

การวิ่งตามตัวเลข

สถิติจากการติดตามของโครงการแสดงให้เห็นว่าการดำเนินการนี้ผิดปกติเพียงใดสำหรับระบบ AI:

  • เวลาทั้งหมด: 37 ชั่วโมง 40 นาที
  • ตัดสินใจแล้ว: 16,150
  • โทเค็นอินพุต: ประมาณ 39.2 ล้าน
  • ค่าใช้จ่ายรวมของ Jev: ประมาณ $1.65
  • เวลาในการตัดสินใจโดยทั่วไป: 0.4 วินาที
  • ฝ่ายตรงข้ามต่อสู้: ประมาณ 1,660
  • ผ้าเช็ดทีม: 16
  • ความพยายามระดับ Elite Four: 15
  • ทางยืดที่ยากที่สุด: ถนนชัยชนะ

ทีมหอเกียรติยศทีมสุดท้าย: Charizard เลเวล 83 ได้รับการสนับสนุนจาก Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) และ Primeape (29)

เศรษฐศาสตร์เป็นหัวข้อข่าว การตัดสินใจหนึ่งหมื่นหกพันครั้งในราคาที่ถูกกว่ากาแฟนั้นแตกต่างอย่างเห็นได้ชัดกับตัวแทนการเล่นเกมที่ใช้ LLM ซึ่งสามารถเผาผลาญโทเค็นได้หลายสิบดอลลาร์ในเซสชันที่ยาวนาน Mathiesen กล่าวว่าเขาเลือกโปเกมอนหลังจากสรุปว่า Jev สามารถตัดสินใจได้อย่างรวดเร็ว แต่ยังเร็วพอที่จะเล่น Doom

ทำไม Pokémon Red ถึงยากสำหรับ AI

Pokémon Red กลายเป็นเกณฑ์มาตรฐานที่ไม่น่าเป็นไปได้สำหรับ AI แบบเอเจนต์ เกมบอยคลาสสิกปี 1996 ต้องการการวางแผนในขอบเขตอันยาวไกล ได้แก่ การไต่ระดับ จัดการปาร์ตี้ที่มีสมาชิก 6 คน การสำรวจถ้ำที่เหมือนเขาวงกตโดยไม่มีแผนที่ และการย้อนรอยเมื่อพลาดรายการสำคัญ ในอดีต เจ้าหน้าที่จำลองภาษาเคยเดินวนเวียนอยู่ในถ้ำ และเปลืองงบประมาณจำนวนมหาศาลในการดำเนินการที่ซ้ำซ้อน

เจฟใช้แนวทางที่แตกต่างโดยพื้นฐาน แทนที่จะสร้างข้อความ โมเดลจะส่งคืนการตัดสินใจที่ปรับเทียบแล้วโดยตรง — การออกแบบ TypeSafe AI ได้ทำการตลาดในฐานะทางเลือก "System One" แทนการใช้เหตุผลโดยเจตนาและใช้ภาษาหนักหน่วงของโมเดลขนาดใหญ่ ตามการรายงานข่าวโมเดลก่อนหน้านี้ของ Tom's Hardware บริษัทอ้างว่า Jev เร็วกว่าประมาณ 193 เท่าและราคาถูกกว่าทางเลือก LLM ในงานการตัดสินใจถึง 445 เท่า

สิ่งที่นักพัฒนายอมรับคือ Jev ต้องการความช่วยเหลือ ตาม Tom's Hardware Claude Opus 5 เป็นโค้ชโมเดลการตัดสินใจผ่านทางตัน ซึ่งเป็นแนวทางแบบไฮบริดที่โมเดลภาษาขนาดใหญ่ให้คำแนะนำเชิงกลยุทธ์ ในขณะที่โมเดลที่รวดเร็วและราคาถูกดำเนินการตัดสินใจนับพันรายการ หน้าโปรเจ็กต์ตั้งข้อสังเกตอย่างผิด ๆ ว่า Jev "รู้แค่ว่าจะต้องไปที่ไหนต่อไปเพราะมีคำแนะนำ"

ความหมายสำหรับตัวแทน AI

ผลลัพธ์ที่ได้คือจุดข้อมูลในการโต้แย้งที่เพิ่มมากขึ้นว่าอนาคตของตัวแทน AI ไม่ใช่โมเดลยักษ์ตัวเดียวที่ทำทุกอย่าง แต่เป็นการแบ่งงาน: โมเดลพิเศษที่รวดเร็ว ราคาถูก และเชี่ยวชาญที่จัดการกับการตัดสินใจที่มีความถี่สูง โดยมีโมเดลการให้เหตุผลที่ช้าลงซึ่งจะเข้ามามีบทบาทเฉพาะเมื่อสถานการณ์คลุมเครือเท่านั้น

สำหรับหุ่นยนต์ เกม และระบบควบคุมแบบเรียลไทม์ — โดเมนที่การตัดสินใจต้องมาถึงในหน่วยมิลลิวินาทีและงบประมาณวัดเป็นเซนต์ — สถาปัตยกรรมนั้นน่าดึงดูด หุ่นยนต์ในโกดัง NPC ที่เล่นเกม หรือระบบการค้าไม่สามารถจ่ายไปกลับสไตล์ GPT 2 วินาทีสำหรับทุกไมโครแอ็คชั่นได้

ผู้คลางแคลงใจใน Hacker News ชี้ให้เห็นถึงคำเตือนของการวิ่ง: เกมนี้มีอายุหลายสิบปีและมีการบันทึกไว้อย่างถี่ถ้วน โมเดลการฝึกสอนได้ยกระดับกลยุทธ์อย่างหนัก และความพยายาม 15 ครั้งของ Elite Four แสดงให้เห็นว่ามีการลองผิดลองถูกมากมาย นั่นเป็นประเด็นที่ยุติธรรม — แต่พวกเขาพลาดสัญญาณที่น่าสนใจกว่า การตัดสินใจที่ดีจำนวนหนึ่งหมื่นหกพันรายการ ที่ราคา 0.0001 ดอลลาร์ต่อการตัดสินใจนั้นถือเป็นโปรไฟล์ต้นทุนที่ตัวแทนอิสระต้องการอย่างแน่นอน หากพวกเขาเคยดำเนินการในวงกว้าง

TypeSafe AI ก่อตั้งโดยอดีตนักวิจัย OpenAI RLHF ได้วางตำแหน่ง Jev เป็นส่วนเสริมให้กับโมเดลภาษามากกว่าการแทนที่ โปรเจ็กต์โปเกมอน — โค้ด สตรีม และแจกแจงต้นทุนที่เปิดเผยต่อสาธารณะ — เป็นการสาธิตที่ชัดเจนที่สุดว่าสแต็กการตัดสินใจต้องมาก่อนสามารถทำได้อย่างไร

ซอร์สโค้ดฉบับเต็มมีอยู่ใน GitHub และสามารถดูการรันที่เสร็จสมบูรณ์ได้บน YouTube รวมถึงการเช็ดทุกครั้งบน Victory Road

ก้าวนำหน้า AI

ติดตาม AI Buzz Wire เพื่อรับทราบการพัฒนา AI ล่าสุด

อ่านข่าว AI เพิ่มเติม →