Jev, "mô hình quyết định" không phải LLM của công ty khởi nghiệp TypeSafe AI, đã hoàn thành Pokémon Red — chiến đấu từ Pallet Town đến Hall of Fame trong 37 giờ 40 phút chơi với tổng chi phí tính toán khoảng 1,65 USD, theo trang web của dự án.

Cuộc chạy do nhà phát triển Christian Mathiesen xây dựng đã được phát trực tiếp bằng mã thông báo và chi phí được hiển thị và có nguồn mở trên GitHub. Nó đã xuất hiện trên trang nhất của Hacker News vào cuối tuần qua, thu hút hàng trăm lượt tán thành và một cuộc thảo luận sôi nổi về những gì nó nói về tương lai của các đặc vụ AI. Tom's Hardware đề cập đến thành tích này, lưu ý rằng một công cụ không phải LLM đã thành công trong khi các chatbot truyền thống đã bị đình trệ trong nhiều tháng - và Claude Opus 5 đã huấn luyện mô hình này vượt qua những ngõ cụt.

Cuộc chạy đua theo những con số

Số liệu thống kê từ quá trình theo dõi của chính dự án cho thấy hoạt động này bất thường như thế nào đối với hệ thống AI:

  • Tổng thời gian: 37 giờ 40 phút
  • Quyết định được đưa ra: 16.150
  • Mã thông báo đầu vào: khoảng 39,2 triệu
  • Tổng chi phí Jev: khoảng 1,65 USD
  • Thời gian quyết định điển hình: 0,4 giây
  • Đối thủ đã chiến đấu: khoảng 1.660
  • Khăn lau nhóm: 16
  • Elite Four lần thử: 15
  • Cung đường khó khăn nhất: Đường Chiến thắng

Đội Hall of Fame cuối cùng: Charizard ở cấp 83, được hỗ trợ bởi Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) và Primeape (29).

Kinh tế là tiêu đề. Mười sáu nghìn quyết định với giá thấp hơn giá một ly cà phê là một sự tương phản rõ rệt với các đại lý chơi trò chơi dựa trên LLM, có thể đốt hàng chục đô la tiền token trong các phiên dài. Mathiesen cho biết anh chọn Pokémon sau khi kết luận rằng Jev có thể quyết định nhanh chóng, nhưng chưa đủ nhanh để chơi Doom.

Tại sao Pokémon Red lại khó đối với AI

Pokémon Red đã trở thành một chuẩn mực khó có thể xảy ra đối với AI tác nhân. Trò chơi cổ điển Game Boy năm 1996 yêu cầu lập kế hoạch dài hạn: mài giũa cấp độ, quản lý một nhóm sáu người, điều hướng các hang động giống như mê cung mà không có bản đồ và quay lại khi bỏ sót một mục quan trọng. Các tác nhân mô hình ngôn ngữ trong lịch sử đã đi lang thang trong các vòng tròn, bị mắc kẹt trong hang động và đốt cháy ngân sách khổng lồ cho các hành động dư thừa.

Jev có một cách tiếp cận cơ bản khác. Thay vì tạo ra văn bản, mô hình trả về trực tiếp các quyết định đã được hiệu chỉnh - một thiết kế mà TypeSafe AI đã tiếp thị như một giải pháp thay thế "Hệ thống Một" cho lối suy luận có chủ ý, nặng về ngôn ngữ của các mô hình lớn. Theo báo cáo trước đây của Tom's Hardware về mô hình này, công ty tuyên bố Jev nhanh hơn khoảng 193 lần và rẻ hơn 445 lần so với các lựa chọn thay thế LLM trong các nhiệm vụ quyết định.

Nhà phát triển thừa nhận điều đáng chú ý là Jev cần sự giúp đỡ. Per Tom's Hardware, Claude Opus 5 đã hướng dẫn mô hình quyết định vượt qua những ngõ cụt - một cách tiếp cận kết hợp trong đó mô hình ngôn ngữ lớn cung cấp hướng dẫn chiến lược trong khi mô hình nhanh, rẻ thực hiện hàng nghìn quyết định riêng lẻ. Trang dự án dí dỏm lưu ý rằng Jev "chỉ biết phải đi đâu tiếp theo vì nó có người hướng dẫn."

Ý nghĩa của nó đối với Đại lý AI

Kết quả là một điểm dữ liệu trong một lập luận ngày càng tăng rằng tương lai của các tác nhân AI không phải là một mô hình khổng lồ làm mọi việc mà là sự phân công lao động: các mô hình chuyên dụng, nhanh, rẻ, xử lý các quyết định tần số cao, còn các mô hình lý luận chậm hơn chỉ can thiệp khi tình hình trở nên mơ hồ.

Đối với các hệ thống robot, trò chơi và điều khiển thời gian thực – những lĩnh vực mà các quyết định phải đến trong một phần nghìn giây và ngân sách được tính bằng xu – kiến ​​trúc đó rất hấp dẫn. Robot nhà kho, NPC chơi trò chơi hoặc hệ thống giao dịch không thể thực hiện chuyến đi khứ hồi kiểu GPT kéo dài 2 giây cho mỗi hành động vi mô.

Những người hoài nghi trên Hacker News đã chỉ ra những lưu ý của cuộc chạy: trò chơi đã có từ hàng thập kỷ và được ghi chép kỹ lưỡng, mô hình huấn luyện đã thực hiện nâng cao chiến lược và 15 lần thử Elite Four gợi ý rất nhiều thử nghiệm và sai sót. Đó là những điểm công bằng - nhưng họ bỏ lỡ tín hiệu thú vị hơn. Mười sáu nghìn quyết định đúng đắn ở mức 0,0001 USD mỗi quyết định chính xác là hồ sơ chi phí mà các đại lý tự trị cần có nếu họ muốn hoạt động trên quy mô lớn.

TypeSafe AI, được thành lập bởi một cựu nhà nghiên cứu OpenAI RLHF, đã định vị Jev như một sự bổ sung cho các mô hình ngôn ngữ hơn là một sự thay thế. Dự án Pokémon - mã, luồng và phân tích chi phí hoàn toàn công khai - là minh chứng sống động nhất về những gì mà ngăn xếp quyết định đầu tiên có thể làm.

Mã nguồn đầy đủ có sẵn trên GitHub và bạn có thể xem quá trình chạy hoàn chỉnh trên YouTube, bao gồm mọi thao tác xóa trên Victory Road.

Đi trước AI

Theo dõi AI Buzz Wire để biết những phát triển mới nhất về AI.

Đọc thêm tin tức về AI →