Джев, «модель принятия решений» без магистратуры от стартапа TypeSafe AI, завершил Pokémon Red, пробиваясь из Паллет-Тауна в Зал славы за 37 часов и 40 минут игры при общей стоимости вычислений около 1,65 доллара, согласно веб-сайту проекта.
Забег, созданный разработчиком Кристианом Матиесеном, транслировался в прямом эфире с демонстрацией жетонов и затрат, а исходный код был открыт на GitHub. На выходных оно попало на первую страницу Hacker News, собрав сотни голосов и оживленную дискуссию о том, что там говорится о будущем агентов ИИ. Tom's Hardware рассказал об этом достижении, отметив, что движок, не поддерживающий LLM, преуспел там, где традиционные чат-боты останавливались на несколько месяцев, и что Клод Опус 5 помог модели преодолеть тупик.
Бег по цифрам
Статистика собственного отслеживания проекта показывает, насколько необычным был этот запуск для системы ИИ:
- Общее время: 37 часов 40 минут.
- Принятые решения: 16 150
- Входные токены: примерно 39,2 миллиона.
- Общая стоимость Джева: около 1,65 доллара США.
- Типичное время принятия решения: 0,4 секунды.
- Противники сражались примерно 1660
- Командные вайпы: 16
- Элитные четыре попытки: 15
- Самый сложный участок: Дорога Победы.
Последняя команда Зала славы: Чаризард на уровне 83, которого поддерживают Гравелер (62), Нидокуин (45), Бидрилл (44), Хаунтер (39) и Праймейп (29).
Экономика – это заголовок. Шестнадцать тысяч решений по цене меньше, чем цена кофе, — разительный контраст с игровыми агентами на основе LLM, которые могут сжигать десятки долларов в токенах за длительные сеансы. Матисен сказал, что выбрал покемонов после того, как пришел к выводу, что Джев может принять решение быстро, но еще недостаточно быстро, чтобы играть в Doom.
Почему Pokémon Red сложен для ИИ
Pokémon Red стал маловероятным эталоном для агентного ИИ. Классическая игра для Game Boy 1996 года требует долгосрочного планирования: прохождение уровней, управление группой из шести человек, навигация по похожим на лабиринт пещерам без карты и возврат назад, когда ключевой элемент был пропущен. Агенты языковых моделей исторически бродили кругами, застревали в пещерах и тратили огромные бюджеты на избыточные действия.
Джев придерживается принципиально иного подхода. Вместо того, чтобы генерировать текст, модель напрямую возвращает калиброванные решения — дизайн TypeSafe AI, который позиционируется как «Система 1», альтернатива преднамеренному, насыщенному языком рассуждению больших моделей. Согласно более раннему обзору модели Tom's Hardware, компания утверждает, что Jev примерно в 193 раза быстрее и в 445 раз дешевле, чем альтернативы LLM при решении задач.
Загвоздка, как признал разработчик, в том, что Джеву нужна была помощь. Согласно Tom's Hardware, Клод Опус 5 провел модель принятия решений через ее тупики — гибридный подход, в котором большая языковая модель обеспечивает стратегическое руководство, в то время как быстрая и дешевая модель выполняет тысячи отдельных решений. На странице проекта иронично отмечается, что Джев «знал, куда идти дальше, только потому, что у него был гид».
Что это значит для агентов ИИ
Результатом стали данные в растущем аргументе о том, что будущее агентов ИИ — это не одна гигантская модель, выполняющая все, а разделение труда: быстрые, дешевые, специализированные модели, обрабатывающие высокочастотные решения, а более медленные модели рассуждения вступают в действие только тогда, когда ситуация становится двусмысленной.
Для робототехники, игр и систем управления в реальном времени — областей, где решения должны приниматься за миллисекунды, а бюджеты измеряются в центах — такая архитектура привлекательна. Складской робот, игровой NPC или торговая система не могут позволить себе двухсекундный обход в стиле GPT для каждого микродействия.
Скептики из Hacker News указали на предостережения: игре уже несколько десятилетий, и она тщательно задокументирована, тренерская модель взяла на себя тяжелую стратегическую работу, а 15 попыток Элитной четверки предполагают множество проб и ошибок. Это справедливые замечания, но они упускают более интересный сигнал. Шестнадцать тысяч хороших решений по цене 0,0001 доллара США за каждое — это именно та стоимость, которая необходима автономным агентам, если они когда-либо хотят работать в больших масштабах.
Компания TypeSafe AI, основанная бывшим исследователем OpenAI RLHF, позиционирует Jev как дополнение к языковым моделям, а не как замену. Проект Pokémon — код, поток и разбивка затрат общедоступны — является наиболее яркой демонстрацией того, на что способен стек, ориентированный на принятие решений.
Полный исходный код доступен на GitHub, а завершенный запуск можно посмотреть на YouTube, включая все вайпы на Дороге Победы.
Оставайтесь впереди искусственного интеллектаСледите за AI Buzz Wire, чтобы быть в курсе последних разработок в области искусственного интеллекта.
Читать больше новостей об искусственном интеллекте →