Джев, «модель принятия решений» без магистратуры от стартапа TypeSafe AI, завершил Pokémon Red, пробиваясь из Паллет-Тауна в Зал славы за 37 часов и 40 минут игры при общей стоимости вычислений около 1,65 доллара, согласно веб-сайту проекта.

Забег, созданный разработчиком Кристианом Матиесеном, транслировался в прямом эфире с демонстрацией жетонов и затрат, а исходный код был открыт на GitHub. На выходных оно попало на первую страницу Hacker News, собрав сотни голосов и оживленную дискуссию о том, что там говорится о будущем агентов ИИ. Tom's Hardware рассказал об этом достижении, отметив, что движок, не поддерживающий LLM, преуспел там, где традиционные чат-боты останавливались на несколько месяцев, и что Клод Опус 5 помог модели преодолеть тупик.

Бег по цифрам

Статистика собственного отслеживания проекта показывает, насколько необычным был этот запуск для системы ИИ:

  • Общее время: 37 часов 40 минут.
  • Принятые решения: 16 150
  • Входные токены: примерно 39,2 миллиона.
  • Общая стоимость Джева: около 1,65 доллара США.
  • Типичное время принятия решения: 0,4 секунды.
  • Противники сражались примерно 1660
  • Командные вайпы: 16
  • Элитные четыре попытки: 15
  • Самый сложный участок: Дорога Победы.

Последняя команда Зала славы: Чаризард на уровне 83, которого поддерживают Гравелер (62), Нидокуин (45), Бидрилл (44), Хаунтер (39) и Праймейп (29).

Экономика – это заголовок. Шестнадцать тысяч решений по цене меньше, чем цена кофе, — разительный контраст с игровыми агентами на основе LLM, которые могут сжигать десятки долларов в токенах за длительные сеансы. Матисен сказал, что выбрал покемонов после того, как пришел к выводу, что Джев может принять решение быстро, но еще недостаточно быстро, чтобы играть в Doom.

Почему Pokémon Red сложен для ИИ

Pokémon Red стал маловероятным эталоном для агентного ИИ. Классическая игра для Game Boy 1996 года требует долгосрочного планирования: прохождение уровней, управление группой из шести человек, навигация по похожим на лабиринт пещерам без карты и возврат назад, когда ключевой элемент был пропущен. Агенты языковых моделей исторически бродили кругами, застревали в пещерах и тратили огромные бюджеты на избыточные действия.

Джев придерживается принципиально иного подхода. Вместо того, чтобы генерировать текст, модель напрямую возвращает калиброванные решения — дизайн TypeSafe AI, который позиционируется как «Система 1», альтернатива преднамеренному, насыщенному языком рассуждению больших моделей. Согласно более раннему обзору модели Tom's Hardware, компания утверждает, что Jev примерно в 193 раза быстрее и в 445 раз дешевле, чем альтернативы LLM при решении задач.

Загвоздка, как признал разработчик, в том, что Джеву нужна была помощь. Согласно Tom's Hardware, Клод Опус 5 провел модель принятия решений через ее тупики — гибридный подход, в котором большая языковая модель обеспечивает стратегическое руководство, в то время как быстрая и дешевая модель выполняет тысячи отдельных решений. На странице проекта иронично отмечается, что Джев «знал, куда идти дальше, только потому, что у него был гид».

Что это значит для агентов ИИ

Результатом стали данные в растущем аргументе о том, что будущее агентов ИИ — это не одна гигантская модель, выполняющая все, а разделение труда: быстрые, дешевые, специализированные модели, обрабатывающие высокочастотные решения, а более медленные модели рассуждения вступают в действие только тогда, когда ситуация становится двусмысленной.

Для робототехники, игр и систем управления в реальном времени — областей, где решения должны приниматься за миллисекунды, а бюджеты измеряются в центах — такая архитектура привлекательна. Складской робот, игровой NPC или торговая система не могут позволить себе двухсекундный обход в стиле GPT для каждого микродействия.

Скептики из Hacker News указали на предостережения: игре уже несколько десятилетий, и она тщательно задокументирована, тренерская модель взяла на себя тяжелую стратегическую работу, а 15 попыток Элитной четверки предполагают множество проб и ошибок. Это справедливые замечания, но они упускают более интересный сигнал. Шестнадцать тысяч хороших решений по цене 0,0001 доллара США за каждое — это именно та стоимость, которая необходима автономным агентам, если они когда-либо хотят работать в больших масштабах.

Компания TypeSafe AI, основанная бывшим исследователем OpenAI RLHF, позиционирует Jev как дополнение к языковым моделям, а не как замену. Проект Pokémon — код, поток и разбивка затрат общедоступны — является наиболее яркой демонстрацией того, на что способен стек, ориентированный на принятие решений.

Полный исходный код доступен на GitHub, а завершенный запуск можно посмотреть на YouTube, включая все вайпы на Дороге Победы.

Оставайтесь впереди искусственного интеллекта

Следите за AI Buzz Wire, чтобы быть в курсе последних разработок в области искусственного интеллекта.

Читать больше новостей об искусственном интеллекте →