Джев, не-LLM «модель прийняття рішень» від стартапу TypeSafe AI, завершив Pokémon Red — пройшов шлях від Pallet Town до Залу слави за 37 годин і 40 хвилин гри із загальною обчислювальною вартістю близько $1,65, згідно з веб-сайтом проекту.
Пробіг, створений розробником Крістіаном Матісеном, транслювався в прямому ефірі з демонстрацією токенів і витрат у відкритому доступі на GitHub. У вихідні він потрапив на першу сторінку Hacker News, викликавши сотні голосів «за» та жваве обговорення того, що в ньому йдеться про майбутнє агентів ШІ. Tom's Hardware висвітлило це досягнення, зазначивши, що двигун, який не є LLM, досяг успіху там, де традиційні чат-боти зупинялися місяцями, і що Claude Opus 5 провів цю модель у глухих кутах.
Біг за цифрами
Статистика власного відстеження проекту показує, наскільки цей запуск був незвичайним для системи ШІ:
- Загальний час: 37 годин 40 хвилин
- Прийнято рішень: 16150
- Вхідні маркери: приблизно 39,2 мільйона
- Загальна вартість Jev: близько 1,65 дол
- Типовий час прийняття рішення: 0,4 секунди
- Супротивники билися: приблизно 1660
- Стирання команди: 16
- Елітна четвірка спроб: 15
- Найскладніша ділянка: Дорога Перемоги
Остання команда Залу слави: Чарізард на рівні 83, підтриманий Гравелером (62), Нідоквін (45), Бідрілом (44), Хаунтером (39) і Праймейпом (29).
Економіка - це заголовок. Шістнадцять тисяч рішень за ціною менше кави є разючим контрастом із ігровими агентами на базі LLM, які можуть спалити десятки доларів у токенах за довгі сесії. Матісен сказав, що він вибрав Pokémon після того, як дійшов висновку, що Джев може швидко прийняти рішення, але ще недостатньо швидко, щоб грати в Doom.
Чому Pokémon Red важкий для ШІ
Pokémon Red став малоймовірним еталоном для агентського штучного інтелекту. Класика Game Boy 1996 року вимагає довгострокового планування: шліфування рівнів, управління групою з шести осіб, навігація в печерах, схожих на лабіринт, без карти та повернення назад, коли ключовий елемент пропущено. Історично агенти мовної моделі блукали колами, застрягали в печерах і витрачали величезні бюджети на зайві дії.
У Джева принципово інший підхід. Замість того, щоб генерувати текст, модель повертає відкалібровані рішення безпосередньо — дизайн TypeSafe AI, який рекламується як «System One» альтернатива навмисним, важким для мови міркуванням великих моделей. Згідно з попереднім висвітленням моделі Tom's Hardware, компанія стверджує, що Jev приблизно в 193 рази швидший і в 445 разів дешевший, ніж альтернативи LLM для вирішення завдань.
Заковика, як визнав розробник, полягає в тому, що Джеву потрібна допомога. Згідно з Tom's Hardware, Claude Opus 5 наставляв модель прийняття рішень через тупики — гібридний підхід, у якому велика мовна модель забезпечує стратегічне керівництво, а швидка та дешева модель виконує тисячі індивідуальних рішень. На сторінці проекту криво зазначається, що Джев «знав, куди йти далі, лише тому, що мав гіда».
Що це означає для агентів ШІ
Результатом є дана точка в зростаючих аргументах про те, що майбутнє агентів штучного інтелекту — це не одна гігантська модель, яка буде робити все, а розподіл праці: швидкі, дешеві спеціалізовані моделі, які обробляють високочастотні рішення, а повільніші моделі міркувань втручаються лише тоді, коли ситуація стає неоднозначною.
Для робототехніки, ігор і систем керування в реальному часі — областей, де рішення приймаються за мілісекунди, а бюджети вимірюються в центах — ця архітектура є привабливою. Складський робот, ігровий NPC або торгова система не можуть дозволити собі 2-секундну поїздку туди й назад у стилі GPT для кожної мікро-дії.
Скептики в Hacker News звернули увагу на застереження щодо гри: гра десятиліттями давно задокументована, тренерська модель виконала стратегічну важку роботу, а 15 спроб Елітної четвірки свідчать про багато спроб і помилок. Це справедливі зауваження, але вони пропускають більш цікавий сигнал. Шістнадцять тисяч хороших рішень по $0,0001 кожне — це саме той профіль витрат, який потрібен автономним агентам, якщо вони коли-небудь будуть працювати в масштабах.
TypeSafe AI, заснований колишнім дослідником OpenAI RLHF, позиціонує Jev як доповнення до мовних моделей, а не як заміну. Проект Pokémon — загальнодоступний розподіл коду, потоків і витрат — це найяскравіша демонстрація того, що може зробити стек, який приймає рішення.
Повний вихідний код доступний на GitHub, а завершений запуск можна переглянути на YouTube, включаючи кожне стирання на Дорозі Перемоги.
Будьте попереду ШІСлідкуйте за AI Buzz Wire, щоб дізнатися про останні розробки штучного інтелекту.
Читати більше новин AI →