스타트업 TypeSafe AI의 LLM이 아닌 "의사결정 모델"인 Jev는 Pokémon Red를 완성했습니다. 프로젝트 웹사이트에 따르면 총 컴퓨팅 비용은 약 1.65달러로 37시간 40분 동안 Pallet Town에서 명예의 전당에 올랐습니다.

개발자 Christian Mathiesen이 구축한 이 실행은 토큰과 비용이 표시된 상태로 실시간 스트리밍되었으며 GitHub에서 오픈 소스로 제공되었습니다. 주말 동안 Hacker News의 첫 페이지에 게재되어 수백 개의 찬성표를 얻었으며 AI 에이전트의 미래에 대해 말하는 내용에 대한 활발한 토론이 이루어졌습니다. Tom's Hardware는 전통적인 챗봇이 몇 달 동안 정체되었던 곳에서 LLM이 아닌 엔진이 성공했으며 Claude Opus 5가 막다른 골목을 통해 모델을 코칭했다는 점을 언급하면서 이러한 성과를 다루었습니다.

숫자에 의한 실행

프로젝트 자체 추적의 통계는 AI 시스템에서 이 실행이 얼마나 특이한지 보여줍니다.

  • 총 시간: 37시간 40분
  • 결정된 사항: 16,150
  • 입력 토큰: 약 3,920만 개
  • 총 Jev 비용: 약 $1.65
  • 일반적인 결정 시간: 0.4초
  • 싸운 상대: 약 1,660명
  • 팀 전멸: 16
  • 엘리트 4 시도: 15
  • 가장 힘든 구간: Victory Road

최종 명예의 전당 팀: 레벨 83의 Charizard, Graveler(62), Nidoqueen(45), Beedrill(44), Haunter(39) 및 Primeape(29)가 지원합니다.

경제학이 헤드라인이다. 커피 한 잔 가격보다 저렴한 가격으로 16,000개의 결정을 내리는 것은 LLM 기반 게임 플레이 에이전트와는 현저한 대조를 이룹니다. LLM 기반 게임 플레이 에이전트는 오랜 세션 동안 수십 달러의 토큰을 태울 수 있습니다. Mathiesen은 Jev가 빠르게 결정할 수 있지만 아직 Doom을 플레이할 만큼 빠르지는 않다고 결론을 내린 후 Pokémon을 선택했다고 말했습니다.

포켓몬 레드가 AI에게 어려운 이유

포켓몬 레드(Pokémon Red)는 에이전트 AI의 벤치마크가 될 가능성이 거의 없습니다. 1996년 게임보이 클래식은 레벨을 갈고, 6인 파티를 관리하고, 지도 없이 미로 같은 동굴을 탐색하고, 핵심 항목을 놓쳤을 때 되돌아가는 등 장기적인 계획을 요구합니다. 언어 모델 에이전트는 역사적으로 원을 그리며 방황하고, 동굴에 갇히고, 중복된 작업으로 막대한 예산을 소모했습니다.

Jev는 근본적으로 다른 접근 방식을 취합니다. 모델은 텍스트를 생성하는 대신 교정된 결정을 직접 반환합니다. TypeSafe AI는 대형 모델의 고의적이고 언어 중심 추론에 대한 "System One" 대안으로 마케팅한 디자인입니다. Tom's Hardware의 이전 모델 보도에 따르면 회사는 Jev가 의사 결정 작업에 있어 LLM 대안보다 대략 193배 빠르고 445배 저렴하다고 주장합니다.

개발자는 Jev에게 도움이 필요하다는 점을 인정했습니다. Tom의 하드웨어에 따르면 Claude Opus 5는 막다른 골목까지 의사 결정 모델을 지도했습니다. 이는 대규모 언어 모델이 전략적 지침을 제공하는 동시에 빠르고 저렴한 모델이 수천 개의 개별 결정을 실행하는 하이브리드 접근 방식입니다. 프로젝트 페이지에는 Jev가 "가이드가 있었기 때문에 다음에 어디로 가야할지 알 뿐이었다"고 냉정하게 언급되어 있습니다.

AI 에이전트에게 미치는 영향

그 결과는 AI 에이전트의 미래가 모든 것을 수행하는 하나의 거대한 모델이 아니라 노동 분업이라는 점증하는 주장의 데이터 포인트입니다. 즉, 빈번한 결정을 처리하는 빠르고 저렴하며 전문화된 모델과 상황이 모호해질 때만 개입하는 느린 추론 모델이 있습니다.

결정이 밀리초 단위로 이루어지고 예산이 센트 단위로 측정되는 로봇 공학, 게임 및 실시간 제어 시스템의 경우 이러한 아키텍처가 매력적입니다. 창고 로봇, 게임을 하는 NPC 또는 거래 시스템은 모든 마이크로 액션에 대해 2초의 GPT 스타일 왕복을 감당할 수 없습니다.

Hacker News의 회의론자들은 이 게임의 주의 사항을 지적했습니다. 이 게임은 수십 년이 지났고 철저하게 문서화되어 있으며 코칭 모델은 전략적으로 무거운 작업을 수행했으며 15번의 Elite Four 시도는 많은 시행착오를 암시합니다. 이는 타당한 지적이지만 더 흥미로운 신호를 놓치고 있습니다. 각각 $0.0001의 올바른 결정 16,000개는 자율 에이전트가 대규모로 실행되는 경우 정확히 필요한 비용 프로필입니다.

전 OpenAI RLHF 연구원이 설립한 TypeSafe AI는 Jev를 대체가 아닌 언어 모델의 보완물로 자리매김했습니다. 코드, 스트림, 비용 내역이 모두 공개된 Pokémon 프로젝트는 의사결정 우선 스택이 무엇을 할 수 있는지를 가장 생생하게 보여줍니다.

전체 소스 코드는 GitHub에서 사용할 수 있으며 Victory Road의 모든 삭제를 포함하여 완료된 실행을 YouTube에서 볼 수 있습니다.

AI보다 앞서 나가세요

최신 AI 개발 소식을 보려면 AI Buzz Wire를 팔로우하세요.

AI 뉴스 자세히 보기 →