OpenAI의 GPT-6 Astra는 기록에 특이한 트로피를 추가했습니다. 즉, 총 컴퓨팅 비용 $571.18로 24시간 이내에 자동으로 완료되는 Valve의 상징적인 1인칭 퍼즐 Portal 전체 플레이가 가능했습니다. The Verge는 2026년 9월 6일에 이정표를 보고했으며, 코지블레이즈(coyblaze)로 알려진 사용자가 프론티어 모델을 게임에 연결하고 나머지를 알아내도록 했습니다.

Portal은 나이에도 불구하고 AI 에이전트에 대한 까다로운 테스트입니다. 2007년 Valve가 출시한 이 게임에서는 플레이어가 포털 건을 사용하여 공간 퍼즐에 대해 추론해야 합니다. 즉, 벽, 바닥, 천장에 연결된 구멍을 만들어 일상적으로 직관을 무시하는 테스트 챔버를 통과해야 합니다. 기댈 만한 전투적 노력도 없고 따라야 할 퀘스트 마커도 없습니다. 모든 방은 본질적으로 물리학의 수수께끼입니다. 개척 모델이 어떻게 스트레스 테스트를 받고 있는지 알고 있는 독자들에게 이번 실행은 AI 개발 보도의 생생한 항목입니다.

데모영상부터 완결까지

실행은 갑자기 나오지 않았습니다. 앞서 지난 9월 6일 해커뉴스에는 GPT-6 아스트라가 포털을 플레이하는 모습을 담은 유튜브 영상이 유포됐고, 해당 모델이 게임을 "자율적으로 완료했다"는 후속 게시물이 날이 갈수록 관심을 끌었다. The Verge의 보고서는 회의론자들을 위해 게시된 실행 요약 비디오를 통해 24시간 이내에 전체 게임이 600달러 미만의 컴퓨팅 비용으로 완료되었다는 세부 사항을 확인했습니다.

The Verge는 이 작업이 데이터 센터 냉각에 대략 작은 수영장만큼의 물을 소비했을 것이라는 점을 지적하면서 청구서의 환경적 측면을 정량화하는 것을 거부할 수 없었습니다. 에이전트 게임 실행은 사용자에게는 저렴하지만 지구를 위해 무료는 아니라는 점을 상기시켜줍니다.

2007년 퍼즐러가 심각한 벤치마크인 이유

Beating Portal은 ARC-AGI 또는 SWE-bench와 같은 예정된 벤치마크가 아니며 이것이 부분적으로 반향을 불러일으키는 이유입니다. 이 게임은 역사적으로 인간과 AI 시스템을 분리해 온 기술을 정확하게 요구합니다.

  • 공간적 추론. 솔루션을 위해서는 포털 출구가 플레이어의 몸을 어디로 발사할지 예측해야 합니다. 이는 수년간 에이전트를 당황하게 했던 3차원 물리 추론입니다.
  • 장거리 계획. 챔버는 여러 단계를 연결합니다. 마지막 단계에 실패하면 일반적으로 처음부터 시퀀스를 다시 실행하는 것을 의미합니다.
  • 손을 잡지 않고도 실패로부터 배운다. 힌트가 없습니다. 에이전트는 시행착오를 통해 게임의 규칙을 추론한 다음 이를 새로운 챔버에 일반화해야 합니다.

올해 초 OpenAI의 GPT-6 Astra는 행위적 추론에 초점을 맞춘 ARC-AGI-3 벤치마크에서 1위를 차지했으며, 이 모델은 컴퓨터 사용 기능, 즉 사람이 원하는 방식으로 소프트웨어 인터페이스를 작동하는 능력에 대한 관심을 끌었습니다. Portal 실행은 동일한 기술 세트(인식, 계획, 제어)를 사람의 개입 없이 몇 시간 동안 펼쳐 보여 주는 재미있지만 실제적인 시연입니다.

더 넓은 물결의 일부

이 실행은 AI 게임이 2026년에 상륙했다는 신호이기도 합니다. 벤치마크 점수는 이제 문화적 이정표와 공간을 공유합니다. 즉, 바흐 합창곡을 작곡하는 모델, 필기 교정 인식 테스트를 통과하고 한때 "컴퓨터는 절대 이 일을 하지 않을 것"이라는 문구를 대표했던 게임을 완성하는 것입니다. 각 패스는 오래된 확신을 완화하고 다음 패스가 무엇인지에 대한 질문을 제기합니다.

실용적인 의미도 있습니다. cosyblaze의 설정이 Portal(스크린샷 입력, 결정 출력, 수백 달러의 비용)을 조종할 수 있게 해주는 동일한 루프는 소프트웨어 테스트, 로봇 공학 및 컴퓨터 사용 보조자를 위해 제품화되고 있는 루프입니다. 전체 플레이를 위해 게임의 물리학을 염두에 둘 수 있는 모델은 원칙적으로 더 짧은 컨텍스트 시스템을 물리치는 길고 지저분한 소프트웨어 작업을 처리할 수 있는 모델입니다.

하지만 지금은 테이크아웃이 더 간단합니다. AI는 게임에서 가장 사랑받는 퍼즐 중 하나를 새로운 GPU 보증금 정도의 가격으로 처음부터 끝까지 이기고 비디오를 게시했습니다. 애퍼처 사이언스의 실험실은 인간이 영리하다는 느낌을 갖도록 설계되었습니다. 이번 주말에는 모델이 유창해 보이도록 만들었습니다.

실행이 수신된 방법

응답은 일반적으로 AI 게임 이정표의 호를 추적했습니다. 먼저 불신, 그 다음 비디오, 그 다음 수용이었습니다. Hacker News에서 이 실행은 설정이 어떻게 작동하고 에이전트 AI에 대해 무엇을 의미하는지 분석하는 논평자의 꾸준한 흐름을 이끌어 냈습니다. 몇몇은 총 청구서가 그러한 실행에 드는 비용이 많은 사람들이 예상한 것보다 낮았다고 지적했습니다. 완료에 대한 압축된 비디오는 회의론자들에게 대부분의 벤치마크 결과가 제공하는 것보다 더 많은 주장을 직접 확인할 수 있는 방법을 제공했습니다.

또한 이전에 나온 이정표와의 비교도 요청했습니다. 게임은 보드 게임부터 실시간 전략, 개방형 샌드박스에 이르기까지 수십 년 동안 해당 분야의 공개 시험장 역할을 해왔습니다. 게임이 실패할 때마다 논쟁은 바뀌게 됩니다. 오늘날의 회의론자들은 그 위업이 좁거나, 특화되었거나, 일반화할 수 없는 방식으로 특화되었다고 주장합니다. 그 역사에서 포털 실행을 주목할 만한 이유는 게임용으로 특별히 훈련된 맞춤형 연구 시스템이 아니라 상용으로 이용 가능한 프론티어 모델, 소비자 게임 및 수백 달러의 컴퓨팅 설정이 얼마나 평범했는지입니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →