Nvidia 연구진은 AI에서 가장 까다로운 대화형 추론 벤치마크 중 하나인 ARC-AGI-3에서 Anthropic의 Claude Opus 5가 자체적으로 실행될 때 30%의 점수를 얻는 동일한 모델을 사용하여 ARC-AGI-3에서 완벽한 100% 점수를 달성하는 에이전트 시스템을 구축했습니다. 금요일 Nvidia 기술 블로그에 게시된 결과는 프론티어 모델을 둘러싼 소프트웨어가 모델 자체만큼 중요하다는 가장 강력한 증거입니다. 최신 AI 개발을 추적하는 사람이라면 에이전트 AI의 경쟁 우위가 실제로 존재하는 위치에 변화가 있음을 알 수 있습니다.

이 시스템은 Agentic Variation Operators의 약자인 AVO라고 불리며, 단일 프롬프트에 응답하는 대신 몇 시간 또는 며칠 동안 작업을 계속할 수 있는 AI인 장거리 자율 에이전트를 위한 범용 아키텍처를 Nvidia가 채택한 것입니다. ARC-AGI-3 공개 세트에서 AVO는 Claude Opus 5를 백엔드 모델로 사용하여 6,624개 환경 작업에서 183개 레벨을 모두 완료하여 25개 게임 환경 전체에서 100.00 RHAE 점수를 기록했습니다.

ARC-AGI-3가 실제로 테스트하는 것

ARC-AGI-3은 ARC Prize 재단에서 만든 대화형 추론 벤치마크입니다. 에이전트는 아무런 지시도 없고, 명시된 규칙도 없고, 명시된 목표도 없는 익숙하지 않은 게임과 같은 환경에 놓이게 됩니다. 시행착오를 통해 탐색하고, 환경이 어떻게 작동하는지 추론하고, "승리"가 무엇을 의미하는지 파악한 다음, 점점 더 어려운 레벨을 통과할 수 있을 만큼 효율적으로 행동해야 합니다.

벤치마크의 점수 측정 기준인 RHAE(Relative Human Action Efficiency)는 작업 완료와 처음 인간 플레이어에 비해 에이전트가 낭비하는 작업 수가 얼마나 적은지를 결합합니다. 따라서 지속적인 자율성에 대한 잔혹한 테스트가 됩니다. 에이전트는 배운 내용을 기억하고, 실수를 복구하고, 전체 실행에 걸쳐 신중하게 조치 예산을 책정해야 합니다.

Nvidia의 헤드라인 번호는 비교를 통해 맥락을 얻습니다. Claude Opus 5를 사용한 이전 직접 상호 작용 하네스인 VISTA는 7,542개의 환경 작업에서 동일한 183개의 공개 설정 레벨을 완료했습니다. Nvidia의 블로그 게시물에 따르면 AVO는 작업을 완료하는 데 대략 12% 더 적은 작업이 필요했습니다.

GPU 커널부터 알려지지 않은 게임까지

AVO는 퍼즐용으로 제작되지 않았습니다. Nvidia는 작은 코드 변경이 예측할 수 없는 방식으로 정확성, 메모리 동작 및 처리량을 손상시킬 수 있는 영역인 GPU 커널 최적화에 대한 아키텍처를 먼저 시연했습니다. 한 주의 커널 연구에서 AVO는 7일 동안 지속적으로 실행되어 500개 이상의 최적화 방향을 탐색하고 40개의 커널 버전을 커밋했습니다. NVIDIA DGX B200 시스템에서 결과적인 멀티헤드 어텐션 커널은 cuDNN보다 최대 3.5%, FlashAttention-4보다 최대 10.5% 성능이 뛰어났습니다. 그런 다음 에이전트는 약 30분의 추가 자율 작업을 통해 진화된 커널을 그룹화된 쿼리 주의에 적용했습니다.

검사, 계획, 구현, 테스트, 평가와 같은 동일한 핵심 루프는 작업 인터페이스만 변경된 상태에서 ARC-AGI-3을 가리켰습니다. 두 가지 메커니즘이 이어졌습니다. 첫 번째는 이전 구현, 평가 결과, 컴파일러 및 프로파일러 출력, 누적된 추론을 저장하는 영구 메모리이므로 에이전트가 컨텍스트를 처음부터 다시 작성하는 대신 현재 상태에서 다시 시작할 수 있습니다. 두 번째는 전체 궤적을 관찰하고 진행이 중단될 때 개입하는 두 번째 에이전트인 감독자입니다.

슈퍼바이저가 혁신이다

Nvidia의 AI 부문 제품 담당 부사장인 Adel El Hallak을 인터뷰한 TechCrunch는 감독자를 가장 중요한 요소로 강조했습니다. El Hallak은 "에이전트가 방향을 벗어나거나 막다른 골목으로 이어질 수 있는 경로를 탐색하기 시작하거나 이전에 밟았던 경로를 다시 탐색하기 시작할 때 에이전트를 살짝 찌르는 것은 거의 CEO와 같은 역할을 합니다."라고 El Hallak은 말했습니다.

성능 격차가 극명합니다. Nvidia의 테스트에서는 정교한 하네스가 없는 Claude Opus 5가 ARC-AGI-3에서 30% 점수를 관리한 것으로 나타났습니다. 이는 테스트된 기본 모델 중에서 가장 좋은 결과이지만 전체 실행에 가까운 수준은 아닙니다. OpenAI의 모델은 벤치마크에서 10% 미만의 점수를 얻었으며 회사는 지난달 자체 연구를 발표하여 단 두 가지 하네스 설정만 조정하면 점수가 3배 증가했음을 보여줍니다. AVO가 달성한 100%에 가까운 모델 전용 구성은 없습니다.

특히 AVO 구성은 텍스트 전용 형식으로 실행되었습니다. 각 관측값은 모델에 전송된 이미지나 이미지 토큰 없이 정확한 64x64 텍스트 그리드로 제공되었습니다. 추론 능력은 다중 모드 인식이 아닌 모델 주변의 루프에서 나왔습니다.

업계가 하네스에 투자하는 이유

원시 모델 기능이 아닌 에이전트 인프라가 현재 자율 AI의 병목 현상이라는 증거가 쏟아지고 있는 가운데 이번 발견이 이루어졌습니다. Databricks는 7월에 하네스가 성능과 비용 모두에 큰 영향을 미친다는 것을 보여주는 벤치마킹 연구를 발표했습니다. Databricks CEO Ali Ghodsi는 TechCrunch에 "동일한 모델이지만 다른 하네스를 선택할 수 있으며, 잘못된 하네스를 사용하면 훨씬 더 많은 비용을 발생하게 됩니다"라고 말했습니다. "그 자체로 비용이 2배가 될 수 있습니다."

El Hallak은 개방성 측면에서 Nvidia의 광범위한 주장을 구성했습니다. "우리는 하네스, 인프라, 런타임 전반에 걸쳐 제어할 수 있는 개방형 에이전트 스택을 보유하는 것이 생태계를 안전하게 발전시키는 데 필요하다고 믿습니다."라고 그는 말했습니다. Nvidia는 NeMo 브랜드로 개방형 하네스 기술을 보유하고 있으며 AVO 연구는 arXiv의 논문에 문서화되어 있습니다.

역사가 있는 벤치마크

ARC-AGI-3은 프론티어 연구소 경쟁의 발화점이 되었습니다. OpenAI는 이전에 벤치마크에서 GPT-5.6 Sol 모델에 대한 강력한 결과를 주장하면서 사용된 평가 설정을 면밀히 조사했습니다. Nvidia의 결과는 어떤 의미에서는 이러한 논쟁을 회피합니다. 즉, 더 똑똑한 모델을 주장하는 것이 아니라 기존 모델을 기반으로 더 나은 엔지니어링된 에이전트를 주장하는 것입니다.

에이전트 제품을 구축하는 개발자와 기업에 대한 메시지는 직접적입니다. 모델 선택은 여전히 ​​중요하지만 이제 시스템 설계는 프론티어 모델이 프론티어 결과를 제공할지 여부를 결정합니다. Nvidia가 말했듯이 모델을 평가하는 것은 에이전트를 평가하는 것과 동일하지 않으며 2026년 벤치마크 테이블은 비계를 구축하는 엔지니어에게 점점 더 많은 보상을 제공하고 있습니다.

AI보다 앞서 나가세요

에이전트 아키텍처는 그 어느 때보다 빠르게 움직이고 있으며, 좋은 하네스와 나쁜 하네스 사이의 격차는 이제 벤치마크 포인트와 실제 달러로 측정됩니다. AI Buzz Wire를 팔로우하세요에서 AI 연구, 벤치마크, 제품 출시에 대한 소스 검증 보도를 매일 확인하세요.

AI 연구 뉴스 자세히 보기 →