OpenAI는 Anthropic의 Claude Opus 5가 ARC-AGI-3 벤치마크를 장악한 후 반발하여 자체 GPT-5.6 Sol 모델이 38.3%를 기록했다는 결과를 발표했습니다. 공식 테스트 하네스가 아닌 OpenAI의 기본 설정을 사용한 경우입니다.
2026년 7월 30일에 발생한 이 논쟁은 AI 평가에서 점점 커지는 문제의 핵심을 찔렀습니다. 벤치마크는 더 이상 모델만 측정하는 것이 아니라 모델을 둘러싼 전체 기술 기반을 측정합니다. 최신 AI 개발 및 모델 출시에 대한 심층 분석을 위해 AI Buzz Wire가 스토리를 추적하고 있습니다.
숫자와 캐치
OpenAI는 GPT-5.6 Sol이 ARC-AGI-3에서 38.3%에 도달하여 이전에 벤치마크 기록을 4배로 늘린 후 30.2%를 기록한 Anthropic의 Claude Opus 5를 앞질렀다고 보고했습니다. 주의 사항은 중요합니다. 38.3% 수치는 OpenAI Responses API의 두 가지 특정 기능에 따라 달라집니다.
첫 번째는 Retained Reasoning으로, 각 작업 후에 모델의 사고 사슬을 삭제하는 대신 단계 간에 모델의 사고 사슬을 보존합니다. 두 번째는 압축으로, 이전 컨텍스트를 자르는 대신 요약하여 모델이 이전 추론을 잃지 않고 긴 문제를 계속 작업할 수 있도록 합니다.
정확한 비교를 보장하기 위해 의도적으로 공급자별 설정을 피하는 ARC Prize의 공식 표준화된 하네스를 실행해 보면 GPT-5.6 Sol은 7.8%만 관리했습니다. OpenAI는 그 이유는 공식 설정이 모든 단계 후에 모델의 추론을 폐기하여 지속적인 다단계 사고가 필요한 작업의 성능을 저하시키기 때문이라고 주장합니다.
순수성을 위해 구축된 벤치마크
ARC-AGI-3은 François Chollet과 ARC Prize 팀이 이전에 본 적이 없는 새로운 추론 퍼즐을 풀 수 있는 모델의 능력을 조사하기 위해 설계되었습니다. 이는 기억된 지식이 아닌 일반 지능에 대한 테스트입니다. 비교를 공정하게 유지하기 위해 공식 하네스는 공급자별 기능을 의도적으로 제거하여 중립 환경에서 원시 모델 기능을 측정합니다.
OpenAI의 반론은 이러한 중립성이 핸디캡이 될 수 있다는 것입니다. 회사는 공식 하네스가 Claude API가 이미 제공한 기능이 부족한 오래된 "OpenAI 스타일 완성 API"에 의존하여 원래 비교에서 OpenAI를 Anthropic에 비해 구조적으로 불리하게 만들었다고 주장합니다.
본질적으로 OpenAI는 다음과 같이 말합니다. 한 손을 등 뒤로 묶은 채 모델을 측정했습니다.
촐레의 답변
ARC Prize 공동 창립자인 François Chollet은 두 종류의 테스트 설정 사이에 명확한 선을 긋는 것으로 응답했습니다. 그는 "벤치마크를 해결하기 위해 맞춤 제작되었거나 벤치마크 형식에 대한 지식을 포함하는" 하네스에는 한계가 있다고 말했습니다. 그러나 "ARC-AGI-3용으로 개발되지 않았고 모든 API 사용자가 사용할 수 있는" 범용 API 설정은 공정한 게임입니다.
실제로 Chollet은 ARC Prize의 자체 GPT-5.6 Sol 점수가 OpenAI를 불리하게 만들었다는 점을 인정했습니다. 그는 조직이 "특히 압축과 관련하여 모델을 가장 잘 테스트하는 방법에 대해 OpenAI와 많은 의견 교환"을 했으며 회사가 "답을 찾기 시작한" 것을 환영했다고 언급했습니다.
Chollet은 한 가지 남은 우려 사항을 표시했습니다. 서로 다른 설정을 사용하는 여러 제공업체는 그가 "잠재적인 패리티 문제"라고 부르는 문제를 야기합니다. 그러나 그는 "설정과 비용이 명확하게 보고되는 한" 이를 허용할 수 있다고 생각합니다.
이것이 리더보드 이상으로 중요한 이유
이 에피소드는 AI 업계가 진행 상황을 평가하는 방식을 재편하는 긴장감을 강조합니다. 독립 실행형 시스템이 아닌 기능이 풍부한 API를 통해 모델이 점점 더 많이 배포됨에 따라 모델의 고유한 기능과 모델을 둘러싼 엔지니어링 사이의 경계가 점점 모호해지고 있습니다. 스캐폴딩을 무시하는 벤치마크는 실제 성능을 과소평가할 수 있습니다. 이를 수용하는 회사는 테스트를 진행한 회사에 보상을 줄 수 있습니다.
ARC-AGI-3 논쟁이 마지막이 아닐 것 같습니다. 프론티어 모델이 확립된 벤치마크의 상위권에 밀집해 있기 때문에 무엇이 공정한 측정으로 간주되는지, 그리고 누구의 하네스가 표준을 설정하게 되는지에 대한 의견 차이는 더욱 심해질 것입니다.
AI보다 앞서 나가세요
모델, 벤치마크, 이를 구축하는 연구소에 대한 AI 속보를 팔로우하고 싶으신가요? AI Buzz Wire가 도와드립니다.
AI 뉴스 더 보기