ARC Prize Foundation이 수요일 발표한 결과에 따르면 OpenAI의 GPT-6 Astra는 에이전트 지능을 측정하도록 설계된 추상 추론 벤치마크인 ARC-AGI-3에 대한 최첨단 결과를 게시했습니다. 이 모델은 재단의 표준 하니스에 따른 벤치마크의 Semi-Private 세트에서 62.7%를 기록했으며, 요청 사이에 모델의 내부 추론 상태를 유지하는 공급자 어댑터 하네스로 평가할 때 99.9%를 기록했습니다.

OpenAI가 새로운 시대의 시작을 알리는 주력 모델인 Astra의 단계적 출시를 시작한 지 하루 만에 결과가 나왔습니다. 프론티어 연구소 거래 벤치마크가 급락하면서 점수를 유지하려는 독자를 위해 최신 AI 개발 페이지에서 모든 주요 릴리스를 실시간으로 추적합니다.

두 개의 하네스, 두 개의 매우 다른 점수

Astra의 두 헤드라인 숫자 사이의 차이는 보고서에서 가장 중요한 세부 사항입니다. ARC Prize는 다양한 하네스에서 에이전트를 평가하고 각 하네스는 모델이 자체 컨텍스트에 따라 수행할 수 있는 작업을 변경합니다.

표준 하네스에서 모델은 환경에서 작동하면서 유지하기로 선택한 메모를 전달할 수 있습니다. 이러한 설정을 통해 Astra는 최대 추론 노력으로 62.7%의 점수를 얻었으며 평가 실행을 위한 총 비용은 26,098달러였습니다. 반대쪽 끝에서는 추론을 끈 상태에서 동일한 하네스를 실행하면 모델이 진전을 이루기 위해 더 많은 작업이 필요하기 때문에 35.2%의 결과만 얻었지만 더 많은 비용(49,791달러)이 소요되었습니다.

Provider Adapter 하네스는 더 관대합니다. 요청 간에 모델의 불투명한 추론 상태를 유지하고 긴 대화를 위해 압축을 사용하여 Astra가 이전 작업을 재사용할 수 있도록 합니다. 해당 하네스에서 Astra는 $18,817에 대한 높은 추론 노력에서 99.9%를 얻었고 $17,332에 대한 최대 노력에서 98.6%를 기록했습니다. 최저 추론 설정도 96.7%에 달했다.

즉, 부분 점수와 거의 완벽한 점수의 차이는 원시 기능 자체가 아니라 모델의 작업 상태가 단계 간에 얼마나 유지되는지에 달려 있습니다.

행동 효율성 면에서 인간을 능가함

ARC-AGI-3은 새롭고 추상적인 턴제 게임 환경을 기반으로 구축되었습니다. 에이전트는 지침 없이 탐색하고, 세상이 어떻게 돌아가는지 추론하고, 희박한 보상에서 목표를 식별하고, 다단계 작업을 계획해야 합니다. 인간이 100% 문제를 해결할 수 있도록 환경이 조정되어 인간의 성과가 벤치마크 측정 기준이 됩니다.

Astra는 대부분의 레벨을 해결했을 뿐만 아니라 효율적으로 해결했습니다. ARC Prize에 따르면 이 모델은 96% 레벨에서 인간을 테스트한 중앙값보다 적은 작업을 사용하여 세트 전체의 작업 효율성에서 인간 기준을 능가했습니다.

비교의 경제성은 극명합니다. 인간 테스트 참가자들은 90분 세션당 115달러에 완료된 게임당 5달러를 더해 시도한 게임당 대략 12.78달러를 받았습니다. 전체 Astra 평가 실행 비용은 구성에 따라 5자리입니다. 그러나 ARC Prize는 직관에 반하는 주름을 지적했습니다. Astra는 더 적은 수의 작업으로 게임을 해결하고 실행당 소모되는 총 모델 호출 수와 토큰 수를 줄였기 때문에 더 높은 추론 노력은 일반적으로 비용이 더 저렴합니다.

자체 언어를 구축하는 모델

점수 외에도 ARC Prize는 팀이 관찰한 질적 행동을 강조했습니다. Astra는 익숙하지 않은 환경을 컴팩트한 상징적 세계 모델로 지속적으로 전환했습니다. 즉, 게임 메커니즘을 논리적 규칙으로 표현하고 상태 및 계획 작업을 추적하기 위한 자체 도메인별 약어를 개발했습니다.

이것이 바로 ARC-AGI-3이 조사하도록 설계된 기술입니다. 이전 세대의 벤치마크가 새로운 패턴에 대한 유동적 추론을 테스트했다면, 3세대에서는 에이전트가 이전에 본 적이 없는 환경에서 탐색, 모델링, 목표 설정 및 계획 실행이 가능한지 여부를 테스트합니다. ARC Prize의 구성 요소는 탐색, 모델링, 목표 설정, 계획 및 실행으로 나열됩니다.

AGI 시대 배경

벤치마크 결과는 OpenAI 자체의 최대한의 수사 속에서 나왔습니다. The New Stack의 출시 보도에 따르면, 목요일 출시 전 언론 브리핑에서 그렉 브록먼(Greg Brockman) 회사 사장은 "우리가 지금 AGI 시대에 있다고 느끼는 것이 무리하지 않다"고 말하면서도 공식 선언에는 미치지 못했다고 합니다. 그는 AGI를 계약적 유발 요인이라기보다는 "임무 개념 또는 영적 개념"으로 설명했습니다.

OpenAI 연구원인 Aidan Clark은 Astra가 현재까지 회사에서 가장 큰 훈련 실행이었다고 말했습니다. 이는 텍사스의 Stargate 사이트에서 100,000개 이상의 GPU에 대한 최초의 사전 훈련이자 이전 모델이 훈련 프로세스를 감독하는 데 중요한 역할을 한 최초의 OpenAI 릴리스였습니다. 액세스는 단계적으로 유지됩니다. 출시는 Daybreak 프로그램의 기업 고객을 대상으로 시작되며 Plus, Pro, Business 및 Enterprise 가용성과 API 및 AWS 액세스는 향후 약속됩니다.

점수의 별표

여러 면에서 주의가 필요합니다. 두 헤드라인 숫자에서 알 수 있듯이 Astra의 ARC-AGI-3 성능은 하네스 구성에 크게 좌우되며, 모델 상태를 보존하는 맞춤형 하네스는 벤치마크 분쟁에서 반복적으로 논쟁거리가 되어 왔습니다. New Stack의 출시 분석에 따르면 Astra는 "특화된 작업에 큰 이점을 제공하지만 프리미엄이 적용되며 코딩 팩을 명확하게 주도하지 않습니다"라고 언급했습니다. 이는 에이전트 퍼즐 벤치마크와 일상적인 상용 작업 부하가 서로 다른 것을 측정한다는 점을 상기시켜 줍니다.

ARC Prize 자체는 현재 AI와 AGI 사이의 "잔여 격차"를 측정하는 것으로 운동을 구성하고 AGI를 인간이 할 수 있는 모든 기술을 인간이 할 수 있는 만큼 효율적으로 획득할 수 있는 능력으로 정의합니다. 유리한 조건에서 거의 만점에 가까운 점수가 있다고 해서 그 격차가 저절로 줄어들지는 않습니다. 그리고 평가 실행당 17,000~50,000달러의 비용으로 자원이 풍부한 실험실만이 이 규모로 벤치마크를 실행할 수 있습니다. 하지만 ARC Prize의 비용 데이터에 따르면 더 현명한 추론을 통해 실제로 비용을 줄일 수 있음을 알 수 있습니다.

중요한 이유

행동 효율성은 진정으로 새로운 비교 축입니다. 모든 레벨을 해결하지만 이를 수행하기 위해 수천 번의 호출을 낭비하는 모델은 Astra가 여기서 했던 것처럼 의도적으로 탐색하고, 학습한 내용을 압축하고, 그에 따라 실행하는 모델보다 유용성이 떨어지고 비용도 더 많이 듭니다. AGI 논쟁에 대해 어떤 결론을 내리든 ARC Prize 데이터는 이제 개척자들이 새로운 문제를 해결할 수 있는지 여부뿐만 아니라 문제를 얼마나 경제적으로 해결할 수 있는지에 대해서도 인간과 일치하고 있음을 보여줍니다.

AI보다 앞서 나가세요

모든 벤치마크 결과, 모델 출시 및 안전 토론을 실시간으로 추적 — 더 많은 AI 뉴스 읽기 →