벤치마킹 회사인 Artificial Analysis는 2026년 9월 4일에 최신 AI 모델을 측정하는 방법을 재작업하는 임시 업데이트인 Intelligence Index 버전 4.2를 출시했습니다. 새로운 리더보드에 따르면 Anthropic의 Claude Fable 5.1이 1위를 차지했으며 OpenAI의 GPT-6 Astra는 GPT-5.6 Sol보다 4포인트 상승한 후 2위를 차지했습니다.
이 업데이트는 1월에 Index v4가 출시된 지 불과 8개월 만에 나온 것입니다. 이는 회사가 최근 개척 버전의 출시 속도에 힘입어 이례적으로 빠른 전환을 이룬 것입니다. 회사는 발표문에서 "지난 몇 주 동안 변화가 너무 빠르게 진행됨에 따라 지수가 그 어느 때보다 관련성과 유용성을 유지할 수 있도록 즉각적인 중간 업데이트를 제공하는 것이 중요하다고 생각합니다"라고 밝혔습니다.
헤드라인 순위
발표된 결과에 따르면 Anthropic의 Claude Fable 5.1이 지수 1위를 차지했으며, OpenAI의 GPT-6 Astra가 GPT-5.6 Sol보다 4점 향상되었습니다. Meta는 리더보드에서 세 번째로 강력한 연구소로 평가되었으며 SpaceXAI, Moonshot/Kimi, Z.AI 및 Google이 그 뒤를 이었습니다.
Anthropic과 OpenAI는 또한 업데이트된 비용 효율성 그림을 공유합니다. 두 회사는 Meta 및 Z.AI와 함께 Index의 "작업당 비용" Pareto 경계를 점유합니다. 이는 현재 완료된 작업당 동일한 가격으로 더 나은 인텔리전스를 제공하는 다른 실험실이 없음을 의미합니다.
토큰 효율성 측면에서 인공 분석에서는 Claude Fable 5.1, Grok 4.5 및 Gemini 3.5 Flash-Lite가 곡선의 양쪽 끝에 있는 GPT-6 Astra가 "정보 경계 근처의 거의 모든 다른 모델보다 토큰 효율성이 더 높다"는 사실을 발견했습니다. 그러나 회사는 동료 분석에서 Astra의 낮은 토큰 사용량보다 높은 가격이 더 중요하다고 지적했습니다. 이는 원시 효율성과 총 비용이 항상 함께 움직이는 것은 아니라는 점을 상기시켜 줍니다.
v4.2에서 변경된 사항
가장 중요한 구조적 변화는 벤치마크 게임에 대한 의도적인 추진입니다. 이제 지수 가중치의 40%는 AA-Briefcase, AA-Omniscience 및 CritPt용 솔루션을 포함하여 v4.1의 점유율의 두 배인 비공개 홀드아웃 테스트 세트에서 나옵니다. 회사는 Index v5에서는 그 수치가 더욱 높아질 것이라고 말했습니다.
두 가지 새로운 평가가 업데이트를 고정합니다.
- AA-Briefcase, 비공개 테스트 세트를 갖춘 사내 에이전트 지식 작업 벤치마크입니다. 모델은 연결된 여러 작업과 수천 개의 입력 소스 파일이 포함된 여러 주에 걸친 전문 프로젝트에서 평가되며 검증 가능한 작업 성공, 분석 품질 및 프레젠테이션 품질을 포괄하는 루브릭 채점 및 쌍별 비교의 조합을 통해 등급이 매겨집니다.
- 전문 문서 전반에 걸쳐 단일 회전 추론을 테스트하는 Surge AI에서 만든 GDP.pdf: 10개 도메인에 걸쳐 있는 100개의 PDF, 4,592페이지의 텍스트, 표, 차트 및 각주에 증거가 분산되어 있습니다. 응답은 전문가가 작성한 1,275개의 원자 기준에 따라 등급이 매겨지며, 헤드라인 All-pass Rate는 모든 기준이 충족되는 경우에만 작업에 대한 크레딧을 부여합니다.
오랫동안 지속되어 온 벤치마크 중 하나가 곧 종료됩니다. 대학원 수준의 과학 추론 테스트인 GPQA Diamond는 프론티어 모델에 의해 효과적으로 포화되었기 때문에 제거되었습니다.
또한 회사는 새로운 채점 시스템 프롬프트 및 수정된 답안 키가 포함된 AA-LCR v1.1을 출시하고, GDPval-AA v2 및 AA-Briefcase에 대한 Elo 척도를 다시 고정하여 새 모델이 출시될 때 등급이 안정적으로 유지되고, 느리지만 올바른 코드가 더 이상 실패로 간주되지 않도록 SciCode의 채점 샌드박스를 강화하여 채점 인프라를 업그레이드했습니다.
새로운 테스트에서 밝혀진 것
새로운 평가 결과는 프론티어 연구소가 실제로 어디에 있는지에 대한 보다 세부적인 그림을 제공합니다.
AA-Briefcase에서는 Anthropic의 Claude Fable 5.1과 Opus 5가 선두를 달리고 있으며 OpenAI의 GPT-6 Astra와 Meta의 Muse Spark 1.3이 그 뒤를 따릅니다. GPT-6 Astra는 동일한 평가에서 GPT-5.6 Sol보다 약 85 Elo 포인트를 얻었습니다. 이는 연속적인 OpenAI 세대 간의 상당한 도약입니다.
GDP.pdf에서는 상황이 반전됩니다. OpenAI가 GPT-6 Astra로 33.2%의 전체 통과율로 선두를 달리고 있으며 GPT-5.6 Sol이 28.2%, Claude Fable 5.1이 26.2%로 그 뒤를 따릅니다. 이러한 차이는 Anthropic의 모델이 전체 Index 및 에이전트 작업 작업을 주도하더라도 OpenAI의 최신 모델에 대해 매우 큰 컨텍스트에 대한 긴 문서 합성이 상대적인 강점으로 남아 있음을 시사합니다.
비공개 테스트 세트가 중요한 이유
보류 평가로의 전환은 AI 벤치마킹의 광범위한 신뢰성 문제를 반영합니다. 모델이 더 많은 공개 테스트 데이터를 흡수함에 따라 실험실과 독립적인 관찰자들은 잘 알려진 벤치마크의 헤드라인 점수가 실제 능력보다는 암기 또는 목표 교육을 반영한다는 점에 점점 더 우려하고 있습니다. 테스트 세트의 점점 더 많은 부분을 비공개로 유지하고 이에 더 많은 가중치를 부여함으로써 인공 분석은 공개 순위표가 잃어가고 있다는 신호를 보존하려고 시도하고 있습니다.
회사는 "몇 달 동안" Index v5의 요소를 구축해 왔으며 최근 주요 모델 출시의 물결을 통해 지수를 안정적으로 유지하기 위해 의도적으로 업데이트를 보류했다고 밝혔습니다. v4.2 임시 릴리스 이후 v5 전환이 완료되면 가까운 시일 내에 더 많은 증분 업데이트를 계획하고 있습니다.
프론티어 모델 중에서 선택하는 구매자의 경우, v4.2에서 얻을 수 있는 실질적인 교훈은 시장의 선두가 Anthropic과 OpenAI 사이의 두 경쟁으로 남아 있고 Meta가 그 격차를 좁히고 있으며 게임에 저항하도록 설계된 평가가 이제 더 많은 순위 작업을 하고 있다는 것입니다. 모델 선택 결정을 추적하는 사용자는 v5 출시가 가까워짐에 따라 최신 AI 개발을 따를 수 있습니다.
AI보다 앞서 나가세요
이와 같은 벤치마크 업데이트는 업계 심사위원의 진행 방식을 재편합니다. AI 뉴스 자세히 읽기 모든 모델 출시에 앞서 나가세요.
AI 뉴스 자세히 보기 →