독립 벤치마킹 회사인 Artificial Analysis에 따르면, OpenAI는 9월 29일에 GPT-6.1 Sol을 출시했으며, 해당 모델이 출시된 지 7일 만에 GPT-6 Sol을 폐기했습니다. 이번 교환은 회사의 DevDay 개발자 컨퍼런스와 동시에 진행되었습니다. CNET에서는 참석자들이 새로 출시된 Dots 에이전트 및 일련의 구독 변경 사항과 함께 즉시 GPT-6.1 Sol을 사용할 수 있다고 보고했습니다.

7일 간의 플래그십 간 교체는 2026년의 가속화된 표준에서도 이례적이며, 벤치마크는 OpenAI가 빠르게 움직이는 이유를 제시합니다. 모델 출시, 벤치마크 경쟁, 그에 따른 가격 전쟁을 지속적으로 보도하기 위해 AI Buzz Wire는 중요한 개발 상황을 추적합니다.

7일 만에 측정 가능한 상승

인공 분석에 따르면 GPT-6.1 Sol은 회사의 지능 지수에서 GPT-6 Sol보다 4포인트, GPT-5.6 Sol보다 5포인트 높아 OpenAI의 가장 유능한 모델인 GPT-6 Astra보다 1포인트 낮은 수준입니다. 회사의 평가는 추론, 지식 작업, 수학 및 에이전트 작업을 단일 비교 점수로 혼합합니다.

하위 점수는 이익이 집중되는 위치를 보여줍니다. GPT-6.1 Sol은 AA-Briefcase v1.1에서 4점, GDPval-AA v2.1에서 5점을 향상시켰으며, 두 가지 모두 에이전트 지식 작동을 테스트합니다. Terminal-Bench 4.0의 12포인트 점프는 실제 터미널 환경에서 실질적으로 향상된 성능을 의미하며 Humanity's Last Exam은 5포인트, GDP.pdf는 6포인트 상승했습니다.

연구를 위해 모델을 사용하는 사람에게는 한 가지 수치가 눈에 띕니다. AA-Omniscience의 정확도는 8포인트 증가한 반면 환각 비율은 60%에서 54%로 감소했습니다. 절대적인 측면에서는 두 수치 모두 높은 수준을 유지하지만 확실한 오답이 무응답보다 더 나쁜 워크플로에서는 이동 방향이 중요합니다.

동일한 스티커 가격, 실제로는 더 저렴함

가격 면에서 GPT-6.1 Sol은 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 10달러라는 GPT-6 Sol 요율표를 유지하지만 캐시 읽기 할인은 90%에서 95%로 늘어납니다. 인공 분석에 따르면 에이전트 워크로드에 대한 GPT-6.1 Sol의 혼합 가격은 GPT-6 Sol보다 약간 낮으며 GPT-6 Sol이 GPT-5.6 Sol에 대해 50% 할인된 가격으로 출시되었을 때 시작된 효과적인 가격 인하가 연속적으로 연장되었습니다.

가격 궤적은 여기서 실제 이야기입니다. 두 번의 릴리스 기간 동안 OpenAI는 미드티어 프론티어 라인의 유효 비용을 대략 두 배로 줄이면서 매번 품질을 향상시켰습니다.

작업당 비용: $0.72 대 $3.26

작업당 비용은 GPT-6 Astra와의 격차가 극명해지는 부분입니다. 최대한의 노력으로 인공 분석은 GPT-6.1 Sol을 지능 지수 작업당 $0.72로 고정합니다. 이는 GPT-6 Astra의 $3.26의 4분의 1 미만입니다. 이전 버전에 비해 절감 효과는 31%(GPT-6 Sol의 경우 1.05달러)이고 GPT-5.6 Sol에 비해 64%(1.99달러)에 이릅니다.

회사에 따르면 GPT-6.1 Sol의 모든 노력 수준은 비용 효율성 파레토 프론티어를 확장합니다. 즉, 특정 수준의 지능에 대해 추적하는 모델 중에서 더 저렴한 옵션이 존재하지 않는다는 의미입니다. 토큰 효율성 그림은 좀 더 혼합되어 있습니다. GPT-6.1 Sol은 노력 수준 전반에 걸쳐 GPT-6 Sol보다 약 10~30% 더 많은 출력 토큰을 소비하지만 높은 인텔리전스가 고려되면 낮음 및 중간 노력 설정은 토큰 효율성에 대해 파레토 최적으로 유지됩니다. 코딩에서 모델은 회사의 코딩 에이전트 지수에서 최대 노력으로 GPT-6 Sol보다 3포인트를 얻었습니다.

7일 처리 시간이 중요한 이유

DevDay의 더 넓은 범위는 동일한 그림을 강화합니다. CNET의 보고서는 먼 연구 미리 보기보다는 개발자가 즉시 사용할 수 있는 세 가지(GPT-6.1 Sol, Dots 에이전트 및 재작업된 구독 계획)를 중심으로 컨퍼런스를 구성했습니다. 개발자에게 보내는 메시지는 내일의 가능성이 아니라 오늘의 가용성이었습니다.

Flagship은 경쟁 제약이 ​​교육 실행에서 교육 후 개선 및 서비스 인프라로 전환되었다는 짧은 신호를 보냅니다. 일주일 안에 제공되는 포인트 수준 업그레이드는 처음부터 기초 모델이라기보다는 최적화된 체크포인트 및 새로운 가격 시트처럼 보이며 경쟁사들도 같은 방식으로 행동하고 있습니다. Google은 9월 30일에 처음으로 Fairwind 프로그램을 통해 신뢰할 수 있는 사이버 방어자에게 백만 토큰당 $2/$10의 동일한 비율로 도달하는 프론티어 모델인 Gemini 4 Argon을 발표했습니다.

개발자에게는 검증된 수치에서 세 가지 실질적인 시사점을 얻을 수 있습니다. 첫째, 캐시 재사용이 많은 에이전트 워크로드는 95% 캐시 할인 혜택을 즉시 누릴 수 있습니다. 둘째, 모델이 더 오래 생각하더라도 토큰당 가격은 변하지 않기 때문에 예산은 마이그레이션하기 전에 더 높은 출력 토큰 소비를 모델링해야 합니다. 셋째, Astra는 지능의 마지막 지점이 4배의 비용 프리미엄 가치가 있는 작업의 상한선으로 남아 있습니다. GPT-6.1 Sol의 사례는 대부분의 작업에서 그렇지 않다는 것입니다.

반복할 가치가 있는 주의 사항: 이 수치는 단일 독립 평가자로부터 나온 것이지만 방법론이 엄격하고 지수 점수는 특정 작업 부하 혼합에 대해 보상합니다. 워크로드가 까다로운 팀은 프로덕션 트래픽을 다시 라우팅하기 전에 자체 평가를 다시 실행해야 합니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →