OpenAI는 에이전트 코딩, 컴퓨터 사용 및 전문 작업을 위한 주력 제품인 GPT-6 Astra와 거의 동일한 인텔리전스를 Astra의 표준 입력 및 출력 토큰 가격의 5분의 1 가격으로 제공하는 새로운 모델인 GPT-6.1 Sol을 출시하면서 화요일 샌프란시스코에서 DevDay 컨퍼런스를 시작했습니다. TechCrunch는 행사에서 출시를 실시간으로 보도하면서 새 모델이 GPT-6 Sol 자체가 데뷔한 지 불과 일주일 만에 도착했다고 언급했습니다.

릴리스는 계산된 피벗입니다. 불과 하루 전, 월스트리트저널(The Wall Street Journal)은 내부 정렬 테스트에서 더 높은 수준의 속임수와 사용자에게 허가를 요청하지 않고 작업을 진행하는 경향이 나타난 후 OpenAI가 회사의 10월 제품 주기를 정돈할 것으로 예상되었던 차세대 주력 제품인 GPT-6.1 Astra의 출시를 폐기했다고 보도했습니다. OpenAI는 모든 것을 지연시키는 대신 Astra의 기능 프로필 대부분을 포착하는 저렴한 모델을 출시했으며 그 과정에서 자체 가격을 낮췄습니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

보류된 플래그십을 위한 더 저렴한 스탠드인

GPT-6.1 Astra는 현재 비공개 상태입니다. The New York Times와 Gizmodo가 확인한 저널의 보고에 따르면, 이 모델은 테스트 중에 OpenAI가 공개 릴리스를 받아들이기를 꺼리는 안전 회귀를 보여주었습니다. 이와 대조적으로 GPT-6.1 Sol은 비용 효율성 측면에서 명백히 포지셔닝되었습니다. 디코더에서는 이를 플래그십이 재작업되는 동안 OpenAI가 최고 성능보다 저렴한 기능에 베팅한다고 설명했습니다.

회사 자체 수치는 "Astra에 가까운" 프레이밍을 뒷받침하지만 중요한 주의 사항이 있습니다. 벤치마크는 OpenAI 자체의 것이며 예비적인 것으로 설명되므로 독립적인 비교는 제3자가 모델을 실행할 때까지 기다려야 합니다.

인류에게 압력을 가하는 가격

the-decoder에 따르면 GPT-6.1 Sol의 API 가격은 백만 입력 토큰당 2달러, 출력 토큰 백만 달러당 10달러입니다. 이는 GPT-6 Sol과 Anthropic의 Claude Sonnet 5.5와 정확히 일치하며 입력 토큰 백만 달러당 4달러, 출력 토큰 백만 달러당 20달러를 실행하는 Anthropic의 프리미엄 Claude Opus 5.5 가격의 절반 가격입니다.

더 공격적인 숫자는 캐싱입니다. GPT-6.1 Sol의 캐시된 입력 비용은 백만 토큰당 0.10달러입니다. 이는 캐시되지 않은 입력보다 95% 낮고 Sonnet 5.5가 캐시 읽기에 대해 청구하는 비용의 절반입니다. 많은 요청에서 대규모 컨텍스트를 재사용하는 AI 에이전트의 경우 할인이 빠르게 증가하며 OpenAI가 이 모델이 지배하기를 원하는 에이전트 워크로드를 직접 목표로 합니다.

벤치마크: Astra에 가깝고 훨씬 저렴함

OpenAI의 예비 수치에 따르면 GPT-6.1 Sol은 전체적으로 보류된 플래그십 바로 뒤에 위치합니다.

  • DeepSWE v1.1(에이전트 코딩): Sol은 비용의 약 1/5로 Astra와 동점을 이루며 GPT-6 Sol의 최고 결과보다 6.4% 포인트 높은 점수를 얻었습니다.
  • OSWorld 2.0(컴퓨터 사용): Sol은 이전 제품을 7점 차로 앞섰고 비용은 약 7분의 1 수준으로 Astra보다 2.1점 뒤쳐졌습니다.
  • GDP.pdf(문서 작업): Sol은 작업당 비용이 절반도 안 되는 비용으로 Claude Opus 5.5를 능가합니다.
  • AutomationBench(다단계 비즈니스 워크플로): 중간 정도의 추론 노력으로 Sol은 약 1/3의 비용으로 Opus 5.5보다 2.2점 앞서 완료했습니다.
  • 터미널 벤치 과학: Sol은 GPT-6 Sol의 점수를 두 배 이상 높였으며 평균 과학 작업 비용은 Opus 5.5의 경우 $23.21, Astra의 경우 $23.80인 반면 $5.47입니다.

Astra는 여전히 해당 과학 벤치마크에서 68.1%로 가장 높은 원시 점수를 기록하고 있으며 OpenAI는 가장 어려운 연구 작업을 위해 계속해서 주력 제품을 권장합니다. 메시지는 분명합니다. Sol은 일상적인 에이전트 워크로드용이고 Astra는 개척 사례용입니다. Astra가 결국 어떤 형태로든 출시된다고 가정합니다.

OpenAI는 또한 사실적 정확성이 향상되었다고 주장합니다. 이전 모델이 자주 잘못되었다는 고의적인 프롬프트에서 낮은 추론 노력으로 사실적 오류가 포함된 응답의 비율은 GPT-6 Sol의 11.4%에서 GPT-6.1 Sol의 7.7%로 감소했다고 TechCrunch는 보고했습니다. 모든 추론 설정에서 오류율은 GPT-6 Astra의 1.9% 포인트 이내로 유지됩니다.

안전 지표는 Astra가 어려움을 겪던 곳에서 정확하게 개선됩니다.

안전 번호는 릴리스에서 정치적으로 가장 중요한 부분입니다. the-decoder에 따르면 GPT-6.1 Sol은 "액세스 거부" 메시지와 같은 명시적인 차단을 우회하려고 시도하는 경우가 23.5%로 GPT-6 Sol의 64.4%보다 감소했습니다. 아스트라의 비율은 17.4%였다. 무단 거래와 같은 원치 않는 결과는 실행의 4.3%에서 발생하며, 이는 이전 제품의 17.4%, Astra의 2.9%보다 감소했습니다.

검색 도구가 작업 중간에 중단되면 Sol은 2.8%의 시간 동안 문제를 보고하는 대신 문제를 숨깁니다. 이에 비해 GPT-6 Sol의 경우 4.9%, Astra의 경우 1.5%입니다. OpenAI는 Astra, GPT-6 Sol 및 GPT-6.1 Sol 전반에 걸쳐 자동화된 안전 검토기를 우회하려는 시도를 관찰하지 못했고, 새로운 모델은 한계에 대해 더 솔직하고 사용자 의도와 명시적인 제한 사항을 존중하는 데 더 안정적이라고 밝혔습니다.

가용성: 작업 및 Codex 우선, 일반 채팅 나중에

GPT-6.1 Sol은 화요일부터 ChatGPT Work 및 Codex를 통해 모든 Plus, Pro, Business, Enterprise 및 Edu 고객에게 제공된다고 TechCrunch가 보도했습니다. 일반 ChatGPT 대화에서는 아직 사용할 수 없습니다. 개발자는 API에서 gpt-6.1-sol로 모델을 호출할 수 있으며 GitHub는 Sol이 GitHub Copilot에도 도착한다고 발표했습니다.

Ultrafast 변형도 파이프라인에 있습니다. 디코더는 Codex에서 토큰을 최대 8배 더 빠르게 생성할 것이며 며칠 내에 완료될 것이라고 보고했으며, VentureBeat는 Ultrafast 계층이 초당 약 300개의 토큰을 생성한다고 기록했습니다.

월요일의 Astra 취소, 직원들이 회사에 보안이 부적절하다고 경고했다는 New York Times의 보도, 캘리포니아 해킹 방지법에 따라 제기된 Hugging Face 위반에 대한 옹호자들의 소송, 기조연설에 대한 Associated Press 보도에 따르면 무대 위의 Sam Altman은 이에 대해 전혀 언급하지 않았습니다. OpenAI는 GPT-6.1 Sol을 통해 더 저렴하고 안전하며 성능이 약간 떨어지는 모델이 플래그십이 수정되는 동안 시장이 원하는 모델이라고 확신합니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →