OpenAI는 2026년 7월 30일에 세 가지 GPT-5.6 모델 중 두 가지의 API 가격을 인하하여 해당 제품군이 일반 공급에 도달한 지 불과 3주 만에 가장 저렴한 계층을 80% 인하했습니다. 이러한 움직임은 선도적인 모델 제조업체가 비용에 민감한 대용량 워크로드를 위해 얼마나 공격적으로 경쟁하고 있는지, 그리고 고객이 현재 모든 토큰을 얼마나 밀접하게 계산하고 있는지를 나타냅니다. AI 경제학의 광범위한 변화에 대해 자세히 알아보려면 최신 AI 개발을 팔로우하세요.

달라진 점

OpenAI가 게시한 요율표 및 API 변경 로그에 따르면 표준 백만 개당 토큰 가격은 다음과 같습니다.

  • GPT-5.6 Luna: 20센트 입력 및 1.20달러 출력, $1 및 $6에서 인하 — 80% 감소
  • GPT-5.6 Terra: $2.50 및 $15에서 $2 및 $12 인하 — 20% 인하
  • GPT-5.6 Sol(플래그십): $5 및 $30, 변경되지 않음

세 가지 계층 모두 2026년 7월 9일에 더 높은 가격으로 일반 공급이 시작되었으며, 가족의 상업 수명이 단 21일 만에 가격 조정이 이루어졌습니다. Reuters와 CNBC는 둘 다 삭감을 확인했으며 Axios는 Luna 모델에서 가장 급격한 감소가 발생했다고 보고했습니다.

모든 서비스 계층을 통한 흐름 감소

할인은 헤드라인 가격에만 국한되지 않습니다. 요율표의 모든 옵션을 통해 전달됩니다.

  • 배치 및 플렉스 처리는 둘 다 표준 가격의 절반이므로 Luna는 백만 토큰당 입력 10센트, 출력 60센트입니다.
  • 캐시된 입력 읽기, 90% 할인, Luna에서는 토큰 백만 개당 2센트, Terra에서는 20센트로 떨어집니다.
  • 장기 컨텍스트 요청은 입력 요금의 2배, 출력 요금의 1.5배로 청구되며 Luna의 경우 40센트 및 1.80달러입니다.

이미 대량 분류, 추출 또는 장기 상담사 루프를 저렴한 계층을 통해 라우팅하고 있는 팀의 경우 동일한 통화 비용이 하루 전보다 훨씬 저렴해졌습니다.

컷을 Anthropic과 비교하는 방법

Anthropic의 가격 페이지에 따르면 Luna는 이제 20센트와 1.20달러로 Anthropic의 가장 저렴한 공개 모델인 Haiku 4.5를 입력에서 약 5배, 출력에서 4배 정도 깎아줍니다. Terra의 새로운 요금은 2026년 8월 31일에 초기 가격이 만료되면 Claude Sonnet 5가 청구할 예정인 3달러와 15달러보다 낮습니다.

두 라인업 모두에서 Sol은 가격이 5달러와 25달러인 Anthropic의 Opus 5보다 출력 비용이 여전히 더 높습니다.

우선 처리가 빠른 모드로 전환됨

동일한 변경 로그 항목은 "우선 처리"를 중단하고 "빠른 모드"로 대체했습니다. OpenAI는 플래그십 Sol 모델의 경우 Fast 모드가 두 배의 가격으로 표준 속도의 최대 2.5배까지 실행되며 스위치가 이전 버전과 호환된다고 말합니다. 요청은 코드 변경 없이 Fast 모드로의 우선순위 경로에 이미 태그가 지정되어 있습니다.

고속 모드 요금은 Sol의 경우 10달러와 60달러, Terra의 경우 4달러와 24달러, Luna의 경우 40센트와 2.40달러입니다. 특히 Anthropic은 동일한 이름과 동일한 조건으로 동일한 제품을 판매하며 이제 두 요율표가 지역별 추론에도 수렴됩니다. OpenAI는 고객이 데이터 상주를 요구할 때 2026년 3월 5일 이후 출시된 모델에 대해 10% 인상을 청구하는 반면, Anthropic은 미국 전용 추론에 표준 요율의 1.1배를 청구합니다.

저렴한 등급이 더 저렴해진 이유

컷 하루 전, OpenAI는 추론 스택 전반에 걸친 최적화를 설명하는 엔지니어링 게시물을 게시했습니다. 회사의 기술 직원 중 5명은 Codex 코딩 도구 내에서 실행되는 Sol이 프로덕션 GPU 커널을 다시 작성했다고 썼습니다. OpenAI에서는 엔드투엔드 서비스 비용을 20% 절감했다고 밝혔습니다. 이 모델은 또한 수백 번의 실험을 통해 자체 추측 디코딩 초안 모델을 재설계했으며, 이 변경으로 인해 토큰 생성 효율성이 15% 이상 향상되었습니다.

이는 자체 스택에 대한 OpenAI 자체 수치이지만 가격 인하 문제가 해결되는 동일한 비용 센터, 즉 Codex 및 ChatGPT 뒤에 있는 에이전트 하네스를 가리킵니다. OpenAI는 기본적으로 도구 출력을 10,000개의 토큰으로 제한하고 모델 표시 기록을 추가 전용으로 유지하므로 모든 단계에서 지침을 다시 보내는 에이전트 루프는 전체 입력 요금을 지불하는 대신 프롬프트 캐시에 도달합니다. 회사는 "더 널리 사용 가능하고 비용 효율적인 인텔리전스의 형태로 내부 개선 사항을 사용자에게 다시 제공"하겠다는 약속으로 게시물을 마감했습니다. 요율표는 하루 후에 나왔습니다.

클라우드 파트너 및 청구

OpenAI는 Amazon Bedrock을 통해 트래픽을 라우팅하는 구매자에게 AWS에서 요금을 청구하며 해당 요금은 자체 게시된 카드와 다를 수 있다는 점에 주목했습니다. 더 많은 기업이 단일 클라우드 공급업체를 통해 모델 액세스를 중앙 집중화함에 따라 OpenAI의 직접 가격과 고객이 중개자를 통해 실제로 지불하는 금액 간의 격차는 헤드라인 수치만큼이나 중요해질 것입니다.

모든 토큰을 계산하는 시장

기업 구매자가 추론 지출을 그 어느 때보다 더 자세히 감사함에 따라 삭감이 이루어집니다. 이번 주 초, 주요 플랫폼에서 기업 AI 비용이 급등하면서 비용을 보지 않고 볼륨을 늘리는 무제한 "tokenmaxxing" 시대가 어떻게 사라지고 있는지에 대한 보고가 있었습니다. 마진을 확보하기보다는 내부 비용 절감액을 고객에게 전가하기로 한 OpenAI의 결정은 현재 경쟁이 벌어지고 있다고 생각하는 곳이 어디인지를 보여주는 분명한 신호입니다. Sol이 여전히 프리미엄 가격을 책정하고 있는 프런티어가 아니라 실제로 대부분의 생산 트래픽이 존재하는 저렴하고 대량 생산되는 계층입니다.

Sol의 가격이 변경되지 않았으므로 개발자의 실시간 결정은 제품군이 출시된 이후 OpenAI가 설정한 위치, 즉 각 요청에 필요한 계층이 정확히 유지됩니다. 차이점은 잘못된 결정을 내리는 데 드는 비용이 극적으로 감소했다는 것입니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →