Cerebras와 OpenAI는 OpenAI API에서 처음으로 출시되고 Cerebras 하드웨어로 구동되는 새로운 서비스 계층인 Ultrafast Mode를 세상에 미리 선보였습니다. 2026년 8월 13일에 발표된 Cerebras 발표에 따르면 Ultrafast에서 실행되는 GPT-5.6 Sol은 품질 저하 없이 초당 최대 750개의 출력 토큰을 제공합니다.

이 계층은 처음에는 특정 고객 그룹에게 제공되며 시간이 지남에 따라 액세스가 확장됩니다. Cerebras의 Joyce Er이 작성한 이 발표는 수년 동안 AI 제품 개발을 정의해 온 절충안의 해결책으로 이 제품을 제시합니다. 더 크고 스마트한 모델은 응답 시간을 늦추는 더 높은 계산 및 데이터 이동 비용을 발생시키기 때문에 제작자는 속도와 지능 중에서 선택해야 했습니다. 프론티어 모델을 가속화하기 위한 경쟁을 따르는 독자들은 AI Buzz Wire에서 최신 개발 상황을 추적할 수 있습니다.

Ultrafast는 정확히 얼마나 빠른가요?

원시 처리량 수치는 그 자체로 놀랍지만 Cerebras도 비교 컨텍스트를 제공했습니다. 독립적인 벤치마킹 서비스인 Artificial Analysis에서 보고한 출력 속도에 따르면 Ultrafast 모드의 GPT-5.6 Sol은 다음과 같이 실행됩니다.

  • Fable 5보다 11배 빠릅니다
  • 빠른 모드에서 Opus 4.8보다 5배 빠릅니다

주장에 대한 스트레스 테스트를 위해 Cerebras는 Humanity's Last Exam(HLE)에서 인기 경쟁사와 정면으로 모델을 실행했습니다. HLE(Humanity's Last Exam)**는 일반적으로 화학, 경제학, 문학과 같은 분야에서 박사 학위를 보유한 사람들만 답할 수 있는 2,500개의 질문으로 구성된 어려운 벤치마크입니다.

결과: Ultrafast의 GPT-5.6 Sol은 11시간 11분 만에 HLE 질문 2,500개에 모두 답변했습니다. Claude Fable 5가 동일한 결론에 도달하려면 78시간 27분, 즉 3일 이상의 연속 컴퓨팅이 필요했습니다. 즉, Ultrafast는 단 하루 만에 인간 지식의 최전선을 통과하여 거의 7배 더 빠르게 비슷한 정확도를 달성했습니다.

Cerebras는 벤치마킹 방법론을 언급했습니다. GPT-5.6 Sol Ultrafast는 7월 10일 xhigh 추론에서 Codex를 사용하여 테스트되었으며, Claude Fable 5는 7월 13~15일 xhigh 추론에서 Claude Code를 사용하여 테스트되었습니다.

단순한 벤치마크가 아닌 실제 워크로드

도중에 품질이 저하되면 속도 벤치마크가 오해의 소지가 있을 수 있으므로 Cerebras는 경제적으로 가치 있는 지식 작업 작업에 대한 벤치마크인 GDP-Val에 대한 결과도 강조했습니다. GDP-Val에서 Ultrafast는 품질 저하 없이 전체 속도 향상을 제공했습니다.** Cerebras가 2026년 7월 31일 Codex 내 중간 추론에서 GPT-5.6 Sol 및 GPT-5.6 Sol Ultrafast를 사용하여 실행한 테스트에 따르면.

회사는 GPT-5.6 Sol이 법률 브리핑, 재무 모델 및 엔지니어링 보고서(출력 품질과 처리 시간 모두 직접적인 재정적 영향을 미치는 영역)를 위한 OpenAI 최고의 모델이라고 말합니다.

속도가 에이전트 방정식을 변경하는 이유

더 중요한 변화는 AI 에이전트의 작동 방식에 있을 수 있습니다. 더 빠른 추론은 개인과 조직의 가능성을 변화시킵니다. 에이전트는 매 초가 중요한 문제의 중요한 경로에 배치될 수 있기 때문입니다.

OpenAI의 제품인 Rohan Varma는 발표문에 인용된 성명에서 "GPT-5.6 Sol Ultrafast를 통해 Cerebras는 사용자의 생각, 코딩 및 협업 방식을 따라잡는 AI를 가능하게 합니다."라고 말했습니다. "Ultrafast 추론을 통해 워크플로와 애플리케이션이 어떻게 변화하는지 확인하게 되어 매우 기쁩니다."

Cerebras는 속도 향상이 중요한 몇 가지 고위험 시나리오를 설명했습니다.

사고 대응

웹 서비스를 운영하는 회사는 Ultrafast를 사용하여 생산 중단의 근본 원인을 해결하고 고객 신뢰를 유지하며 수익 손실을 방지하고 SLA에 따른 가동 중지 시간을 단축할 수 있습니다.

사이버 보안

적대적이고 위험성이 높은 사이버 공격에서 보안 팀은 악의적인 행위자를 신속하게 감지하고 이에 대응하여 치명적인 손실을 억제해야 합니다. 이 작업에서는 추론 대기 시간이 피해 제어에 직접적인 영향을 미칩니다.

상담원 생산성

Ultrafast는 실시간 통찰력과 업데이트를 제공하여 병렬 세션 전반에 걸쳐 컨텍스트 전환의 필요성을 줄여 에이전트와 작업하는 새로운 모드를 지원합니다.

OpenAI의 연구원인 Jeffrey Wang은 발표에서 "이전에는 작업이 완료될 때까지 몇 분 정도 기다려야 했지만 이제는 컨텍스트를 전환할 기회도 생기기도 전에 작업이 완료됩니다. 덕분에 생산성이 훨씬 더 높아졌습니다."라고 말했습니다.

파트너십의 전략

Cerebras에게 이번 거래는 AI 추론을 위한 웨이퍼 규모 가속을 상용화하려는 노력의 또 다른 이정표를 의미합니다. OpenAI의 경우 Ultrafast 모드는 추론 지연 시간이 경쟁적인 차별화 요소가 된 순간에 API에 프리미엄 속도 계층을 추가합니다. 특히 호출당 지연이 몇 분의 대기 시간으로 복합되는 많은 모델 호출을 함께 연결하는 에이전트 애플리케이션의 경우 더욱 그렇습니다.

기업은 이 계층을 조직이 들어오는 정보에 신속하게 대응하기 위해 프론티어 AI를 사용하는 지속적인 엣지로 구성하고, 시간에 민감한 작업을 위한 초고속 처리와 백그라운드에서 병렬화할 수 있는 상용 작업을 위한 표준 처리를 결합합니다.

액세스는 점진적으로 출시됩니다. 관심 있는 개발자는 OpenAI API 문서의 가용성을 모니터링할 수 있습니다. Cerebras는 시간이 지남에 따라 초기 선택된 고객 그룹에서 액세스가 확장될 것이라고 말했습니다.

AI보다 앞서 나가세요

인공 지능을 재편하는 하드웨어 및 인프라 경쟁에 대한 자세한 내용을 보려면 AI Buzz Wire를 북마크에 추가하고 AI 하드웨어 뉴스 피드를 팔로우하세요.

AI 뉴스 자세히 보기 →