Cerebras Systems와 OpenAI는 OpenAI API에서 최초로 출시되고 Cerebras 웨이퍼 규모 기술로 구동되는 새로운 서비스 계층인 Ultrafast Mode에 대한 초기 모습을 공유했습니다. 이 파트너십을 통해 GPT-5.6 Sol은 초당 최대 750개의 출력 토큰으로 실행되어 실시간 속도로 최전선 수준의 인텔리전스를 제공할 수 있습니다. 최신 AI 하드웨어 소식은 AI 버즈와이어에서 확인하세요.

속도-지능 절충 제거

AI 빌더는 오랫동안 근본적인 균형에 직면해 왔습니다. 즉, 모델의 크기와 지능이 확장됨에 따라 계산 및 데이터 이동 비용이 높아지고 응답 시간이 느려집니다. 개발자는 높은 품질의 결과를 기다리거나 짧은 시간 내에 열등한 결과를 수용하는 것 중에서 선택해야 했습니다.

초고속 모드의 GPT-5.6 Sol은 이러한 딜레마를 해결하도록 설계되었습니다. Cerebras에 따르면 이 서비스는 인공 분석에서 보고한 출력 속도를 기준으로 Fast 모드에서 Anthropic의 Claude Fable 5보다 11배, Opus 4.8보다 5배 빠르게 실행됩니다.

인류의 마지막 시험: 속도 테스트

Cerebras는 일반적으로 화학, 경제, 문학과 같은 분야의 박사 학위 소지자만이 답할 수 있는 2,500개의 질문으로 구성된 까다로운 벤치마크인 Humanity's Last Exam(HLE)에서 경쟁 모델과 비교하여 Ultrafast를 테스트했습니다.

Cerebras가 실시한 평가에서 Ultrafast 모드의 GPT-5.6 Sol은 11시간 11분 만에 2,500개의 HLE 질문에 모두 답했습니다. Claude Fable 5는 동일한 결론에 도달하기 위해 78시간 27분, 즉 3일 이상의 연속 계산이 필요했습니다. 즉, Ultrafast는 단 하루 만에 인간 지식의 최전선을 처리하여 거의 7배 더 빠르게 비슷한 정확도를 달성했습니다.

벤치마킹은 7월 10일 높은 추론 설정에서 Cerebras가 GPT-5.6 Sol Ultrafast with Codex를 사용하고, 7월 13일부터 15일까지 높은 추론 설정에서 Claude Fable 5를 Claude Code를 사용하여 수행했습니다.

실제 비즈니스에 미치는 영향

경제적으로 가치 있는 지식 작업 작업에 대한 벤치마크인 GDP-Val에서 Ultrafast는 품질 저하 없이 5.6배의 엔드투엔드 속도 향상을 제공했습니다. 이는 더 빠른 추론이 출력 품질을 희생하지 않고도 경제적으로 가치 있는 작업을 얼마나 가속화할 수 있는지를 보여줍니다.

Cerebras는 Ultrafast를 매 순간이 중요한 시나리오를 위한 도구로 구상합니다. 웹 서비스를 운영하는 회사는 이 기술을 사용하여 생산 중단의 근본 원인을 보다 신속하게 해결하고 고객 신뢰를 유지하고 수익 손실을 방지할 수 있습니다. 위험이 큰 사이버 보안 상황에서 보안 팀은 Ultrafast를 활용하여 공격을 신속하게 탐지하고 대응할 수 있습니다.

속도 뒤에 숨은 기술

성능상의 이점은 최첨단 AI 워크로드를 위해 특별히 제작된 Cerebras의 웨이퍼 스케일 엔진 아키텍처에서 비롯됩니다. 빠른 프론티어 추론의 핵심 과제는 데이터 이동 문제입니다. 기존 GPU에서는 대규모 모델에 대한 추론이 메모리 대역폭으로 인해 병목 현상이 발생합니다. 연속적인 토큰을 생성하려면 모델 가중치를 온칩 메모리와 오프칩 스토리지 간에 반복적으로 전송해야 하기 때문입니다.

Cerebras는 근본적으로 다른 접근 방식을 취합니다. 각 웨이퍼 크기의 칩은 44GB의 SRAM을 실리콘에 직접 포장합니다. 모델 가중치는 온칩에 유지되고 토큰은 웨이퍼 전체에 걸쳐 파이프라인된 모델 레이어를 통해 중단 없이 흐릅니다. 이를 통해 GPU 기반 추론 속도를 늦추고 모델 크기에 따라 원활하게 확장되는 비효율적인 데이터 이동을 제거하여 미래 개척 모델에서 지속적인 속도 이점을 얻을 수 있는 기반을 마련합니다.

가용성 및 시장 포지셔닝

초고속 모드의 GPT-5.6 Sol은 현재 일부 고객 그룹에게 제한된 미리 보기로 제공되며 시간이 지남에 따라 용량이 증가함에 따라 액세스도 확장됩니다. Cerebras는 이번 파트너십이 차세대 AI 혁신을 주도하고 조직이 반응형 AI를 통해 달성할 수 있는 한계를 높이는 것이라고 설명합니다.

이번 협력은 GPU가 지배하는 AI 하드웨어 시장의 대안으로 오랫동안 웨이퍼 규모 컴퓨팅을 추구해 온 Cerebras에게 중요한 이정표를 의미합니다. Cerebras는 OpenAI와 직접 협력하여 가장 유능한 프론티어 모델 중 하나를 가속화함으로써 해당 아키텍처가 고속 추론 워크로드에 대한 진정한 경쟁 우위를 제공한다는 강력한 사례를 만들고 있습니다.

모델이 계속해서 더 크고 지능적으로 성장함에 따라 실시간 속도로 모델을 제공하는 능력은 AI 인프라 시장에서 결정적인 경쟁 요소가 될 수 있습니다. Cerebras-OpenAI 파트너십은 추론 속도 경쟁이 이제 모델 지능 경쟁만큼 중요하다는 신호입니다.

AI보다 앞서 나가세요

더 많은 AI 하드웨어 소식, 모델 성능 분석, 산업 발전을 알아보려면 AI Buzz Wire를 즐겨찾기에 추가하세요.

AI 뉴스 자세히 보기 →