Cerebras는 새로운 WSE-3 Turbo 웨이퍼 규모 프로세서를 기반으로 구축된 랙 규모 AI 추론 시스템인 CS-4를 공개했으며 회사가 Nvidia 데이터 센터 제국의 속도 대안으로 자리매김함에 따라 이 시스템이 GPU 기반 시스템보다 최대 30배 빠른 추론을 제공한다고 주장했습니다.
화요일에 발표되고 회사의 제품 페이지와 Reuters, Bloomberg 및 The Register의 보도에 자세히 설명된 이번 출시는 Cerebras의 상장 이후 가장 중요한 하드웨어 교체이자 IPO 이후 주가가 하락세를 겪고 있는 회사에게는 중추적인 순간입니다. 이 소식이 전해지면서 세레브라스(CBRS)의 주가가 급등했고, Investor's Business Daily는 AI 추론 시장이 "매우 빠르게 성장하고 있다"는 CEO의 논평을 인용해 투자자들이 주목하고 있는 것으로 보입니다.
AI 모델의 응답 속도를 높이기 위한 경쟁이 가속화되는 것을 추적하는 독자들에게 CS-4 출시는 이번 분기의 가장 중요한 하드웨어 스토리 중 하나이며 컴퓨팅 환경을 지속적으로 재편하는 AI 산업 범위의 광범위한 변화 중에 있습니다.
CS-4 내부에는 무엇이 들어있나요?
헤드라인 구성 요소는 Cerebras의 디너 플레이트 크기 웨이퍼 스케일 엔진의 업그레이드 버전인 WSE-3 Turbo입니다. The Register의 기술 심층 분석에 따르면 WSE-3T는 새로운 실리콘이 아닙니다. 2년 된 WSE-3과 동일한 TSMC 5nm 프로세스, 46,225제곱밀리미터의 다이 면적, 4조 개의 트랜지스터, 900,000개의 코어 및 44GB의 온웨이퍼 SRAM을 유지합니다.
대신 Cerebras는 기존 칩을 훨씬 더 강화하여 성능을 두 배로 늘렸습니다. WSE-3T는 스파스 FP16 컴퓨팅을 250페타플롭으로 두 배 늘리고, 고밀도 FP16 성능을 약 25페타플롭으로 두 배 늘리고, 메모리 대역폭을 초당 43.2페타바이트로 두 배 늘리고, I/O 대역폭을 초당 2.4테라비트로 두 배 늘립니다. Register는 현재 회사가 이전 세대의 약 1.4GHz에서 약 2.8GHz로 실리콘 클럭을 증가시키고 있다고 추정합니다.
Cerebras에 따르면 그 비결은 프로세서에서 단 0.5mm 떨어진 곳에 재설계된 전력 공급 시스템입니다. 이는 기존 GPU 보드의 일반적인 ~50mm보다 약 100배 더 가깝습니다. 이러한 근접성은 보드 수준의 전력 손실을 거의 제거하고 웨이퍼에 도달하는 전력의 두 배를 허용하여 더 빠른 토큰 생성 뒤에 더 높은 작동 주파수를 가능하게 합니다.
Nexus 랙 아키텍처
CS-4는 칩 자체 외에도 Cerebras가 Nexus 플랫폼 아키텍처라고 부르는 최초의 진정한 랙 규모 설계와 Nvidia의 NVL72 및 AMD의 Helios 랙 시스템에 대한 직접적인 답변을 도입합니다. 각 CS-4는 자체 내장형 "웨이퍼 스케일 백팩"(웨이퍼, 전력 변환, 직접 액체 냉각, 고속 I/O 및 제어 전자 장치를 50% 적은 구성 요소로 단일 어셈블리로 접는 3D 패키지)에 수용된 최대 3개의 WSE-3T 프로세서를 탑재할 수 있습니다.
모듈식 설계는 컴퓨팅에서 안정적인 전력, 냉각 및 네트워크 계층을 분리합니다. 컴퓨팅이 도착하기 전에 Cerebras PowerRack을 설치하고 시설 인증을 받은 다음 백팩을 제자리에 밀어넣어 배치 시간을 며칠에서 몇 시간으로 단축할 수 있다고 회사에 따르면.
소비전력이 상당합니다. The Register에서는 백팩당 약 46kW, 전체 시스템 소비량을 120~140kW로 추산합니다. 그럼에도 불구하고 AMD와 Nvidia가 올해 말에 출시할 것으로 예상되는 240~250kW 랙 시스템 옆에 보수적으로 보이는 눈길을 끄는 수치입니다.
스위치 죽이기
아마도 기술적으로 가장 흥미로운 선택은 상호 연결일 것입니다. AWS가 Trainium3 가속기에 채택한 접근 방식인 스위치를 통해 웨이퍼 간 트래픽을 라우팅하는 대신 Cerebras는 칩을 인접한 웨이퍼가 서로 직접 통신하는 2D 토러스 토폴로지에 연결합니다. 이 설계는 웨이퍼 간 대기 시간을 5마이크로초에서 단 2마이크로초로 줄였으며, Cerebras는 메시가 현재 존재하는 모든 것보다 훨씬 더 많은 최대 50조 매개변수의 모델을 지원할 수 있다고 말합니다.
속도 결과는 놀랍습니다. 단일 CS-4 시스템에서 벤치마킹 회사인 Artificial Analysis는 gpt-oss-120b에서 사용자당 초당 최대 4,400개의 토큰을 측정했습니다. 이는 현재 사용할 수 있는 가장 빠른 GPU 기반 추론 서비스의 초당 최대 350개 토큰의 약 12배입니다. Cerebras는 또한 시스템이 10조 개의 매개변수를 초과하는 모델에서 초당 1,000개 이상의 토큰을 유지한다고 주장합니다.
분산된 파트너십 전략
특히 Cerebras는 더 이상 자체 실리콘에서 전체 추론 파이프라인을 실행하려고 시도하지 않습니다. 이 회사는 AWS 및 AMD와 제휴하여 추론의 컴퓨팅 집약적인 프롬프트 처리 단계를 각각 Trainium XPU 및 Instinct GPU로 오프로드하여 웨이퍼 규모 엔진이 대규모 SRAM 보유량이 빛나는 지연 시간에 민감한 디코드 단계를 처리하도록 남겨두었습니다.
CS-4 출시는 또한 Cerebras와 OpenAI의 협력을 확장합니다. Yahoo Finance는 AI 추론 가속화를 목표로 하는 새로운 OpenAI 및 AMD 파트너십과 함께 공개했다고 보고했습니다. 이는 회사가 8월 초에 도입한 Ultrafast 모드를 기반으로 하며 GPT-5.6 Sol을 초당 최대 750개의 토큰으로 사용자에게 제공했습니다.
헤드라인 수치 뒤에 숨겨진 주의 사항
업계 분석가들은 마케팅 수치에 대해 주의를 촉구합니다. Register에서는 Cerebras의 헤드라인 250petaFLOPS가 희소성에 의존하고 있으며 이는 일반적으로 대규모 언어 모델 추론에 도움이 되지 않으며 WSE-3에는 자체 SRAM을 포화시킬 컴퓨팅이 부족하기 때문에 최대 메모리 대역폭 수치는 대체로 이론적이라고 지적합니다. 이 간행물은 또한 왜 Cerebras가 SRAM 용량을 늘리는 대신 성능을 두 배로 늘렸는지 의문을 제기했습니다. SRAM 용량은 5년 전 WSE-2가 출시된 이후로 의미 있게 성장하지 않았습니다. 이는 디코드 가속기가 메모리에서 가장 많은 이점을 얻는 분리된 추론 시대에 흥미로운 선택입니다.
그럼에도 불구하고 시장 기회는 현실입니다. AI 챗봇과 에이전트가 더 빠른 응답 시간을 요구함에 따라 추론 속도는 진정한 경쟁 차별화 요소가 되었으며 Cerebras는 이제 상용 흐름에 맞춰 비전통적인 웨이퍼 규모 기술을 반복할 수 있음을 보여주었습니다.
첫 번째 CS-4 배송은 이번 분기에 시작되며 첫 번째 시스템은 9월 말 이전에 온라인으로 출시될 것으로 예상됩니다. 그것이 Nvidia의 지배력을 약화시키기에 충분한지 여부는 아직 알 수 없지만, 한동안 처음으로 업계에서 가장 빠른 AI 추론이 새로운 주소를 갖게 되었습니다.
AI보다 앞서 나가세요
CS-4와 같은 하드웨어 출시는 시장을 움직이고 AI 시스템이 수행할 수 있는 작업을 재정의합니다. 더 많은 AI 뉴스를 읽어보세요.
최신 AI 보도 살펴보기 →