AMD와 Cerebras Systems는 AMD의 랙 규모 Helios 플랫폼과 Cerebras의 Wafer-Scale Engine(WSE)을 단일의 분리된 워크플로우로 결합하여 새로운 종류의 AI 추론 인프라를 구축하기 위한 기술 파트너십을 공개했습니다. 2026년 7월 23일 AMD의 Advancing AI 2026 이벤트에서 발표된 이번 협업은 추론을 생성 AI 시대에서 가장 비용이 많이 드는 문제 중 하나로 만든 대기 시간 및 처리량 병목 현상을 직접 목표로 삼고 있습니다. 업계에서 빠르게 변화하는 이 분야에 대한 최신 정보를 보려면 AI 속보 보도를 팔로우하세요.

핵심 아이디어는 하나의 칩이 모든 작업을 수행하도록 강요하는 것을 중단하는 것입니다. 기존 추론 스택에서는 단일 GPU 제품군이 프롬프트를 소화하는 무거운 사전 채우기 작업과 각각의 새 토큰을 생성하는 섬세하고 순차적인 작업을 모두 처리합니다. 두 직업의 요구 사항이 매우 다르기 때문에 이는 절충안입니다. AMD와 Cerebras는 분리된 추론으로 알려진 기술인 작업 분할을 통해 각 엔진이 가장 잘 수행할 수 있다고 주장합니다.

두 엔진이 노동력을 나누는 방법

AMD의 공식 발표에 따르면, AMD Helios는 AMD Instinct GPU를 활용하여 대규모 입력 배치를 신속하게 처리하는 고성능, 확장 가능한 처리량 엔진 역할을 할 것입니다. 한편 Cerebras 웨이퍼 스케일 엔진은 초고속, 초저 지연 시간의 디코드 및 토큰 생성을 처리합니다. Cerebras의 칩은 개별 다이로 절단되는 것이 아니라 전체 웨이퍼에 구축되어 특히 지연 없이 토큰을 스트리밍하는 데 적합한 엄청난 온칩 메모리 대역폭을 제공합니다.

두 회사는 두 개의 컴퓨팅 엔진을 결합함으로써 공동 솔루션이 와트당 초당 최대 5배 더 높은 토큰을 제공할 것으로 예상한다고 말합니다. 이는 공급자가 속도와 에너지 비용 모두에서 경쟁함에 따라 추론 경제학의 중심 점수표가 된 지표입니다. 이 수치는 AMD의 보도 자료에 인용되었으며 Tom's Hardware, Investing.com 및 Yahoo Tech를 포함한 매체에 보고되었습니다.

Nvidia의 지배력을 시험해 보세요

파트너십은 전략적 신호이기도 합니다. Nvidia의 CUDA 생태계와 GPU 라인업은 현재 AI 훈련과 추론을 지배하고 있으며, 도전자들은 단일 아키텍처에서 기존 제품을 정면으로 이기는 것이 어렵다는 결론을 점점 더 많이 내리고 있습니다. Business Insider는 AMD가 추론에 베팅하여 Nvidia를 공격하면서 거래를 구성했습니다. AI 컴퓨팅 단계는 모델이 개발에서 생산으로 이동함에 따라 가장 빠르게 성장할 것으로 예상됩니다.

AMD의 경우 Cerebras와 결합하면 교육을 넘어 Instinct 및 Helios 로드맵의 매력이 확대됩니다. 나스닥에서 AMD(NASDAQ: AMD)와 함께 CBRS라는 이름으로 거래되고 있는 Cerebras의 경우 주요 가속기 공급업체와의 통합을 통해 웨이퍼 규모 기술을 대기업 및 클라우드 배포에 대한 보다 명확한 경로로 확보할 수 있습니다. Cerebras는 자체 데이터 센터에 AMD Helios를 배포할 계획이며, 양사는 공동 솔루션이 2026년 하반기에 Cerebras Cloud를 통해 먼저 제공될 것으로 기대하고 있습니다.

지금 분할이 중요한 이유

추론 비용은 AI 산업의 결정적인 압력 포인트가 되었습니다. 모델이 커지고 애플리케이션이 실시간 응답을 요구함에 따라 각 토큰을 생성하는 데 드는 비용과 사용자가 이를 기다리는 동안 경험하는 대기 시간에 따라 제품의 실행 가능 여부가 결정될 수 있습니다. 분리 추론은 사전 채우기와 디코딩을 각각에 가장 잘 맞는 하드웨어로 라우팅할 수 있는 별도의 워크로드로 처리합니다. 이는 Cerebras와 같은 회사가 1년 넘게 옹호해 온 설계 철학입니다.

AMD-Cerebras 발표는 접근 방식이 저항적인 아이디어에서 업계가 승인하는 아키텍처로 이동하고 있음을 시사합니다. 처리량 전문가와 대기 시간 전문가를 결합함으로써 두 회사는 추론의 미래가 모든 것을 지배하는 하나의 칩이 아니라 전문 엔진의 조율된 시스템이 될 것이라고 확신하고 있습니다.

볼만한 것

몇 가지 질문이 남아 있습니다. 와트당 초당 5배의 토큰 수치는 타사 벤치마크가 아닌 기대치이며 실제 성능은 고객이 실행하는 특정 모델 및 워크로드에 따라 달라집니다. Cerebras Cloud 출시 이후의 가격 및 가용성 세부 정보는 공개되지 않았으며 솔루션이 다른 클라우드 제공업체에 언제 제공될지는 확실하지 않습니다.

그럼에도 불구하고 이번 거래는 AI 하드웨어의 더 광범위한 변화를 강조합니다. 단일 GPU 아키텍처가 AI 파이프라인의 모든 단계를 지원한다는 가정은 허물어지고 있습니다. AMD와 Cerebras가 효율성 주장을 실현할 수 있다면 분리된 추론은 가장 큰 AI 시스템 구축 방법의 표준 부분이 될 수 있습니다.

AI보다 앞서 나가세요

AI 하드웨어 환경은 전문화된 캠프로 분할되고 있으며 비용, 속도 및 경쟁에 미치는 영향은 엄청납니다. AI Buzz Wire에서 AI 뉴스 자세히 읽기를 통해 모든 주요 거래, 릴리스 및 벤치마크를 확인하세요.