인텔은 AI 워크로드의 다음 단계인 에이전트 추론을 위해 기대하고 있는 데이터 센터 GPU인 Crescent Island에 대한 심층 분석으로 올해 Hot Chips 컨퍼런스를 열었습니다. 최고 엔터프라이즈 AI 시스템 설계자인 Sumit Mohan과 Intel 펠로우 Hong Jiang이 발표한 이 강연은 회사가 에이전트 시대를 정의한다고 말하는 세 가지 지표, 즉 와트당 토큰, 대용량 메모리 및 개방형 소프트웨어 스택에 중점을 두었습니다.

타이밍이 중요합니다. Nvidia는 동일한 컨퍼런스를 통해 Vera Rubin NVL72 랙 규모 시스템을 자세히 설명했으며 Hot Chips 2026의 모든 가속기 공급업체는 이제 원시 최고 성능보다는 효율성을 강조하고 있습니다. 인텔의 답변은 주류 AI GPU가 사용하는 메모리 기술을 기가바이트당 더 저렴한 것으로 바꾸는 부분으로, 헤드라인 수치를 눈에 띄게 만듭니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

350와트의 480GB PCIe 카드

Crescent Island는 350와트 공랭식 PCIe GPU입니다. Intel 브랜드 카드에는 160GB의 LPDDR5X 메모리가 함께 제공되지만, 이 설계를 통해 ODM 파트너는 최대 480GB의 변형을 보드에 구축할 수 있습니다. 이는 일반적인 고급 가속기 카드 용량의 약 3배이며, 긴 컨텍스트 및 다중 세션 에이전트 워크로드를 위해 매우 큰 KV 캐시를 상주하는 데 충분합니다. 이 설계는 FP4 및 MXFP4부터 FP64까지의 데이터 유형을 다룹니다.

메모리 선택은 제품에 대한 전략적 결정입니다. LPDDR5X는 용량과 비용을 위해 대역폭을 교환합니다. 이는 엄청난 컨텍스트 창과 도구 호출 루프가 원시 컴퓨팅보다 메모리 용량을 더 많이 소비하는 추론 워크로드 프로필에 적합합니다. 인텔은 "와트당 토큰"을 중심으로 전체 설계를 구성합니다. 이는 최대 FLOPS 비교에서 승리하는 대신 에너지 단위당 더 유용한 출력을 제공합니다.

Xe3P 실리콘: 32개 코어, 256개 XMX 엔진

내부적으로 Crescent Island는 Intel의 Xe3P 아키텍처이며 Intel은 이를 Battlemage 기반 Xe2 세대에 대한 세대적 도약으로 제시했습니다. Xe2가 20개의 Xe 코어와 4개의 깊은 수축기 XMX 어레이를 제공한 반면 Crescent Island는 32개의 Xe 코어와 16개의 깊은 수축기 어레이를 제공하여 총 256개의 XMX 엔진을 제공합니다.

3세대 Xe Matrix Extensions는 FP4 정밀 공동 발행 및 FP64 지원을 갖춘 3방향 확장 Xe 매트릭스 설계를 추가합니다. 각 Xe 코어에는 1MB의 일반 레지스터 파일과 512KB의 L1 캐시가 포함되어 있으며, 32MB의 통합 L2는 장치 전체에서 공유됩니다. 4개의 디코더와 4개의 인코더가 있는 미디어 엔진이 나란히 배치되며, 전체 SoC는 개방형 스위치 패브릭 전반에 걸친 확장을 지원하는 PCIe Gen5 x16을 통해 연결됩니다. Intel은 분산 전원 도메인, 공격적인 클록 게이팅을 갖춘 패킷 기반 네트워크 온 칩 라우터, 그래픽 및 미디어용 독립 DVFS 레일을 통해 달성되는 G0 상태에서 50와트 이하, 저전력 G8 상태에서 약 10와트의 활성 유휴 전력을 표시합니다.

서버 플레이북에서 가져온 RAS 기능

데이터 센터 부분의 경우 신뢰성 엔지니어링은 처리량만큼 많은 단계 시간을 얻었습니다. 이는 Nvidia도 Vera Rubin을 통해 관심을 기울인 주제입니다. Crescent Island는 주요 메모리 구조 전반에 걸쳐 ECC 및 패리티, 내부 상호 연결 패브릭의 모든 홉에 대한 오류 검사, 동적 페이지 오프라인화, 하드 패키지 후 복구 및 PCI Express 고급 오류 보고 기능을 제공합니다. Intel은 이 조합이 장기간 실행되는 무인 추론에 가장 중요한 오류 모드인 자동 데이터 손상을 줄여준다고 말합니다.

Intel은 또한 Arc Pro 워크스테이션 GPU에서 인수한 SambaNova SN50 RDU를 통해 확장되는 포트폴리오 내에 해당 부품을 배치했으며, Crescent Island를 엔터프라이즈 데이터 센터 앵커로 맨 위에 배치했습니다. 이 회사는 GPU를 첫 번째 시도가 아닌 성숙한 3세대 디자인으로 캐스팅하면서 6년 이상 거슬러 올라가는 로드맵 계보를 보여주었습니다. 이 카드는 6월 Computex에서 처음 공개되었습니다. Hot Chips는 그 뒤에 있는 건축학적 세부 사항을 전달했습니다.

에이전트 추론이 이 디자인을 선호하는 이유

워크로드 주장은 인텔의 발표에서 가장 흥미로운 부분입니다. Agentic AI - 도구 호출을 연결하고, 긴 컨텍스트를 열어두고, CPU와 GPU 간에 조정하는 모델로, 챗봇 제공의 일괄 처리량 프로필 대신 대기 시간, 메모리 용량 및 시스템 처리량에 동시에 세금을 부과합니다. 긴 컨텍스트 및 압축된 도메인 동시 세션을 위한 KV 캐시 용량은 SoC 설계에 명시적으로 내장되어 있습니다.

이 프레이밍은 LPDDR5X 베팅도 설명합니다. 차세대 AI 컴퓨팅이 훈련 실행이 아닌 메모리를 많이 사용하는 에이전트인 경우, 소프트웨어 스택이 제공하는 경우 350와트의 480GB 카드가 프리미엄 HBM 기반 부품에 대한 신뢰할 수 있는 대안입니다. 오픈 스택과 오픈 스위치 패브릭에 대한 Intel의 강조는 Nvidia의 통합 플랫폼 잠금을 경계하는 구매자를 겨냥한 것입니다.

Crescent Island는 AI 헤드라인을 지배하는 교육 가속기를 대체하지 않을 것이며 Intel은 컨퍼런스에서 가격이나 가용성을 공개하지 않았습니다. 그러나 인텔이 추론이 어디로 가고 있는지에 대한 설명(지방 메모리, 린 파워, 개방형 패브릭)은 올해 핫 칩의 보다 명확한 아키텍처 이야기 중 하나입니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →