Nvidia는 Hot Chips 컨퍼런스에서 2026년 8월 24일에 Groq 3 LPX 대화형 추론 가속기를 정식 생산에 투입했다고 발표했습니다. Nvidia Vera Rubin 플랫폼의 확장인 이 칩은 활성 100,000 토큰 컨텍스트 창을 갖춘 오픈 소스 Gemma 4 31B 모델을 실행하는 동안 인공 분석 벤치마킹에서 초당 3,400개의 기록적인 출력 토큰을 제공했습니다. 이는 해당 모델에 대해 기록된 가장 빠른 성능입니다.
이번 출시는 Nvidia가 추론 전문업체 Groq를 200억 달러에 인수한 것 중 가장 중요한 제품 이정표입니다. 이 거래는 현재 저지연 추론에 대한 수요가 급증함에 따라 회사가 활용하기 위해 움직이고 있는 거래입니다. CNBC는 Nvidia가 첫 번째 Groq 랙이 올해 말 이전에 온라인에 출시될 것이라고 밝혔습니다. 이 이야기에 대한 자세한 내용은 진행 중인 AI 산업 보도를 참조하세요.
토큰 생성 속도가 중요한 이유
Agentic AI 시스템(추론하고, 도구를 호출하고, 코드를 작성 및 테스트하고, 수백 또는 수천 개의 추론 단계를 반복하는 프로그램)은 엄청난 양의 출력 토큰을 생성합니다. 대화형 작업 또는 디코딩 처리량이라고 하는 토큰이 생성되는 속도에 따라 에이전트가 작업의 각 단계를 얼마나 빨리 완료할 수 있는지가 결정됩니다.
Nvidia는 Groq 3 LPX가 가장 가까운 대체 플랫폼보다 에이전트 및 대기 시간에 민감한 워크로드에 대해 4배 더 빠른 응답성을 제공한다고 말합니다. 이기종 배포에서 Vera Rubin NVL72 시스템은 컨텍스트 수집 및 사전 채우기 계산을 처리하는 반면 Groq 3 LPX 장치는 대기 시간에 민감한 토큰 생성 단계를 처리합니다.
엔비디아 창업자이자 CEO인 젠슨 황(Jensen Huang)은 발표에서 “추론은 AI의 성장 엔진”이라고 말했습니다. "Vera Rubin은 에이전트 AI 시대를 위해 설계된 워크로드 최적화 AI 공장 구성으로 이러한 비전을 확장하고 초고속 토큰 생성을 위한 LPX를 통해 성능 한계를 발전시킵니다."
하드웨어 내부
StorageReview의 기술 분석에 따르면 각 2U 수냉식 컴퓨팅 트레이는 호스트 CPU, 패브릭 확장 로직, DRAM과 함께 16개의 Groq 3 LPU와 BlueField-4 DPU 또는 ConnectX-9 네트워크 카드를 탑재하고 있습니다. 트레이에는 전면 패널에 32개의 LPU 칩 간 광 링크와 400Gb/s 이더넷이 있습니다.
랙 규모에서 Groq 3 LPX 배포에는 고속의 직접 칩 간 상호 연결을 통해 연결된 최대 256개의 LP30 가속기가 통합되어 있습니다. 이 랙은 Nvidia의 가장 광범위한 플랫폼인 Vera Rubin AI 공장 인프라에 장착됩니다. 이 인프라는 BlueField-4 DPU, Vera CPU 랙, Vera BlueField-4 STX 스토리지 및 Spectrum-6 SPX 이더넷 네트워킹을 포함하여 5가지 특수 목적 랙 구성에 걸쳐 7개의 개별 칩으로 구성됩니다.
Nvidia는 또한 Vera Rubin NVL72가 140,000개의 토큰 에이전트 코딩 워크로드에서 GB300 NVL72에 비해 메가와트당 최대 30배의 토큰 처리량을 제공하며 사용자별 상호 작용 목표가 높아질수록 이점이 넓어진다고 플랫폼 수준 성능 주장을 새롭게 했습니다.
별표가 있는 벤치마크
헤드라인 초당 3,400개 토큰 수치에는 주목할 만한 주의 사항이 있습니다. StorageReview가 지적했듯이 Nvidia의 결과는 8월 21일 비공개 사전 출시 엔드포인트에서 측정된 반면, 비교된 경쟁 수치는 라이브 서버리스 프로덕션 엔드포인트에서 나온 것입니다. 일반적으로 사용 가능한 서비스의 실제 성능은 기록적인 벤치마크 구성과 다를 수 있습니다.
그럼에도 불구하고 독립적인 벤치마킹 기관인 Artificial Analysis는 해당 컨텍스트 길이에서 Gemma 4 31B에 대해 측정된 가장 빠른 결과를 기록했으며, 특수 제작된 실리콘이 추론의 디코딩 단계를 극적으로 가속화할 수 있다는 기본 주장은 업계가 에이전트 워크로드를 위해 재설계해 온 방식과 일치합니다.
클라우드 도입 시작
암스테르담에 본사를 둔 AI 클라우드인 Nebius는 Groq 3 LPX 배포를 약속한 최초의 제공업체이며 이를 생산 추론 플랫폼인 Nebius Token Factory에 도입할 계획입니다.
Nebius의 최고 기술 책임자인 Danila Shtan은 “세대는 AI 시스템이 실제로 얼마나 반응하는지를 결정하는 추론 단계이며, NVIDIA Groq 3 LPX는 바로 이를 가속화하기 위해 제작되었습니다.”라고 말했습니다. "Nebius Token Factory를 통해 프로덕션에 적용되는 최초의 AI 클라우드로서 우리는 에이전트 루프의 모든 단계가 즉각적으로 느껴지도록 하고 있습니다. 개발자가 이미 사용하고 있는 것과 동일한 API를 통해 새 스택으로 마이그레이션할 필요가 없습니다."
현재 Nvidia 제품군의 일부인 추론 제공업체 Groq는 플랫폼의 가장 초기 채택자가 될 계획입니다.
더 큰 그림
본격 생산 발표는 AI 인프라 시장이 훈련에서 추론으로 얼마나 급격하게 전환되었는지를 보여줍니다. 기업이 원시 모델 사전 훈련에서 실시간 추론 및 자율 에이전트 오케스트레이션으로 예산을 전환함에 따라 토큰의 경제성(생성 속도 및 에너지 비용)이 핵심 경쟁 전장이 되었습니다.
Nvidia의 경우 Groq 3 LPX는 클라우드 제공업체와 스타트업 모두의 맞춤형 실리콘이 동일한 에이전트 추론 워크로드를 쫓는 순간 AI 공장 프랜차이즈에 대한 방어를 확장합니다. CNBC가 보도한 바와 같이, 올해 온라인에 출시되는 랙은 인수가 완료된 지 몇 달 후 고객의 손에 첫 번째 생산 시스템을 제공하게 될 것입니다. 이는 반도체 산업 표준에 따른 빠른 통합입니다.
회사는 새로운 시스템의 가격을 공개하지 않았습니다. Groq 3 LPX는 가능한 경우 AI 클라우드 파트너를 통해 제공될 예정이며, Nebius는 기존 API 엔드포인트를 통해 개발자에게 최초로 액세스를 제공할 것으로 예상됩니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →