OpenAI는 맞춤형 추론 칩인 Jalapeño에 대한 첫 번째 벤치마크 결과를 발표했으며 그 수치는 놀랍습니다. SemiAnalytic의 InferenceX 벤치마크에서 새로운 실리콘은 현재 사용 가능한 최첨단 추론 프로세서보다 사용자당 더 많은 토큰과 킬로와트당 더 많은 처리량을 기록했습니다. 이는 Nvidia의 Blackwell 시스템을 포함하는 비교입니다. 결과는 화요일 Palo Alto에서 열린 Hot Chips 컨퍼런스에서 칩 제작 방법에 대한 자세한 기술 검토와 함께 발표되었습니다. 모든 AI 모델 릴리스를 뒷받침하는 컴퓨팅 경쟁을 추적하는 독자들에게 이는 올해 가장 중요한 하드웨어 데이터 포인트 중 하나입니다.

OpenAI의 하드웨어 책임자인 Richard Ho는 TechCrunch가 보도한 언론 통화에서 "결론은 최신 기술에 비해 매우 중요한 성능 향상을 보여주는 결과입니다."라고 말했습니다. "Jalapeño는 전력 단위당 더 많은 AI 작업을 처리할 수 있는 동시에 더 빠르게 응답을 반환할 수 있습니다. 많은 고객에게 서비스를 제공하는 것은 매우 효율적이지만 대기 시간도 매우 짧을 수 있습니다."

전체 추론 파이프라인을 위해 제작된 칩

Jalapeño는 OpenAI의 첫 번째 맞춤형 실리콘으로 2026년 6월에 공개되었으며, Broadcom과의 긴밀한 협력을 통해 개발되었으며 OpenAI의 자체 AI 모델이 칩 개발 프로세스를 지원합니다. 파트너십 자체는 OpenAI가 네트워킹 대기업과 함께 다세대 맞춤형 가속기 프로그램에 대한 계획을 세운 2025년 10월로 거슬러 올라갑니다.

OpenAI에 따르면 Jalapeño가 범용 GPU와 다른 점은 제공할 모델과 함께 설계되었다는 것입니다. 회사가 AI 제품, 모델, 칩, 메모리 등 전체 스택을 제어하기 때문에 엔지니어들은 종종 마찰을 일으키는 추론 프로세스의 특정 단계를 공격할 수 있었습니다.

특히 Jalapeño는 처리의 사전 채우기 및 통신 단계 중 지연을 최소화하도록 설계되었습니다. OpenAI에 따르면 대규모 언어 모델을 대규모로 제공할 때 병목 현상이 발생하는 경우가 많습니다.

회사는 결과를 발표하는 블로그 게시물에서 "우리는 데이터 이동과 통신 지연을 최소화하도록 Jalapeño를 설계했습니다"라고 썼습니다. "이것은 시스템이 각 추론 단계에 대해 컴퓨팅, 메모리 및 네트워킹의 올바른 조합을 활성화하는 동안 응답을 생성하는 동안 사용되는 KV 캐시를 포함한 모델 상태를 명시적으로 배치하고 로컬로 유지할 수 있음을 의미합니다."

마지막 요점은 프로덕션 AI 워크로드를 실행하는 모든 사람에게 중요합니다. KV 캐시(모델이 응답을 생성하는 동안 보유하는 누적 컨텍스트)는 현대 추론에서 가장 큰 메모리 및 대역폭 문제 중 하나입니다. 클러스터 전체에 걸쳐 섞는 대신 로컬로 유지하고 명시적으로 관리하는 것이 대기 시간과 전력을 회수하는 고전적인 방법입니다.

Blackwell보다 낫습니다 — 현재로서는

헤드라인 비교는 현재 프론티어 AI 추론의 주력 제품인 Nvidia Blackwell 시스템에 대한 것입니다. 같은 날 SemiAnalytics가 "OpenAI Jalapeño: Nvidia Blackwell보다 낫다"라는 제목으로 발표한 독립적인 분석에서는 칩의 초기 결과에 대해 비슷한 결론에 도달했으며, 이 이야기는 빠르게 Hacker News에서 가장 많이 논의되는 항목 중 하나가 되었습니다.

그러나 OpenAI 경영진과 분석가 모두 주의를 촉구합니다. Ho는 Jalapeño가 2026년 말에 "매우 작은 볼륨"으로 배포될 것이며 2027년에 더 중요한 배포가 이루어질 것이라고 추정했습니다. Jalapeño가 본격적인 규모에 도달할 때쯤이면 경쟁이 크게 발전했을 수 있습니다. Nvidia의 로드맵은 계속해서 움직이고 Google, Amazon 및 Microsoft를 포함한 다른 하이퍼스케일러는 모두 자체 맞춤형 실리콘을 추진하고 있습니다.

TechCrunch가 언급했듯이 오늘날의 최신 기술을 기준으로 측정된 벤치마크는 스냅샷일 뿐 보장되는 것은 아닙니다. 2026년 효율성 측면에서 승리하는 칩은 내년에 Nvidia와 경쟁업체가 출시하는 모든 제품에 대해 계속해서 승리해야 합니다.

OpenAI가 자체 실리콘을 구축하는 이유

전략적 논리는 간단합니다. 추론은 OpenAI의 가장 큰 반복 비용입니다. 모든 ChatGPT 쿼리, 모든 API 호출 및 모든 에이전트 작업은 컴퓨팅을 소모하며 Nvidia에서 해당 컴퓨팅을 시장 가격으로 임대하면 사용량이 증가함에 따라 마진이 줄어듭니다. Broadcom과 공동으로 설계하고 OpenAI의 모델 자체로 형성된 OpenAI의 자체 모델에 맞춰 조정된 맞춤형 칩은 회사가 와트당 및 달러당 더 많은 사용자에게 서비스를 제공할 수 있는 방법을 제공합니다.

할라피뇨 역시 일회성 부분이 아닌 다세대 플랫폼으로 기획됐다. OpenAI는 AI 제품, 모델, 칩, 메모리를 함께 개발하여 각 세대의 실리콘이 실행될 모델과 함께 최적화되도록 할 계획이라고 밝혔습니다. 1세대 결과가 생산에서 유지된다면 Jalapeño는 이후 모든 것의 템플릿이 됩니다.

이해관계는 OpenAI를 넘어 확장됩니다. AI 가속기에 대한 Nvidia의 지배력은 3년 동안 업계에서 가장 심각한 병목 현상이었으며, Google의 TPU 팀, Amazon 또는 현재 OpenAI 등 신뢰할 수 있는 모든 대안은 AI 인프라를 구축하는 모든 사람의 협상 환경을 변화시키고 있습니다. Nvidia 자체는 메모리 비용이 급등함에 따라 AI 서버의 가격이 15% 이상 인상될 것이라고 고객에게 경고한 것으로 알려졌으며, 이는 내부 대안의 매력을 더욱 강화할 뿐입니다.

다음에 나올 내용

현재 Jalapeño는 유망한 용지 번호를 가진 사전 제작 부품으로 남아 있습니다. 실제 테스트는 첫 번째 소규모 볼륨이 배포되는 2026년 말, 특히 OpenAI가 의미 있는 규모를 기대하는 2027년 말에 도달합니다. 데이터 센터 규모의 실제 안정성, 총 소유 비용과 Blackwell 임대 용량, Nvidia의 차세대 제품에 비해 효율성 우위가 유지되는지 여부 등 주요 질문에 대한 답은 아직 남아 있습니다.

그럼에도 불구하고, 첫 번째 벤치마크는 이정표를 세웠습니다. 대규모 AI 연구소 중 하나가 처음으로 효율성 측면에서 기존 기업의 최고 수준을 능가하는 맞춤형 추론 실리콘을 공개적으로 시연한 것입니다. Nvidia 공급을 전략적 생명선으로 간주해온 업계의 경우 이는 진정한 변곡점입니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →