Cerebras는 회사의 모델 카탈로그 문서에 따르면 공개 가중치 모델이 초당 약 1,500개의 토큰으로 실행되는 Cerebras Inference 플랫폼의 공개 엔드포인트에 Qwen 3.8 27B를 추가했습니다. 이 목록을 통해 Alibaba의 가장 널리 사용되는 개방형 모델 제품군 중 하나를 일반적인 GPU 호스팅 서비스보다 훨씬 빠른 속도로 사용할 수 있게 되었습니다.
이 발표는 개발자들의 즉각적인 관심을 끌었습니다. 이 이야기는 하루 만에 Hacker News에서 600개 이상의 포인트를 모았습니다. 이는 빠르고 저렴한 추론에 대한 수요가 얼마나 뜨거운지를 반영하는 수준이었습니다. 추론 시장에 대한 더 폭넓은 시각을 위해 AI 속보 데스크에서는 모든 주요 플랫폼 업데이트가 출시되는 즉시 이를 확인합니다.
카탈로그의 사양
Cerebras의 문서에 따르면 Qwen 3.8 27B는 270억 개의 매개변수를 전달하고 무료 계층에서 64K, 유료 계층에서 128K의 컨텍스트 토큰을 지원하며 초당 약 1,500개의 토큰으로 실행됩니다. 이는 OpenAI의 개방형 GPT-OSS 120B 모델과 함께 사용됩니다. 동일한 카탈로그는 무료 계층에서 65K 컨텍스트, 유료 계층에서 131K 컨텍스트로 초당 약 3,000개의 토큰을 나열합니다.
두 모델 모두 Cerebras의 무료 평가판과 종량제 계층으로 제공되며 요금 제한이 적용됩니다. 예약된 용량, 더 높은 처리량 또는 프로덕션 SLA가 필요한 고객은 회사의 전용 엔드포인트 제품으로 연결되며, 문서에는 공용 엔드포인트의 두 가지 이상의 추가 모델 제품군에 대한 경로도 나열되어 있습니다.
컨텍스트 창은 속도 수치와 함께 주목할 가치가 있습니다. 무료 등급의 토큰 64,000개(유료 등급의 경우 128,000개)는 대규모 코드베이스, 긴 문서 또는 확장된 에이전트 기록을 메모리에 한 번에 저장하기에 충분하며, 이는 빠른 디코딩이 성과를 거두는 정확한 워크로드에 중요합니다. Cerebras의 문서에는 OpenAI 호환성 가이드도 포함되어 있어 기존 코드가 이미 OpenAI SDK를 대상으로 하는 팀의 전환 비용을 낮춥니다. 원칙적으로 Cerebras 엔드포인트에서 기존 클라이언트를 가리키는 것은 재작성이 아닌 구성 변경입니다.
정리되지 않은 모델, 투명한 압축
문서에서 주목할 만한 한 가지 세부 사항은 Cerebras가 모델 압축을 처리하는 방법을 공개했다는 것입니다. 회사는 공개 엔드포인트의 모든 모델이 정리되지 않은 원본 버전이며 품질을 보존하기 위해 저장 중에만 선택적 가중치 전용 양자화를 사용한다고 명시합니다. 민감한 레이어는 최대 정밀도를 유지하고 활성화, 주의 및 KV 캐시는 양자화되지 않은 상태로 유지되며 즉시 역양자화가 이루어집니다.
Cerebras는 또한 REAP(Router-weighted Expert Activation Pruning)와 같은 가지치기 기술에 대한 연구를 공개합니다. 가지치기된 변형은 Hugging Face의 연구 커뮤니티와 공유되지만 공개 API를 통해 제공되지는 않습니다. 개방형 모델을 실행할 위치를 선택하는 개발자의 경우 정확히 무엇이 제공되는지에 대한 투명성이 유난히 명시적입니다.
토큰 속도가 중요한 이유
이와 같은 처리량 수치는 에이전트 및 코딩 워크로드에 가장 중요합니다. 수백 개의 모델 호출(코딩 에이전트, 자동 워크플로, 실시간 보조자)을 연결하는 애플리케이션은 모든 단계에서 토큰당 대기 시간을 증가시키므로 초당 50개에서 1,500개 토큰의 차이가 질적으로 다른 경험을 만들어냅니다. 긴 완료를 스트리밍하는 대화형 애플리케이션이 가장 눈에 띄는 이점을 제공합니다.
절충안은 범위입니다. 270억 개의 매개변수 모델은 가장 어려운 추론 작업에서 최전선 시스템과 일치하지 않으며 Cerebras의 자체 문서는 과도한 생산 작업 부하를 전용 용량으로 조정합니다. 그러나 요약, 분류, 도구 사용, 코드 편집 등 중간 규모의 개방형 모델로 이미 충분히 우수한 작업의 경우 속도가 차별화 요소가 됩니다.
개발자가 평가할 가격 차원도 있습니다. 퍼블릭 엔드포인트 모델은 약속 전 무료 평가판에서 사용할 수 있으므로 팀의 자체 워크로드에 대한 벤치마킹이 본질적으로 마찰이 없습니다. 이는 첫 번째 토큰이 제공되기 전에 판매 대화가 필요한 기업 계약과 대조되는 고의적인 진입로입니다. 문서화된 속도 제한은 주의해야 할 제약 사항입니다. 프리 티어 액세스는 프로덕션 트래픽을 실행하기 위한 것이 아니라 속도를 입증하기 위해 존재합니다.
개방형 모델을 위한 바쁜 스트레칭
추가 기능은 오픈 웨이트 AI에 대한 혼잡한 기간 동안 발생합니다. UAE 기반 연구소 IFM은 6개의 완전 개방형 모델로 구성된 연결된 제품군인 K2 Horizon을 방금 출시했으며 Meta는 코딩 및 에이전트 사용을 위해 Muse 제품군을 계속해서 반복하고 있습니다. 한편, 중국의 개방형 모델 생태계는 업계 전반에 걸쳐 릴리스 주기를 단축하는 속도로 계속 배송되고 있습니다.
개발자들에게 실질적인 시사점은 개방형 모델 스택이 두 가지 측면에서 동시에 성숙해지고 있다는 것입니다. 즉, 일상 작업에서 주력 모델과의 격차를 줄이는 중형 모델의 기능과 전문 추론 제공업체가 원시 속도로 경쟁함에 따라 경제성을 제공한다는 것입니다. Cerebras의 Qwen 3.8 27B는 두 가지 추세에 대한 데이터 포인트입니다. 즉, 해당 작업을 위해 특별히 제작된 하드웨어에서 1년 전의 이색적인 속도로 제공되는 현재 세대의 개방형 모델입니다.
플랫폼을 평가하는 개발자는 자신의 워크로드를 벤치마킹해야 합니다. 게시된 속도는 카탈로그 수치이고 실제 처리량은 프롬프트 길이, 동시성 및 구성에 따라 다르며 무료 계층의 속도 제한은 속도보다 먼저 적용됩니다.
AI보다 앞서 나가세요
모든 모델 출시, 추론 플랫폼 업데이트 및 개발자 도구 출시를 실시간으로 추적합니다. 더 많은 AI 뉴스 읽기 →
