Strata라는 잘 알려지지 않은 오픈 소스 프로젝트가 잠시 시간을 보내고 있습니다. 일반 게이밍 PC에서 1,250억 매개변수의 전문가 혼합 모델인 Alibaba의 Qwen3.8-Flash-Next를 실행하는 MIT 라이선스 엔진은 10월 4일 Hacker News의 첫 페이지에 640개 이상의 포인트를 기록했으며 GitHub 저장소는 9월 24일 생성된 이후 11,000개 이상의 별을 수집했습니다.

요점은 간단합니다. 일반적으로 서버에 있는 1,250억 개의 매개변수 모델은 컴퓨터를 떠나지 않고도 채팅, 코드 작성, 이미지 읽기 및 코딩 에이전트를 소비자 그래픽 카드에서 완전히 구동할 수 있습니다.

Strata가 실제로 하는 일

Strata는 Windows 및 Linux용 추론 엔진이자 원클릭 설치 프로그램입니다. 문서에 따르면 요구 사항은 프론티어 모델 표준에 따라 보통 수준입니다. 즉, NVIDIA의 RTX 20, 30, 40 또는 50 시리즈 또는 AMD의 Radeon RX 6000, 7000 또는 9000 시리즈의 최소 12GB VRAM을 갖춘 GPU, 최소 32GB 시스템 RAM 및 약 80GB의 여유 SSD 공간입니다.

엔진은 Q2_0에서 IQ3_S까지의 여러 압축 수준과 코드 전문 변형에서 Qwen3.8-Flash-Next의 양자화된 버전을 제공합니다. 이는 OpenAI 및 Anthropic 호환 API를 localhost에 노출합니다. 즉, Claude Code, Cursor 및 Codex와 같은 코딩 에이전트를 포함하여 ChatGPT 또는 Claude용으로 구축된 도구는 최소한의 변경만으로 로컬 서버를 가리킬 수 있습니다. 선택적 이미지 입력 ​​및 다중 GPU 지원이 포함되어 있으며 설치 프로그램은 코딩 도우미가 붙여넣은 단일 프롬프트에서 시스템을 구성할 수 있는 AI 지원 설정 모드도 제공합니다.

속도 수치

두 대의 소비자 데스크탑에서 측정된 프로젝트의 공개 벤치마크가 릴리스가 확산된 이유입니다. Ryzen 5 7600 및 64GB RAM과 결합된 12GB VRAM을 갖춘 NVIDIA RTX 5070에서 Strata는 다음과 같이 보고합니다.

  • Q2_0 양자화: 생성을 위해 초당 94개 토큰, 32K 토큰 문서에 대한 신속한 처리를 위해 초당 2,650개 토큰
  • IQ3_S: 초당 53개 토큰 생성, 초당 1,620개 토큰 프롬프트 처리
  • 코더 변형: 초당 55개 토큰

AMD 측에서는 16GB VRAM을 갖춘 RX 9070 XT가 Q2_0에 초당 60개의 토큰을 관리했습니다. 문서에서는 24GB VRAM을 갖춘 RTX 3090이 초당 100~140개의 토큰에 도달해야 한다고 추정합니다. 이는 대부분의 사람들이 읽을 수 있는 것보다 빠릅니다.

비교하자면, 6개월 전만 해도 700억 개의 매개변수가 밀집된 모델을 로컬에서 사용 가능한 속도로 실행하려면 수백 기가바이트의 통합 메모리나 공격적인 추론적 디코딩 트릭을 갖춘 워크스테이션이 필요했습니다.

125B 모델이 게이밍 카드에 적합한 이유

두 가지 기술이 이를 가능하게 합니다. 첫 번째는 모델 자체입니다. AI Buzz Wire가 출시 때 다룬 것처럼 Qwen3.8-Flash-Next는 총 매개변수가 약 1,250억 개에 달하지만 토큰당 활성 매개변수는 약 60억 개에 불과한 전문가 혼합 아키텍처입니다. 따라서 생성된 각 단어는 네트워크의 작은 조각에 닿아 토큰당 컴퓨팅을 크게 줄입니다.

두 번째는 양자화입니다. Strata의 가장 빠른 사전 설정은 모델의 가중치를 매개변수당 2~3비트로 압축하여 12GB GPU 및 시스템 RAM에 맞는 공간에 대한 일부 정확도를 교환합니다. 이러한 절충안이 주요 주의 사항입니다. Q2 클래스 및 IQ2 클래스 퀀트는 추론이 많은 작업에서 품질을 현저히 저하시키며 구매자는 헤드라인 속도 수치를 모든 작업 부하에 대한 보장이 아닌 출발점으로 간주해야 합니다. 저장소의 커뮤니티 벤치마크 페이지는 규모에 따른 품질 결과를 추적합니다.

더 큰 로컬 AI 물결의 일부

Strata는 로컬 추론의 추진력이 가속화되는 가운데 도착합니다. Alibaba의 Qwen 제품군은 가장 많이 다운로드된 오픈 웨이트 모델 라인이 되었으며 Meta와 Google은 자체 경쟁 모델을 오픈 소스로 보유하고 있으며 이제 도구의 물결을 통해 소비자는 구독이나 기기 외부 데이터 없이 유능한 보조자를 실행할 수 있습니다.

이 프로젝트는 또한 "소비자 하드웨어"의 정의가 어떻게 변화하고 있는지를 반영합니다. 주로 게임용으로 출시된 12GB VRAM을 갖춘 중급 2026 그래픽 카드는 이제 불과 2년 전에 프론티어 시스템을 정의한 크기 등급의 모델에 대한 실행 가능한 추론 가속기입니다.

Strata는 초기 소프트웨어로 남아 있습니다. 저장소의 문제 추적기는 구형 GPU 및 비 AVX2 프로세서의 대략적인 부분을 문서화합니다. 하지만 이 프로젝트는 MIT 라이센스가 있고 무료이며 공개적으로 개발되었으며 Intel Arc, 구형 Tesla 및 Radeon 카드에 대한 실험적 지원, 커뮤니티 회원이 문서화한 다중 GPU 장비가 포함되어 있습니다.

개발자의 경우 가장 실용적인 점은 로컬 호스트 API 호환성일 수 있습니다. OpenAI 또는 Anthropic SDK에 대해 작성된 모든 스크립트 또는 에이전트는 기본 URL을 변경하여 로컬 Qwen 배포로 리디렉션될 수 있으므로 Strata를 개인 정보 보호에 민감한 프로토타입 제작, 오프라인 사용 또는 단순히 API 지출 제한을 위한 마찰이 적은 옵션으로 만들 수 있습니다.

사용 방법

시작하려면 매뉴얼이 있는 터미널 세션이 필요하지 않습니다. 설치 프로그램은 드라이버, 모델 가중치 및 로컬 서버를 한 번에 프로비저닝하고 저장소에는 AI 코딩 도우미에 직접 붙여넣도록 설계된 설정 파일이 포함되어 있으며 AI 코딩 도우미는 기계를 자율적으로 구성합니다. 디스크에서 가중치를 로드하는 동안 첫 번째 실행 속도가 느려집니다. 문서에서는 SSD를 권장하고 대화가 길어지면 시스템 RAM에 더 많은 작업이 집중된다는 점을 경고합니다.

AI보다 앞서 나가세요

오픈 소스 모델, 로컬 AI 도구, 추론 하드웨어에 대한 최신 정보를 보려면 AI Buzz Wire를 팔로우하세요.

AI 뉴스 자세히 보기 →