Alibaba의 Qwen 팀은 수요일에 곧 출시될 Qwen4의 아키텍처 미리보기 역할을 하는 다중 모드 전문가 혼합 모델인 Qwen3.8-Flash-Next를 출시했습니다. 이를 통해 회사는 교육 비용의 약 1/9로 훨씬 더 큰 Qwen3.7-Plus를 능가하는 결과를 제공한다고 밝혔습니다. Reuters, Bloomberg 및 The Decoder는 모두 Z.ai가 자체적으로 국경에 인접한 개방형 모델을 출시한 날 Hugging Face 및 ModelScope에 개방형 가중치를 부여하는 출시를 다루었습니다. 오픈 웨이트 경주가 가속화되는 가운데 AI 속보를 팔로우하세요.

미니어처의 새로운 아키텍처

헤드라인 사양은 효율성입니다. Qwen3.8-Flash-Next에는 총 1,250억 개의 매개변수가 있지만 토큰당 60억 개만 활성화됩니다. 비교를 위해 Alibaba가 발표한 벤치마크에서 가장 우수한 모델인 Qwen3.7-Plus는 총 3,970억 개의 매개변수를 갖고 있으며 토큰당 170억 개가 활성화되어 있으며 이는 Flash-Next 활성 개수의 거의 3배입니다.

기술적으로 가장 흥미로운 부분은 510억 개의 매개변수를 전달하는 새로운 N-그램 임베딩 레이어입니다. 레이어는 일반적인 단어 그룹을 The Decoder의 Matthias Bastian이 일종의 "구문 사전"이라고 설명한 독립 실행형 항목으로 저장하여 구문 수준 정보를 네트워크 시작 부분에 제공합니다. 결정적으로, Qwen 팀이 상대적으로 낮은 추가 비용이라고 부르는 값비싼 GPU 메모리가 아닌 일반 시스템 RAM에 위치합니다. 이는 Qwen4에 적용될 아키텍처 혁신입니다.

이 모델은 기본적으로 262,144개의 토큰 컨텍스트 창을 지원하고 YaRN 긴 컨텍스트 확장을 사용하여 100만 개의 토큰으로 확장됩니다. 기술 보고서가 GitHub에 게시되었습니다.

벤치마크: 코딩 및 사무

Alibaba의 벤치마크에서는 Flash-Next를 DeepSeek-V4-Flash(2,840억 개의 매개변수, 130억 개의 활성) 및 Anthropic의 Claude Opus 4.6(Max)과 비교합니다. 두 경쟁업체 모두 규모가 훨씬 크고 비용도 더 높음에도 불구하고 Flash-Next는 테스트된 대부분의 작업에서 선두를 달리고 있으며 코딩 및 사무 생산성 측면에서 가장 큰 이점을 제공합니다.

에이전트 코딩에서 Flash-Next는 DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점을 얻어 DeepSeek-V4-Flash와 Claude Opus 4.6을 모두 제쳤습니다. 사무 작업에 대한 격차는 여전히 더 넓습니다. DeepSeek-V4-Flash의 45.1에 비해 CoWorkBench의 73.9, JobBench의 55.7로 Qwen3.7-Plus의 27.6의 거의 두 배입니다. 과학적 추론은 GPQA Diamond에서 91.7, LiveCodeBench v6에서 91.9를 기록한 Flash-Next를 통해 현장 전반에 걸쳐 밀접하게 일치합니다. Claude Opus 4.6은 Humanity의 마지막 시험인 40.0~35.9에서만 앞서 나오며 2026년 2월의 이전 Anthropic 모델입니다. 항상 그렇듯이 게시된 벤치마크 점수와 실제 성능은 다를 수 있습니다.

모든 경쟁업체에 대한 가격 압박

프로덕션 버전은 QwenCloud를 통해 Qwen3.8-Flash로 배송되며 가격은 입력 토큰 백만 개당 0.16달러, 출력 토큰 백만 개당 0.47달러입니다. 이는 같은 날 각각 0.15달러와 0.50달러에 출시된 Z.ai의 GLM-5.3-Flash보다 낮은 가격으로 시장 바닥에서 사실상 동등합니다.

알리바바의 주력 제품과의 격차는 극명합니다. Claude Opus 4.8, Gemini 3.1 Pro 및 GPT-5.6 Sol과 경쟁하기 위해 8월 초에 출시된 Qwen3.8-Max의 비용은 백만 입력 토큰당 2.00달러, 출력 토큰 백만 달러당 6.00달러입니다. Alibaba 자체 수치에 따르면 Flash-Next는 입력 및 출력 가격 모두 약 1/12 가격으로 주력 제품 바로 아래의 성능을 발휘합니다.

긴 컨텍스트는 사양 시트 이상의 실용적인 가치를 추가합니다. 262,144개의 기본 토큰에서 단일 요청은 여러 개의 대규모 코드 저장소, 전체 계약 세트 또는 몇 시간의 기록된 회의를 보유할 수 있습니다. YaRN을 사용하면 100만 개의 토큰으로 확장되므로 검색 스캐폴딩 없이 전체 코퍼스 분석이 가능해집니다. Flash-Next가 가장 높은 점수를 기록하는 에이전트 코딩 워크로드(실제 소프트웨어 프로젝트에서 독립적으로 버그를 찾아 수정)의 경우 창이 크다는 것은 작업 중에 컨텍스트 관리 실패가 적다는 것을 의미합니다. Qwen 팀은 또한 GitHub에 기술 보고서를 게시하여 독점 연구소가 피하는 일종의 독립적인 아키텍처 조사를 요청했습니다.

이번 릴리스가 중요한 이유

Qwen3.8-Flash-Next는 Qwen4의 공개 드레스 리허설로 가장 잘 이해됩니다. N-그램 임베딩 레이어, 공격적인 활성 매개변수 비율, 부피가 크지만 거의 필요하지 않은 매개변수의 RAM 오프로딩은 GPU당 지능이 아닌 달러당 지능 이동이라는 설계 철학을 보여줍니다. Qwen3.7-Plus보다 뛰어난 모델을 1/9의 비용으로 교육하는 것은 바로 빠른 반복 주기를 저렴하게 만드는 기능입니다. 단일 벤치마크보다 반복 속도가 지금으로부터 1년 뒤에 선두에 서게 될 사람을 결정하는 요소입니다.

FourWeekMBA가 관찰한 바와 같이 Z.ai의 GLM-5.3-Flash와 Alibaba의 Flash-Next 등 중국 연구소에서 두 개의 국경에 인접한 개방형 중량 모델이 당일 도착하는 것도 흐름의 변화를 나타냅니다. 서부 연구소는 여전히 벤치마크 최고치를 유지하고 있지만, 이제 개방형 등급은 훨씬 더 낮은 가격으로 매주 거의 최전선에 가까운 품질로 배송됩니다.

개발자에게 있어 실질적인 교훈은 간단합니다. 단일 제공자에 대한 보험으로 다운로드 가능한 가중치를 사용하여 유능한 장기 컨텍스트 다중 모드 모델의 비용이 다시 떨어졌습니다. 경쟁사 입장에서는 메시지가 덜 편안합니다. 이제 효율성 경계는 주력 가격이 현실적으로 따라갈 수 있는 것보다 더 빠르게 움직이고 있으며 Alibaba는 둔화될 조짐을 보이지 않습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →