중국 AI 연구소 DeepSeek는 5,520억 매개변수 백본과 프론티어급 시스템에 출시된 가장 공격적인 메모리 압축 기능을 결합한 다중 모드 개방형 무게 모델인 V4.1-Flash를 출시했습니다. 이 모델은 Hugging Face에 대한 MIT 라이센스와 함께 기술 보고서와 함께 수요일에 출시되었으며 항저우에 있는 연구소의 헤드라인을 장식했다고 로이터 통신이 보도했습니다.
이번 릴리스는 일상적인 버전 범프 그 이상입니다. DeepSeek은 주력 제품인 V4 Pro 계층을 동시에 폐기했으며 TechNode는 V4 Pro에 대한 요청이 이제 V4.1-Flash로 라우팅되고 있다고 보고했습니다. 이는 "Flash"라는 이름을 가지면서도 대체 모델 이상으로 벤치마크 수치를 게시하는 모델에 대한 놀라운 자신감의 표현입니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
더 작은 메모리 용량으로 더 큰 "플래시"
공식 모델 카드에 따르면 DeepSeek-V4.1-Flash는 토큰 기반 조회를 통해 드물게 액세스되는 5,520억 개의 백본 매개변수와 1,960억 개의 매개변수 "Engram" 조건부 메모리 구성 요소를 갖춘 전문가 혼합(MoE) 모델입니다. 엄청난 크기에도 불구하고 이 모델은 사전 채우기 중에는 토큰당 80억 개의 매개변수만 활성화하고 디코딩 중에는 160억 개의 매개변수만 활성화합니다. 이는 지속적으로 130억 개를 실행했던 이전의 284B 매개변수보다 활성 매개변수가 적습니다.
아키텍처의 중심은 DeepSeek가 인과 인코더-디코더(CED) 설계라고 부르는 것입니다. 즉, 40레이어 트랜스포머가 20레이어 인과 인코더로 분할되고 그 뒤에 20레이어 디코더가 옵니다. 디코더의 글로벌 KV 캐시는 레이어별로 누적되지 않고 최종 인코더 숨겨진 상태에서 투영되므로 긴 대화를 유지하는 데 필요한 메모리가 크게 줄어듭니다.
압축 숫자가 헤드라인입니다. E2M1 형식의 FP4 기본 KV 캐싱을 사용하면 글로벌 KV 캐시 공간이 **토큰당 890바이트(DeepSeek-V4-Flash의 약 1/4)로 떨어집니다. SWA Bounded Replay라는 기술은 가장 최근의 토큰 창만 재생하여 영구 KV 캐시를 이전 Flash 모델의 약 1/8로 줄임으로써 누락된 주의 상태를 재구성합니다. 모델 카드에 따르면 V4-Flash의 경우 약 4배, DeepSeek-V1의 경우 437배 감소합니다. 추가 구성 요소에는 각 주의 계층에 세 가지 정적 모드 중 하나를 할당하는 CSA2(Compressed Sparse Attention 2)와 더 빠른 생성을 위한 DSpark 추측 디코딩이 포함됩니다.
내부적으로 각 MoE 계층은 공유 전문가 1명과 라우팅된 전문가 384명을 결합하여 토큰당 라우팅된 전문가 6명을 활성화합니다.
벤치마크: 은퇴한 플래그십을 앞두고
기술 보고서의 기본 모델 평가에서 V4.1-Flash는 여러 주요 테스트에서 훨씬 더 큰 V4 Pro를 능가했습니다. MMLU-Pro의 74.1 대 73.5, HumanEval의 79.4 대 76.8, BigCodeBench의 60.6, GSM8K의 93.0입니다. South China Morning Post는 DeepSeek에서 새 모델이 사이버 및 코딩 벤치마크에서 Kimi K3를 능가한다고 밝혔으며, 이는 Z.ai의 GLM-5.3 및 Alibaba의 Qwen 라인도 포함하는 중국 개방형 모델 분야에서 주목할만한 주장입니다.
최대 추론 노력에서 교육 모델은 GPQA Diamond에서 90.9점을 얻었습니다. 이는 인상적이지만 여전히 DeepSeek의 자체 비교 테이블에서 언급된 주요 프론티어 시스템인 GPT-5.6 Sol(94.1점)과 Claude Opus 5.0(93.4점)에 뒤처져 있습니다. Kimi K3는 92.9를 기록했습니다. 정직하게 읽은 내용: 이것은 개방형 가격의 최전선에 인접한 모델이지 폐쇄된 실험실을 완전히 휩쓴 것이 아닙니다.
V4.1-Flash는 진정한 다중 모드이기도 합니다. 처음부터 학습된 DeepSeek-ViT 비전 인코더는 2층 프로젝터를 통해 이미지를 공급하며 모델은 사전 학습 시작부터 텍스트와 이미지를 공동으로 학습했습니다. MMMU-Pro에서는 56.5점, DocVQA에서는 95.6점을 받았습니다.
에이전트용으로 제작되었으며 볼륨에 따른 가격 책정
디자인 선택을 통해 대상 고객이 명확해집니다. 즉, 모델이 엄청난 맥락을 읽고 장기적인 관점에서 행동하는 에이전트 워크로드입니다. 이 모델은 최대 100만 개 토큰의 컨텍스트 창을 지원하고 45조 토큰 다중 모달 코퍼스에서 훈련되었으며 추론 비용과 정확성을 교환하는 1부터 100까지 지속적으로 제어 가능한 추론 노력 다이얼을 제공합니다. The Decoder의 보도에서는 메모리 절약으로 인해 AI 에이전트 실행 비용, 즉 출력 생성보다 입력을 읽는 데 훨씬 더 많은 시간을 소비하는 워크로드가 특히 절감된다는 점을 강조했습니다.
커뮤니티의 반응은 강렬했습니다. Hacker News의 출시 스레드는 650개 이상의 포인트를 얻었으며 "DeepSeek, v4 pro보다 저렴하고 더 뛰어난 기능을 갖춘 v4.1 플래시 출시"라는 제목의 이전 스레드에서는 거의 400개 이상의 포인트를 수집했습니다. 모델을 로컬로 실행하는 논평자들은 Engram 매개변수가 빠른 SSD로 오프로드되어 소비자 하드웨어에서 거의 최전선에 가까운 추론을 할 수 있다는 점을 지적했습니다.
Seeking Alpha는 이를 미국 개척 연구소에 도전 과제를 제시하는 초저비용 모델이라고 부르며 상업적 이해관계를 직설적으로 표현했습니다. 이는 AI 추론의 가격 전쟁이 냉각될 조짐을 보이지 않는다는 점을 상기시켜 줍니다.
발표를 위한 고의적인 순간
타이밍이 말해줍니다. 출시 하루 전, Reuters는 DeepSeek이 CITIC Securities를 활용하여 상하이 STAR 시장에 대한 IPO를 주선했다고 보도했으며, 앞서 연구소의 수익이 상장 가능성보다 10배 증가했다고 보도한 바 있습니다. 며칠 후에 헤드라인을 장식하는 공개 모델을 배송하면 이러한 추진력이 계속 유지됩니다.
이번 출시는 중국 AI 기업에 대한 조사가 강화되는 가운데 이루어졌다. 이번 주 초 NSA, CISA 및 FBI를 포함한 미국 기관은 산업 규모의 모델 증류에 대한 자문에서 6개의 중국 AI 회사를 지명했습니다. 이는 DeepSeek의 기술적 승리가 이제 지정학적 수하물과 함께 도착한다는 것을 상기시켜줍니다.
그 어느 것도 엔지니어링 이야기를 흐리게 하지 않습니다. V4 Pro가 은퇴하고 트래픽이 더 저렴하고 강력한 모델로 라우팅됨에 따라 DeepSeek는 2026년 AI의 흥미로운 개척지는 누가 가장 큰 모델을 만드는지뿐만 아니라 누가 메모리 기가바이트당 가장 많은 기능을 제공하는지가 될 수 있다는 가장 명확한 주장을 내놓았습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →