Kinesiska AI-labbet DeepSeek har släppt V4.1-Flash, en multimodal modell med öppen vikt som parar ihop en ryggrad på 552 miljarder parametrar med något av det mest aggressiva minneskomprimeringen som hittills har levererats i ett gränsöverskridande system. Modellen gick live på onsdagen med en MIT-licens på Hugging Face och en åtföljande teknisk rapport, rapporterade Reuters, som täcker en rad rubriker för det Hangzhou-baserade labbet.
Utgåvan är mer än en rutinmässig versionsbump. DeepSeek har samtidigt tagit tillbaka sin flaggskeppsnivå V4 Pro, och TechNode rapporterade att förfrågningar till V4 Pro nu dirigeras till V4.1-Flash – ett slående förtroendeförklaring till en modell som bär namnet "Flash" men som ändå postar benchmarksiffror på eller över modellen den ersätter. For more context on this story, see our ongoing more AI stories.
En större "blixt" med en mindre minnesräkning
Enligt det officiella modellkortet är DeepSeek-V4.1-Flash en Mixture-of-Experts (MoE) modell med 552 miljarder ryggradsparametrar plus en 196 miljarder parametrar "Engram" villkorlig minneskomponent som är sparsamt åtkomlig genom token-baserad uppslagning. Trots den stora storleken aktiverar modellen endast 8 miljarder parametrar per token under förfyllning och 16 miljarder under avkodning — färre aktiva parametrar än dess föregångare med 284B-parametrar, som hade konstanta 13 miljarder.
Det arkitektoniska mittpunkten är vad DeepSeek kallar en Causal Encoder-Decoder (CED)-design: en 40-lagers transformator uppdelad i en 20-lagers kausal encoder följt av en 20-lagers dekoder. Eftersom avkodarens globala KV-cache projiceras från de slutliga kodarens dolda tillstånd snarare än ackumulerat lager för lager, krymper minnet som behövs för att upprätthålla långa konversationer dramatiskt.
Kompressionstalen är rubriken. Med FP4-huvud-KV-cache i E2M1-format sjunker det globala KV-cache-fotavtrycket till 890 byte per token – ungefär en fjärdedel av DeepSeek-V4-Flash. En teknik som kallas SWA Bounded Replay rekonstruerar saknade uppmärksamhetstillstånd genom att bara spela upp det senaste fönstret med tokens, vilket minskar den beständiga KV-cachen till ungefär en åttondel av den tidigare Flash-modellen. Per modellkortet är minskningen ungefär fyrfaldig mot V4-Flash och 437 gånger mot DeepSeek-V1. Ytterligare komponenter inkluderar Compressed Sparse Attention 2 (CSA2), som tilldelar varje uppmärksamhetslager ett av tre statiska lägen, och spekulativ DSpark-avkodning för snabbare generering.
Under huven kombinerar varje MoE-lager en delad expert med 384 dirigerade experter, vilket aktiverar sex dirigerade experter per token.
Benchmarks: Ahead of the Retired Flagship
På basmodellutvärderingarna i den tekniska rapporten går V4.1-Flash förbi den mycket större V4 Pro i flera nyckeltester: 74.1 på MMLU-Pro mot 73.5, 79.4 på HumanEval mot 76.8, 60.6 på BigCodeBench och 983.0 på GSMLU-Pro. South China Morning Post rapporterade att DeepSeek säger att den nya modellen slår Kimi K3 på cyber- och kodningsriktmärken, ett anmärkningsvärt påstående i ett kinesiskt område med öppen modell som även inkluderar Z.ais GLM-5.3 och Alibabas Qwen-linje.
Vid maximal resonemangsansträngning får instruktionsmodellen 90,9 på GPQA Diamond – imponerande, men fortfarande bakom de ledande gränssystemen som refereras till i DeepSeeks egen jämförelsetabell, GPT-5.6 Sol på 94,1 och Claude Opus 5.0 på 93,4. Kimi K3 sitter på 92,9. Den ärliga läsningen: det här är en gränsöverskridande modell till priser med öppen vikt, inte ett rent svep av de stängda labben.
V4.1-Flash är också genuint multimodal. En DeepSeek-ViT vision-kodare, tränad från grunden, matar bilder genom en tvåskiktsprojektor, och modellen tränades på text och bilder gemensamt från början av förträningen. Den får 56,5 på MMMU-Pro och 95,6 på DocVQA.
Byggd för agenter, prissatt för volym
Designvalen gör målgruppen tydlig: agentiska arbetsbelastningar, där modeller läser enorma sammanhang och agerar över långa horisonter. Modellen stöder kontextfönster på upp till en miljon tokens, tränades på en 45 biljoner tokens multimodal korpus och erbjuder en kontinuerligt kontrollerbar resonemang-ansträngningsratt från 1 till 100 som växlar slutsatskostnad mot noggrannhet. Dekoderns täckning betonade att minnesbesparingarna specifikt minskar vad det kostar att köra AI-agenter - arbetsbelastningar som spenderar mycket mer tid på att läsa indata än att generera utdata.
Reaktionen från samhället har varit eftertrycklig. Lanseringstråden på Hacker News drog mer än 650 poäng, och en tidigare tråd med titeln "DeepSeek lanserar v4.1 flash billigare och mer kapabel än v4 pro" samlade nästan 400 fler. Kommentarer som kör modeller lokalt noterade att Engram-parametrarna till och med kan överföras till snabba SSD-enheter, vilket öppnar en väg till nära gränsöverskridande slutsatser om konsumenthårdvara.
Seeking Alpha inramade de kommersiella insatserna rakt av och kallade det en ultra-lågkostnadsmodell som erbjuder utmaningar för amerikanska gränslaboratorier - en påminnelse om att priskriget i AI-inferens inte visar några tecken på kylning.
Ett medvetet ögonblick för tillkännagivandet
Tidpunkten är talande. En dag före lanseringen rapporterade Reuters att DeepSeek hade anlitat CITIC Securities för att arrangera en börsnotering på Shanghais STAR Market, efter att tidigare rapporterat att labbets intäkter har vuxit tio gånger före en eventuell notering. Att skicka en öppen modell som lockar rubriker flera dagar senare håller farten igång.
Releasen landar också mitt i ökad granskning av kinesiska AI-företag. Tidigare i veckan utnämnde amerikanska byråer inklusive NSA, CISA och FBI sex kinesiska AI-företag i en rådgivning om industriell skala modelldestillation - en påminnelse om att DeepSeeks tekniska vinster nu kommer tillsammans med geopolitiskt bagage.
Inget av det dämpar ingenjörshistorien. Med V4 Pro avdragen och dess trafik dirigerad till en billigare, starkare modell, har DeepSeek framfört det tydligaste möjliga argumentet att 2026 kanske den intressanta gränsen för AI inte bara är vem som bygger den största modellen – utan vem som tjänar mest kapacitet per gigabyte minne.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →