Laboratorium AI Cina DeepSeek wis ngrilis V4.1-Flash, model bobot mbukak multimodal sing masangake backbone 552 milyar parameter karo sawetara kompresi memori sing paling agresif sing durung dikirim ing sistem kelas perbatasan. Model kasebut langsung diluncurake dina Rebo kanthi lisensi MIT ing Hugging Face lan laporan teknis sing diiringi, lapor Reuters, nutup berita utama kanggo lab berbasis Hangzhou.

Rilis luwih saka bump versi rutin. DeepSeek wis bebarengan pensiun sawijining kapal penggedhe V4 Pro undakan, lan TechNode kacarita sing panjalukan kanggo V4 Pro saiki lagi routed menyang V4.1-Flash - statement striking saka kapercayan ing model sing mawa jeneng "Flash" durung ngirim nomer pathokan ing utawa ndhuwur model diganti. For more context on this story, see our ongoing AI industry coverage.

"Flash" sing luwih gedhe kanthi tagihan memori sing luwih cilik

Miturut kertu model resmi, DeepSeek-V4.1-Flash minangka model Mixture-of-Experts (MoE) kanthi 552 milyar paramèter backbone plus komponen memori kondisional "Engram" 196 milyar parameter sing jarang diakses liwat telusuran adhedhasar token. Sanajan ukurane gedhe, model kasebut mung ngaktifake 8 milyar parameter saben token sajrone prefill lan 16 milyar sajrone decode - paramèter aktif luwih sithik tinimbang paramèter 284B sing sadurunge, sing terus-terusan 13 milyar.

Pusat arsitektur yaiku apa sing diarani DeepSeek minangka Causal Encoder-Decoder (CED) desain: Transformer 40-lapisan dipérang dadi encoder sebab-akibat 20-lapisan diikuti dekoder 20-lapisan. Amarga cache KV global decoder digambarake saka negara encoder pungkasan sing didhelikake tinimbang akumulasi lapisan kanthi lapisan, memori sing dibutuhake kanggo nyonggo obrolan sing dawa nyusut sacara dramatis.

Nomer kompresi minangka judhul. Kanthi caching KV utama FP4 ing format E2M1, jejak cache KV global mudhun dadi 890 bita saben token - kira-kira seprapat saka DeepSeek-V4-Flash. A technique disebut SWA Bounded Replay reconstructs ilang manungsa waé negara dening muter maneh mung jendhela paling anyar saka token, Cut cache KV ngengkel kanggo bab siji kawolu saka model Flash sadurungé. Saben kertu model, pangurangan kira-kira kaping papat marang V4-Flash lan 437-fold marang DeepSeek-V1. Komponen tambahan kalebu Compressed Sparse Attention 2 (CSA2), sing menehi saben lapisan perhatian siji saka telung mode statis, lan dekoding spekulatif DSpark kanggo generasi sing luwih cepet.

Ing hood, saben lapisan MoE nggabungke siji pakar bareng karo 384 ahli routed, ngaktifake enem ahli routed saben token.

Tolok ukur: Ahead of the Pensiun Kapal Penggedhe

Ing evaluasi model dhasar ing laporan teknis, V4.1-Flash ngliwati V4 Pro sing luwih gedhe ing sawetara tes utama: 74.1 ing MMLU-Pro mungsuh 73.5, 79.4 ing HumanEval mungsuh 76.8, 60.6 ing BigCodeBench, lan 93.0 ing GSM8K. South China Morning Post nglaporake manawa DeepSeek ujar manawa model anyar ngalahake Kimi K3 ing benchmark cyber lan coding , pratelan penting ing lapangan model terbuka Cina sing uga kalebu Z.ai's GLM-5.3 lan garis Qwen Alibaba.

Ing upaya alesan maksimum, model instruct skor 90,9 ing GPQA Diamond - nyengsemaken, sanadyan isih konco sistem wates anjog referensi ing Tabel comparison DeepSeek dhewe, GPT-5.6 Sol ing 94.1 lan Claude Opus 5.0 ing 93.4. Kimi K3 lenggah ing 92.9. Wacan sing jujur: iki minangka model sing cedhak karo wates ing rega bobot mbukak, dudu sapuan laboratorium sing ditutup.

V4.1-Flash uga genuinely multimodal. Encoder visi DeepSeek-ViT, sing dilatih saka awal, menehi gambar liwat proyektor rong lapisan, lan model kasebut dilatih ing teks lan gambar bebarengan saka wiwitan latihan. Skor 56.5 ing MMMU-Pro lan 95.6 ing DocVQA.

Dibangun kanggo Agen, Rega kanggo Volume

Pilihan desain nggawe target pamirsa dadi jelas: beban kerja agen, ing ngendi model maca konteks sing gedhe banget lan tumindak ing cakrawala sing dawa. Model ndhukung jendhela konteks nganti siji yuta token , dilatih ing 45-triliun-token multimodal corpus, lan nawakake terus-terusan kontrol alesan- efforts nelpon saka 1 kanggo 100 sing perdagangan biaya inferensi marang akurasi. Jangkoan Decoder nandheske yen tabungan memori khusus nyuda biaya kanggo mbukak agen AI - beban kerja sing luwih akeh wektu maca input tinimbang ngasilake output.

Reaksi masyarakat wis tegas. Utas peluncuran ing Hacker News narik luwih saka 650 poin, lan benang sadurunge kanthi judhul "DeepSeek ngluncurake lampu kilat v4.1 sing luwih murah lan luwih apik tinimbang v4 pro" nglumpukake meh 400 liyane. Komentator sing mbukak model lokal nyathet yen paramèter Engram malah bisa diundhuh menyang SSD kanthi cepet, mbukak dalan menyang inferensi sing cedhak ing hardware konsumen.

Nggoleki Alpha nggawe saham komersial kanthi blak-blakan, nyebat model kasebut minangka model murah sing menehi tantangan kanggo laboratorium perbatasan AS - pangeling yen perang rega ing inferensi AI ora nuduhake tandha-tandha cooling.

Momen sing Disengaja kanggo Pengumuman

Wektu ngandhani. Sedina sadurunge diluncurake, Reuters nglapurake yen DeepSeek wis nutul CITIC Securities kanggo ngatur IPO ing Pasar STAR Shanghai, sawise nglaporake sadurunge yen revenue lab wis mundhak sepuluh kali luwih dhisik tinimbang listing sing bisa. Ngirim model mbukak sing narik kawigaten ing dina-dina sabanjure supaya momentum kasebut terus maju.

Rilis kasebut uga ana ing tengah-tengah pengawasan perusahaan AI China. Awal minggu iki, agensi AS kalebu NSA, CISA lan FBI menehi jeneng enem perusahaan AI Cina ing penasihat babagan distilasi model skala industri - pangeling yen menang teknis DeepSeek saiki teka bebarengan karo bagasi geopolitik.

Ora ana sing dims crita engineering. Kanthi V4 Pro pensiun lan lalu lintas dituju menyang model sing luwih murah lan luwih kuat, DeepSeek wis nggawe argumentasi sing paling jelas yen ing taun 2026, wates AI sing menarik bisa uga ora mung sing nggawe model paling gedhe - nanging sing nyedhiyakake kemampuan paling akeh saben gigabyte memori.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →