Makmal AI China DeepSeek telah mengeluarkan V4.1-Flash, model berat terbuka berbilang mod yang menggandingkan tulang belakang 552 bilion parameter dengan beberapa pemampatan memori yang paling agresif namun dihantar dalam sistem kelas sempadan. Model itu disiarkan secara langsung pada hari Rabu dengan lesen MIT pada Hugging Face dan laporan teknikal yang disertakan, lapor Reuters, mengehadkan tajuk utama untuk makmal yang berpangkalan di Hangzhou.
Keluaran adalah lebih daripada bonjolan versi rutin. DeepSeek secara serentak telah menamatkan peringkat V4 Pro perdananya, dan TechNode melaporkan bahawa permintaan kepada V4 Pro kini dihalakan ke V4.1-Flash — pernyataan keyakinan yang ketara dalam model yang membawa nama "Flash" namun menyiarkan nombor penanda aras pada atau di atas model yang digantikannya. For more context on this story, see our ongoing breaking AI news.
"Denyar" Lebih Besar Dengan Bil Memori yang Lebih Kecil
Menurut kad model rasmi, DeepSeek-V4.1-Flash ialah model Mixture-of-Experts (MoE) dengan 552 bilion parameter tulang belakang serta komponen memori bersyarat "Engram" 196 bilion parameter yang jarang diakses melalui carian berasaskan token. Walaupun saiznya yang besar, model ini hanya mengaktifkan 8 bilion parameter setiap token semasa praisi dan 16 bilion semasa penyahkod — lebih sedikit parameter aktif daripada parameter sebelumnya 284B, yang mempunyai 13 bilion malar.
Bahagian tengah seni bina ialah apa yang DeepSeek panggil sebagai reka bentuk Causal Encoder-Decoder (CED): 40-layer Transformer dipecahkan kepada 20-layer causal encoder diikuti dengan 20-layer decoder. Oleh kerana cache KV global penyahkod diunjurkan daripada keadaan tersembunyi pengekod terakhir dan bukannya terkumpul lapisan demi lapisan, memori yang diperlukan untuk mengekalkan perbualan yang panjang mengecut secara mendadak.
Nombor mampatan ialah tajuk utama. Dengan caching KV utama FP4 dalam format E2M1, jejak cache KV global menurun kepada 890 bait setiap token — kira-kira satu perempat daripada DeepSeek-V4-Flash. Teknik yang dipanggil SWA Bounded Replay membina semula keadaan hilang perhatian dengan memainkan semula hanya tetingkap token yang paling terkini, memotong cache KV yang berterusan kepada kira-kira satu perlapan daripada model Flash sebelumnya. Mengikut kad model, pengurangan adalah kira-kira empat kali ganda berbanding V4-Flash dan 437 kali ganda berbanding DeepSeek-V1. Komponen tambahan termasuk Compressed Sparse Attention 2 (CSA2), yang memberikan setiap lapisan perhatian satu daripada tiga mod statik dan penyahkodan spekulatif DSpark untuk penjanaan yang lebih pantas.
Di bawah tudung, setiap lapisan MoE menggabungkan seorang pakar yang dikongsi dengan 384 pakar yang dihalakan, mengaktifkan enam pakar yang dihalakan bagi setiap token.
Penanda Aras: Menjelang Kapal Utama Bersara
Pada penilaian model asas dalam laporan teknikal, kelebihan V4.1-Flash melepasi V4 Pro yang jauh lebih besar pada beberapa ujian utama: 74.1 pada MMLU-Pro berbanding 73.5, 79.4 pada HumanEval berbanding 76.8, 60.6 pada BigCodeBench dan 93.0 pada GSM8K. The South China Morning Post melaporkan bahawa DeepSeek berkata model baharu itu mengatasi Kimi K3 pada tanda aras siber dan pengekodan, satu tuntutan yang ketara dalam bidang model terbuka China yang turut merangkumi GLM-5.3 Z.ai dan barisan Qwen Alibaba.
Pada usaha penaakulan maksimum, model arahan mendapat skor 90.9 pada GPQA Diamond — mengagumkan, walaupun masih di belakang sistem sempadan terkemuka yang dirujuk dalam jadual perbandingan DeepSeek sendiri, GPT-5.6 Sol pada 94.1 dan Claude Opus 5.0 pada 93.4. Kimi K3 duduk di 92.9. Bacaan jujur: ini adalah model bersebelahan sempadan pada harga wajaran terbuka, bukan sapuan bersih daripada makmal tertutup.
V4.1-Flash juga benar-benar multimodal. Pengekod penglihatan DeepSeek-ViT, dilatih dari awal, menyuap imej melalui projektor dua lapisan, dan model itu dilatih pada teks dan imej secara bersama dari permulaan pra-latihan. Ia mendapat markah 56.5 pada MMMU-Pro dan 95.6 pada DocVQA.
Dibina untuk Ejen, Harga untuk Jumlah
Pilihan reka bentuk menjadikan khalayak sasaran jelas: beban kerja agen, di mana model membaca konteks yang sangat besar dan bertindak di horizon yang panjang. Model ini menyokong tetingkap konteks sehingga satu juta token, telah dilatih pada korpus multimodal 45 trilion token, dan menawarkan dail usaha penaakulan yang boleh dikawal secara berterusan dari 1 hingga 100 yang memperdagangkan kos inferens terhadap ketepatan. Liputan Penyahkod menekankan bahawa penjimatan memori secara khusus mengurangkan kos untuk menjalankan ejen AI — beban kerja yang menghabiskan lebih banyak masa membaca input daripada menjana output.
Reaksi masyarakat sangat tegas. Urutan pelancaran di Berita Hacker memperoleh lebih daripada 650 mata, dan urutan awal bertajuk "DeepSeek melancarkan v4.1 kilat lebih murah dan lebih berkemampuan daripada v4 pro" mengumpul hampir 400 lagi. Pengulas yang menjalankan model secara tempatan menyatakan bahawa parameter Engram malah boleh dimuat turun ke SSD pantas, membuka laluan kepada inferens berhampiran sempadan pada perkakasan pengguna.
Seeking Alpha merangka kepentingan komersil secara terang-terangan, menyebutnya sebagai model kos ultra rendah yang memberikan cabaran untuk makmal sempadan AS — peringatan bahawa perang harga dalam inferens AI tidak menunjukkan tanda-tanda penyejukan.
Detik yang Disengajakan untuk Pengumuman
Masa yang menentukan. Sehari sebelum pelancaran, Reuters melaporkan bahawa DeepSeek telah memanfaatkan CITIC Securities untuk mengatur IPO di Pasaran STAR Shanghai, berikutan sebelum ini melaporkan bahawa hasil makmal itu telah meningkat sepuluh kali ganda lebih awal daripada kemungkinan penyenaraian. Menghantar model terbuka yang menarik tajuk berita beberapa hari kemudian mengekalkan momentum itu.
Pembebasan itu juga mendarat di tengah-tengah penelitian yang lebih tinggi terhadap firma AI China. Awal minggu ini, agensi AS termasuk NSA, CISA dan FBI menamakan enam syarikat AI China dalam nasihat tentang penyulingan model skala industri — peringatan bahawa kemenangan teknikal DeepSeek kini tiba bersama bagasi geopolitik.
Tiada satu pun daripada itu meredupkan cerita kejuruteraan. Dengan V4 Pro bersara dan trafiknya disalurkan kepada model yang lebih murah dan lebih kukuh, DeepSeek telah membuat hujah yang paling jelas yang mungkin bahawa pada tahun 2026 sempadan menarik AI mungkin bukan sahaja yang membina model terbesar — tetapi yang menyediakan keupayaan paling banyak bagi setiap gigabait memori.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →