Čínská laboratoř AI DeepSeek vydala V4.1-Flash, multimodální model s otevřenou hmotností, který spojuje páteř s 552 miliardami parametrů s jednou z nejagresivnějších kompresí paměti, která byla dosud dodávána v systému hraniční třídy. Model byl uveden do provozu ve středu s licencí MIT na Hugging Face a doprovodnou technickou zprávou, uvedla agentura Reuters, která omezila řadu titulků pro laboratoř v Hangzhou.
Vydání je více než jen rutinní verze. DeepSeek současně vyřadil svou vlajkovou loď úrovně V4 Pro a TechNode oznámil, že požadavky na V4 Pro jsou nyní směrovány do V4.1-Flash – pozoruhodné prohlášení důvěry v model, který nese název „Flash“, přesto uvádí referenční čísla na nebo nad modelem, který nahrazuje. For more context on this story, see our ongoing latest AI developments.
Větší "blesk" s menším účtem za paměť
Podle oficiální modelové karty je DeepSeek-V4.1-Flash model Mixture-of-Experts (MoE) s 552 miliardami parametrů páteře plus komponentou podmíněné paměti "Engram" s 196 miliardami parametrů, ke které se jen zřídka přistupuje prostřednictvím vyhledávání na základě tokenů. Navzdory naprosté velikosti model aktivuje pouze 8 miliard parametrů na token během předvyplnění a 16 miliard během dekódování – méně aktivních parametrů než jeho předchůdce s parametrem 284B, který měl konstantních 13 miliard.
Ústředním prvkem architektury je to, co DeepSeek nazývá Causal Encoder-Decoder (CED) design: 40vrstvý transformátor rozdělený na 20vrstvý kauzální kodér následovaný 20vrstvým dekodérem. Protože globální mezipaměť KV dekodéru je promítána z konečných skrytých stavů kodéru spíše než akumulovaná vrstva po vrstvě, paměť potřebná k udržení dlouhých konverzací se dramaticky zmenšuje.
Čísla komprese jsou nadpisem. S hlavní KV mezipamětí FP4 ve formátu E2M1 klesne globální stopa mezipaměti KV na 890 bajtů na token – zhruba jednu čtvrtinu DeepSeek-V4-Flash. Technika zvaná SWA Bounded Replay rekonstruuje chybějící stavy pozornosti přehráním pouze posledního okna tokenů, čímž omezí perzistentní KV cache na přibližně jednu osminu předchozího modelu Flash. Podle modelu karty je snížení zhruba čtyřnásobné proti V4-Flash a 437násobné proti DeepSeek-V1. Mezi další komponenty patří Compressed Sparse Attention 2 (CSA2), která každé vrstvě pozornosti přiřadí jeden ze tří statických režimů, a spekulativní dekódování DSpark pro rychlejší generování.
Pod kapotou každá vrstva MoE kombinuje jednoho sdíleného experta s 384 směrovanými experty, čímž aktivuje šest směrovaných expertů na token.
Benchmarky: Před vysloužilou vlajkovou lodí
Podle hodnocení základního modelu v technické zprávě V4.1-Flash překonal mnohem větší V4 Pro v několika klíčových testech: 74,1 na MMLU-Pro oproti 73,5, 79,4 na HumanEval oproti 76,8, 60,6 na BigCodeBench a 93,0 na GSM8K. The South China Morning Post uvedl, že DeepSeek říká, že nový model překoná Kimi K3 v kybernetických a kódovacích benchmarcích, což je pozoruhodné tvrzení v oblasti čínských otevřených modelů, které také zahrnují GLM-5.3 od Z.ai a řadu Qwen od Alibaby.
Při maximálním úsilí o uvažování dosáhl model instruct skóre 90,9 na GPQA Diamond – působivé, i když stále za předními hraničními systémy uvedenými ve vlastní srovnávací tabulce DeepSeek, GPT-5.6 Sol na 94,1 a Claude Opus 5,0 na 93,4. Kimi K3 sedí na 92,9. Čestné čtení: jedná se o model sousedící s hranicí za ceny s otevřenou váhou, nikoli o čisté zametání uzavřených laboratoří.
V4.1-Flash je také skutečně multimodální. DeepSeek-ViT kodér vidění, trénovaný od nuly, dodává obrázky přes dvouvrstvý projektor a model byl trénován na textu a obrázcích společně od začátku předběžného školení. Má skóre 56,5 na MMMU-Pro a 95,6 na DocVQA.
Vytvořeno pro agenty, cena za objem
Volby designu objasňují cílové publikum: agentní pracovní zátěž, kde modely čtou obrovské kontexty a jednají v dlouhodobém horizontu. Model podporuje kontextová okna až jeden milion tokenů, byl trénován na multimodálním korpusu s 45 biliony tokenů a nabízí plynule ovladatelný číselník úsudku-úsilí od 1 do 100, který porovnává náklady na odvození a přesnost. Pokrytí dekodéru zdůraznilo, že úspory paměti konkrétně snižují náklady na provoz agentů AI – pracovní zátěže, které tráví mnohem více času čtením vstupu než generováním výstupu.
Reakce komunity byla důrazná. Spouštěcí vlákno na Hacker News získalo více než 650 bodů a dřívější vlákno s názvem „DeepSeek spouští flash v4.1 levnější a schopnější než v4 pro“ shromáždilo téměř 400 dalších. Komentátoři, kteří provozují modely lokálně, poznamenali, že parametry Engramu lze dokonce přesunout na rychlé SSD, což otevírá cestu k téměř hraničnímu úsudku o spotřebitelském hardwaru.
Seking Alpha zformuloval komerční sázky bez obalu a nazval jej velmi levným modelem, který představuje výzvy pro americké pohraniční laboratoře – což je připomínka, že cenová válka v odvození AI nevykazuje žádné známky ochlazení.
Záměrný okamžik pro oznámení
Načasování je vypovídající. Den před spuštěním agentura Reuters uvedla, že společnost DeepSeek využila CITIC Securities, aby zajistila IPO na šanghajském trhu STAR, po dřívější zprávě, že výnosy laboratoře vzrostly desetinásobně před možným uvedením na burzu. Odeslání otevřeného modelu, který zaujme titulky, o několik dní později, tuto dynamiku udržuje.
Zveřejnění také přistane uprostřed zvýšené kontroly čínských firem AI. Začátkem tohoto týdne americké agentury včetně NSA, CISA a FBI jmenovaly šest čínských společností s umělou inteligencí v poradě o průmyslové destilaci modelů – což je připomínka, že technické výhry DeepSeek nyní přicházejí spolu s geopolitickou zátěží.
Nic z toho neoslabuje inženýrský příběh. Vzhledem k tomu, že V4 Pro je vyřazeno a jeho provoz je směrován na levnější a silnější model, DeepSeek předložil nejjasnější možný argument, že v roce 2026 nemusí být zajímavou hranicí umělé inteligence pouze to, kdo postaví největší model, ale také to, kdo poskytne největší kapacitu na gigabajt paměti.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →