Chińskie laboratorium AI DeepSeek wypuściło V4.1-Flash, multimodalny model o otwartej wadze, który łączy szkielet o 552 miliardach parametrów z najbardziej agresywną kompresją pamięci, jaką kiedykolwiek dostarczono w systemie pierwszej klasy. Model został wprowadzony do sprzedaży w środę z licencją MIT na Hugging Face i towarzyszącym mu raportem technicznym, jak podał Reuters, kończąc serię pierwszych stron gazet w laboratorium w Hangzhou.
The release is more than a routine version bump. DeepSeek jednocześnie wycofał swój flagowy poziom V4 Pro, a TechNode poinformował, że żądania do V4 Pro są obecnie kierowane do V4.1-Flash – co stanowi uderzające potwierdzenie zaufania do modelu, który nosi nazwę „Flash”, a mimo to podaje wyniki testów porównawczych na poziomie modelu, który zastępuje, lub przewyższa go. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.
A Bigger "Flash" With a Smaller Memory Bill
Według oficjalnej karty modelu DeepSeek-V4.1-Flash to model opracowany przez mieszankę ekspertów (MoE) z 552 miliardami parametrów szkieletu oraz komponentem pamięci warunkowej „Engram” o 196 miliardach parametrów, do którego dostęp jest rzadko dostępny poprzez wyszukiwanie oparte na tokenach. Pomimo ogromnych rozmiarów model aktywuje tylko 8 miliardów parametrów na token podczas wstępnego wypełniania i 16 miliardów podczas dekodowania — mniej aktywnych parametrów niż jego poprzednik z parametrami 284B, który działał na stałym poziomie 13 miliardów.
Centralnym elementem architektury jest to, co DeepSeek nazywa konstrukcją Causal Encoder-Decoder (CED): 40-warstwowy transformator podzielony na 20-warstwowy koder przyczynowy, po którym następuje 20-warstwowy dekoder. Ponieważ globalna pamięć podręczna KV dekodera jest wyświetlana na podstawie końcowych ukrytych stanów kodera, a nie gromadzona warstwa po warstwie, pamięć potrzebna do podtrzymania długich rozmów drastycznie się kurczy.
Numery kompresji są nagłówkiem. Dzięki głównemu buforowaniu KV FP4 w formacie E2M1, globalny rozmiar pamięci podręcznej KV spada do 890 bajtów na token — mniej więcej jedna czwarta DeepSeek-V4-Flash. Technika zwana SWA Bounded Replay rekonstruuje brakujące stany uwagi poprzez odtwarzanie tylko najnowszego okna tokenów, zmniejszając trwałą pamięć podręczną KV do około jednej ósmej poprzedniego modelu Flash. Według karty modelu redukcja jest w przybliżeniu czterokrotna w porównaniu z V4-Flash i 437-krotna w porównaniu z DeepSeek-V1. Dodatkowe komponenty obejmują Compressed Sparse Attention 2 (CSA2), który przypisuje każdej warstwie uwagi jeden z trzech trybów statycznych oraz dekodowanie spekulatywne DSpark w celu szybszego generowania.
Pod maską każda warstwa MoE łączy jednego wspólnego eksperta z 384 ekspertami kierowanymi, aktywując sześciu ekspertów kierowanych na token.
Testy porównawcze: przed wycofanym okrętem flagowym
Na podstawie ocen modelu podstawowego zawartych w raporcie technicznym, wersja 4.1-Flash przewyższa znacznie większą wersję V4 Pro w kilku kluczowych testach: 74,1 na MMLU-Pro w porównaniu z 73,5, 79,4 w HumanEval w porównaniu z 76,8, 60,6 w BigCodeBench i 93,0 w GSM8K. Jak donosi South China Morning Post, DeepSeek twierdzi, że nowy model pobija Kimi K3 w testach cybernetycznych i kodowania, co jest godnym uwagi stwierdzeniem w chińskiej dziedzinie modeli otwartych, która obejmuje także GLM-5.3 Z.ai i linię Qwen firmy Alibaba.
Przy maksymalnym wysiłku rozumowania model instruktora osiąga wynik 90,9 w GPQA Diamond — imponujący, choć wciąż pozostający w tyle za wiodącymi systemami granicznymi wymienionymi w tabeli porównawczej DeepSeek, GPT-5.6 Sol z wynikiem 94,1 i Claude Opus 5,0 z wynikiem 93,4. Kimi K3 zajmuje 92,9. Uczciwa lektura: jest to model z pogranicza w cenach otwartych, a nie czysty przegląd zamkniętych laboratoriów.
V4.1-Flash is also genuinely multimodal. Przeszkolony od podstaw koder wizyjny DeepSeek-ViT przesyła obrazy przez dwuwarstwowy projektor, a model od początku szkolenia wstępnego był szkolony łącznie na tekście i obrazach. Uzyskał wynik 56,5 w MMMU-Pro i 95,6 w DocVQA.
Stworzony dla agentów, wyceniony na podstawie objętości
Wybory projektowe jasno pokazują docelowych odbiorców: obciążenia agentów, w których modele czytają ogromne konteksty i działają w długich horyzontach. Model obsługuje okna kontekstowe o wielkości do jednego miliona tokenów, został przeszkolony na multimodalnym korpusie zawierającym 45 bilionów tokenów i oferuje stale kontrolowane pokrętło wysiłku wnioskowania od 1 do 100, które porównuje koszt wnioskowania z dokładnością. W artykule Dekodera podkreślono, że oszczędność pamięci w szczególności zmniejsza koszty uruchamiania agentów AI – obciążeń, które spędzają znacznie więcej czasu na czytaniu danych wejściowych niż generowaniu danych wyjściowych.
Reakcja społeczności była zdecydowana. Wątek o uruchomieniu w Hacker News zebrał ponad 650 punktów, a wcześniejszy wątek zatytułowany „DeepSeek uruchamia pamięć flash w wersji 4.1 taniej i wydajniej niż w wersji 4 pro” zebrał prawie 400 punktów więcej. Komentatorzy, którzy lokalnie uruchamiają modele, zauważyli, że parametry Engramu można nawet przenieść na szybkie dyski SSD, otwierając drogę do wnioskowania o charakterze niemal granicznym na sprzęcie konsumenckim.
Firma Seeking Alpha bez ogródek określiła komercyjne stawki, nazywając go bardzo tanim modelem, który stwarza wyzwania dla amerykańskich laboratoriów granicznych, co przypomina, że wojna cenowa w zakresie wnioskowania dotyczącego sztucznej inteligencji nie wykazuje oznak ochłodzenia.
Celowy moment na ogłoszenie
Czas mówi. Dzień przed premierą agencja Reuters poinformowała, że DeepSeek skontaktował się z CITIC Securities w celu zorganizowania pierwszej oferty publicznej na giełdzie STAR w Szanghaju po wcześniejszych informacjach, że przychody laboratorium wzrosły dziesięciokrotnie w porównaniu z możliwym notowaniem na giełdzie. Wysyłka przyciągającego uwagę otwartego modelu kilka dni później podtrzymuje tę dynamikę.
Publikacja ta pojawia się również w kontekście wzmożonej kontroli chińskich firm zajmujących się sztuczną inteligencją. Na początku tygodnia amerykańskie agencje, w tym NSA, CISA i FBI, w swoim poradniku dotyczącym destylacji modeli na skalę przemysłową wymieniły sześć chińskich firm zajmujących się sztuczną inteligencją, co przypomina, że zwycięstwa techniczne DeepSeek towarzyszą teraz bagażowi geopolitycznemu.
Nic z tego nie przyćmiewa historii inżynierii. Po wycofaniu V4 Pro i przekierowaniu ruchu do tańszego, mocniejszego modelu DeepSeek przedstawił najjaśniejszy możliwy argument, że w 2026 roku interesującą granicą sztucznej inteligencji może być nie tylko to, kto zbuduje największy model, ale także to, kto obsłuży największą pojemność na gigabajt pamięci.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →