Il laboratorio cinese di intelligenza artificiale DeepSeek ha rilasciato V4.1-Flash, un modello multimodale open-weight che abbina un backbone da 552 miliardi di parametri con alcuni dei sistemi di compressione di memoria più aggressivi mai forniti in un sistema di frontiera. Il modello è stato lanciato mercoledì con una licenza del MIT su Hugging Face e un rapporto tecnico di accompagnamento, ha riferito Reuters, coronando una serie di titoli sui giornali per il laboratorio con sede a Hangzhou.

Il rilascio è più di un semplice aggiornamento della versione. DeepSeek ha contemporaneamente ritirato il suo livello di punta V4 Pro e TechNode ha riferito che le richieste a V4 Pro vengono ora indirizzate a V4.1-Flash: una sorprendente dichiarazione di fiducia in un modello che porta il nome "Flash" ma pubblica numeri di riferimento pari o superiori al modello che sostituisce. Per maggiori informazioni su questa storia, consulta la nostra tendenze IA.

Un "Flash" più grande con una fattura di memoria più piccola

Secondo la scheda modello ufficiale, DeepSeek-V4.1-Flash è un modello Mixture-of-Experts (MoE) con 552 miliardi di parametri backbone più un componente di memoria condizionale "Engram" da 196 miliardi di parametri a cui si accede scarsamente tramite ricerca basata su token. Nonostante le dimensioni enormi, il modello attiva solo 8 miliardi di parametri per token durante la precompilazione e 16 miliardi durante la decodifica: meno parametri attivi rispetto al suo predecessore con parametri 284B, che ne gestiva 13 miliardi costanti.

Il fulcro dell'architettura è quello che DeepSeek chiama un design Causal Encoder-Decoder (CED): un trasformatore a 40 strati suddiviso in un codificatore causale a 20 strati seguito da un decodificatore a 20 strati. Poiché la cache KV globale del decodificatore viene proiettata dagli stati nascosti del codificatore finale anziché accumulati strato per strato, la memoria necessaria per sostenere lunghe conversazioni si riduce drasticamente.

I numeri di compressione sono il titolo. Con il caching KV principale di FP4 in formato E2M1, l'impronta della cache KV globale scende a 890 byte per token, circa un quarto di DeepSeek-V4-Flash. Una tecnica chiamata SWA Bounded Replay ricostruisce gli stati di attenzione mancanti riproducendo solo la finestra di token più recente, riducendo la cache KV persistente a circa un ottavo del precedente modello Flash. Secondo la scheda modello, la riduzione è di circa quattro volte rispetto a V4-Flash e 437 volte rispetto a DeepSeek-V1. Componenti aggiuntivi includono Compressed Sparse Attention 2 (CSA2), che assegna a ciascun livello di attenzione una delle tre modalità statiche, e la decodifica speculativa DSpark per una generazione più rapida.

Sotto il cofano, ogni livello MoE combina un esperto condiviso con 384 esperti instradati, attivando sei esperti instradati per token.

Benchmark: davanti all'ammiraglia in pensione

Nelle valutazioni del modello base nel rapporto tecnico, V4.1-Flash supera il molto più grande V4 Pro in diversi test chiave: 74,1 su MMLU-Pro contro 73,5, 79,4 su HumanEval contro 76,8, 60,6 su BigCodeBench e 93,0 su GSM8K. Il South China Morning Post ha riferito che DeepSeek afferma che il nuovo modello batte Kimi K3 sui benchmark informatici e di codifica, un'affermazione notevole in un campo cinese di modelli aperti che include anche il GLM-5.3 di Z.ai e la linea Qwen di Alibaba.

Al massimo sforzo di ragionamento, il modello di istruzione ottiene un punteggio di 90,9 su GPQA Diamond: impressionante, sebbene ancora dietro i principali sistemi di frontiera citati nella tabella comparativa di DeepSeek, GPT-5.6 Sol a 94,1 e Claude Opus 5.0 a 93,4. Kimi K3 si attesta a 92,9. La lettura onesta: questo è un modello adiacente alla frontiera a prezzi a peso aperto, non una piazza pulita dei laboratori chiusi.

V4.1-Flash è anche veramente multimodale. Un codificatore di visione DeepSeek-ViT, addestrato da zero, alimenta le immagini attraverso un proiettore a due strati e il modello è stato addestrato su testo e immagini congiuntamente dall'inizio della pre-formazione. Ha un punteggio di 56,5 su MMMU-Pro e 95,6 su DocVQA.

Costruito per gli agenti, valutato in base al volume

Le scelte progettuali rendono chiaro il pubblico a cui si rivolgono: carichi di lavoro agenti, in cui i modelli leggono contesti enormi e agiscono su orizzonti a lungo termine. Il modello supporta finestre di contesto fino a un milione di token, è stato addestrato su un corpus multimodale di 45 trilioni di token e offre un quadrante dello sforzo di ragionamento continuamente controllabile da 1 a 100 che scambia i costi di inferenza con l'accuratezza. L'articolo di Decoder ha sottolineato che il risparmio di memoria riduce in modo specifico i costi per l'esecuzione degli agenti IA, carichi di lavoro che impiegano molto più tempo a leggere l'input che a generare l'output.

La reazione della comunità è stata enfatica. Il thread di lancio su Hacker News ha ottenuto più di 650 punti e un thread precedente intitolato "DeepSeek launching v4.1 flash più economico e più potente di v4 pro" ne ha raccolti quasi altri 400. I commentatori che eseguono modelli localmente hanno notato che i parametri Engram possono anche essere scaricati su SSD veloci, aprendo la strada a un'inferenza quasi di frontiera sull'hardware consumer.

Seeking Alpha ha inquadrato senza mezzi termini la posta in gioco commerciale, definendolo un modello a bassissimo costo che presenta sfide per i laboratori di frontiera statunitensi – per ricordare che la guerra dei prezzi nell’inferenza dell’intelligenza artificiale non mostra segni di raffreddamento.

Un momento deliberato per l'annuncio

Il momento lo dice. Un giorno prima del lancio, Reuters ha riferito che DeepSeek si era rivolto a CITIC Securities per organizzare un'IPO sul mercato STAR di Shanghai, in seguito a precedenti notizie secondo cui le entrate del laboratorio erano cresciute di dieci volte prima di una possibile quotazione. La pubblicazione di un modello aperto che attira i titoli dei giornali giorni dopo mantiene lo slancio.

Il comunicato arriva anche nel mezzo di un controllo approfondito delle aziende cinesi di intelligenza artificiale. All’inizio di questa settimana, agenzie statunitensi tra cui NSA, CISA e FBI hanno nominato sei società cinesi di intelligenza artificiale in un avviso sulla distillazione modello su scala industriale – per ricordare che le vittorie tecniche di DeepSeek ora arrivano insieme al bagaglio geopolitico.

Niente di tutto ciò offusca la storia dell’ingegneria. Con V4 Pro ritirato e il suo traffico instradato verso un modello più economico e più potente, DeepSeek ha sostenuto nel modo più chiaro possibile che nel 2026 l’interessante frontiera dell’intelligenza artificiale potrebbe non essere solo chi costruisce il modello più grande, ma chi offre la massima capacità per gigabyte di memoria.

---

Rimani Aggiornato sull'IA

Le ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.

Leggi altre notizie sull'IA →