Il laboratorio cinese di intelligenza artificiale DeepSeek ha tranquillamente lanciato deepseek-v4-flash-vision-exp, una versione sperimentale del suo modello V4-Flash che può accettare immagini insieme al testo, colmando una delle lacune più evidenti nella sua famiglia di modelli di punta. Il rilascio, documentato sulle pagine API ufficiali dell'azienda, arriva poche settimane dopo l'aggiornamento di V4-Flash-0731 e V4-Pro-0813 e offre agli sviluppatori un modo a lungo richiesto per inserire screenshot, grafici e foto direttamente in uno dei modelli di frontiera più economici del settore. Per i team che seguono gli ultimi sviluppi dell'intelligenza artificiale, è un altro segnale che DeepSeek intende eguagliare i rivali occidentali funzionalità per funzionalità, riducendoli in modo aggressivo sul prezzo.

Cosa fa il nuovo modello

Secondo la documentazione API di DeepSeek, "deepseek-v4-flash-vision-exp" consente agli utenti di "chiedere al modello di descrivere immagini, leggere testo da screenshot, analizzare grafici e altro ancora". Il modello accetta file JPEG, PNG, GIF e WebP, con il formato rilevato dal contenuto effettivo del file anziché dal nome del file o dal tipo MIME dichiarato: un dettaglio piccolo ma accurato che previene bug di estensioni non corrispondenti.

Gli sviluppatori possono passare le immagini in tre modi: URL di dati in linea con codifica base64 (soggetti a un limite del corpo della richiesta di 48 MiB), URL esterni accessibili pubblicamente (fino a 8.192 caratteri, 32 MiB per immagine, con una finestra di download di 60 secondi) o tramite l'API File. Tutto utilizza il formato standard Chat Completions compatibile con OpenAI e il modello è raggiungibile anche tramite l'endpoint compatibile con Anthropic di DeepSeek, il che significa che il codice SDK Claude esistente può cambiare backend con modifiche minime.

Prezzi: visione di frontiera ai tassi delle materie prime

Il modello sperimentale eredita il prezzo aggressivo di V4-Flash. I token di input costano 0,22 dollari per milione nelle ore non di punta e 0,44 dollari nelle ore di punta per i mancati risultati della cache, scendendo a soli 0,007 dollari per milione per gli accessi alla cache durante le ore non di punta. I token di output hanno un prezzo di 0,66 dollari per milione nelle ore non di punta e di 1,32 dollari nelle ore di punta. Le immagini vengono convertite in token in base alle loro dimensioni e fatturate insieme ai token di testo.

Questo prezzo è importante perché riduce drasticamente le offerte multimodali comparabili dei principali fornitori statunitensi, continuando la guerra dei prezzi che DeepSeek ha intrapreso tutto l’anno. Il modello riporta anche le specifiche principali della famiglia: una finestra di contesto da 1 milione di token, fino a 384.000 token di output massimo, supporto per modalità di pensiero e non pensiero, output JSON, chiamate a strumenti e un limite di concorrenza di 2.500 - specifiche che lo posizionano come un vero cavallo di battaglia per carichi di lavoro di produzione ad alto volume piuttosto che un giocattolo di ricerca.

Perché gli sviluppatori erano disperati per questo

Il lancio è arrivato su Hacker News, dove ha raccolto rapidamente più di 450 punti e l'entusiasmo ha una storia di origine specifica. Il V4-Flash-0731 di solo testo di DeepSeek aveva sviluppato la reputazione di credere di poter vedere. Diversi sviluppatori hanno riferito che il modello avrebbe presupposto che avesse capacità visive, per poi improvvisare elaborate soluzioni alternative quando ha scoperto che non poteva, tra cui l'invenzione di strumenti di analisi delle immagini basati su testo e l'estrazione di screenshot dai dispositivi collegati prima di rendersi conto che non aveva modo di visualizzarli.

"Ho sentito che DeepSeek v4 Flash 0731 ha spesso dato per scontato di avere capacità di visione e poi ricorre a inventare strumenti di analisi delle immagini basati su testo quando scopre che in realtà non può vedere", ha scritto un commentatore, facendo eco ai resoconti di molti altri. Per chiunque utilizzi il modello come agente nelle pipeline di codifica o di automazione, la nuova variante di visione dovrebbe eliminare un’intera categoria di fallimenti guidati dalla confusione.

La cattura 800x800

Il rilascio non è esente da limitazioni e la critica più aspra rivolta a Hacker News ha preso di mira un aspetto: la risoluzione dell'immagine. La documentazione afferma che prima dell'inferenza, ogni immagine viene ridimensionata automaticamente in modo che il numero totale di pixel corrisponda approssimativamente a un'immagine 800x800, preservando le proporzioni.

"È utile, ma per l'OCR e molte altre applicazioni deve essere un po' più alto (ad esempio: inserire una pagina intera in formato A4/Lettera)", ha affermato uno sviluppatore, mentre un altro ha risposto senza mezzi termini che il limite di 800x800 "uccide molti casi d'uso". Per documenti densi, scansioni di pagine intere o debugging dell'interfaccia utente a grana fine, il limite massimo di risoluzione potrebbe spingere gli sviluppatori verso alternative a risoluzione più elevata e più costose. Una soluzione alternativa popolare suggerita nel thread: dividere le pagine di grandi dimensioni in riquadri e alimentarle separatamente.

L’altra questione aperta è l’apertura. DeepSeek ha costruito la sua reputazione rilasciando pesi aperti, ma la società non ha detto se seguirà la variante di visione. I commentatori hanno ipotizzato che potrebbe derivare dalla recente ricerca "Thinking with Visual Primitives" dell'azienda, per la quale sarebbero stati promessi pesi, ma nulla è stato confermato. In particolare, il modello è elencato come sperimentale – il suffisso “-exp” – segnalando che DeepSeek prevede di ripetere.

Una versione silenziosa ma strategica

Il calo di visione continua ad essere un periodo impegnativo per il laboratorio con sede a Hangzhou, che ha passato agosto a fornire aggiornamenti costanti: V4-Flash-0731, il framework DeepSeek Harness orientato agli agenti, l'aggiornamento V4-Pro-0813 e ora input multimodale. Piuttosto che un singolo lancio di successo, DeepSeek sta eseguendo una cadenza di rilasci rapidi e incrementali che mantengono i suoi modelli all’interno delle toolchain degli sviluppatori: la stessa strategia di conquista del territorio che i laboratori occidentali stanno perseguendo con gli agenti di codifica.

Per il settore dell’intelligenza artificiale in generale, il messaggio è familiare ma ancora scomodo per gli operatori storici: capacità che un tempo giustificavano prezzi premium – comprensione dell’immagine in un contesto di milioni di token – stanno ora arrivando a pochi centesimi per milione di token. L'etichetta sperimentale offre a DeepSeek spazio per perfezionare il modello, ma gli sviluppatori hanno già iniziato a collegarlo a flussi di lavoro basati su screenshot. La domanda non è più se DeepSeek possa eguagliare il set di funzionalità multimodali dei suoi rivali, ma quanto velocemente il resto del mercato si adatterà ai suoi prezzi.

Stai al passo con l'intelligenza artificiale

Per le ultime versioni dei modelli di intelligenza artificiale, battaglie benchmark e analisi di settore, aggiungi ai segnalibri AI Buzz Wire.

Leggi altre notizie sull'AI →