Mercoledì il team Qwen di Alibaba ha rilasciato Qwen3.8-Flash-Next, un modello multimodale di mix di esperti che funge anche da anteprima dell'architettura del prossimo Qwen4 e che fornisce risultati che, secondo l'azienda, battono il suo molto più grande Qwen3.7-Plus a circa un nono del costo di formazione. Reuters, Bloomberg e The Decoder hanno tutti coperto il lancio, che dà peso a Hugging Face e ModelScope lo stesso giorno in cui Z.ai ha spedito il proprio modello aperto adiacente alla frontiera. Segui le ultime notizie sull'IA mentre la corsa a peso aperto accelera.
Una nuova architettura in miniatura
La specifica principale è l’efficienza. Qwen3.8-Flash-Next ha 125 miliardi di parametri totali ma ne attiva solo 6 miliardi per token. Per fare un confronto, Qwen3.7-Plus, il modello che supera nei benchmark pubblicati da Alibaba, ha 397 miliardi di parametri totali con 17 miliardi attivati per token, quasi tre volte il conteggio attivo di Flash-Next.
Il pezzo tecnicamente più interessante è un nuovo strato di inclusione di N grammi che trasporta 51 miliardi di parametri. Il livello memorizza gruppi di parole comuni come voci autonome in quello che Matthias Bastian di The Decoder ha descritto come una sorta di "dizionario delle frasi", fornendo informazioni a livello di frase all'inizio della rete. Fondamentalmente, si trova nella normale RAM di sistema piuttosto che nella costosa memoria della GPU, a quello che il team di Qwen chiama un costo aggiuntivo relativamente basso: un'innovazione architetturale prevista per portare in Qwen4.
Il modello supporta nativamente una finestra di contesto da 262.144 token e scala fino a un milione di token utilizzando l'estensione YaRN a contesto lungo. Una relazione tecnica è pubblicata su GitHub.
Benchmark: programmazione e lavoro d'ufficio
I benchmark di Alibaba confrontano Flash-Next con DeepSeek-V4-Flash (284 miliardi di parametri, 13 miliardi attivi) e Claude Opus 4.6 (Max) di Anthropic. Nonostante entrambi i rivali siano molto più grandi o più costosi, Flash-Next è leader nella maggior parte delle attività testate, con i maggiori guadagni in termini di codifica e produttività in ufficio.
Nella codifica ad agenti, Flash-Next ha ottenuto 58,7 su DeepSWE 1.1 e 62,5 su SWE-bench Pro, battendo sia DeepSeek-V4-Flash che Claude Opus 4.6. Il divario nelle attività d'ufficio è ancora più ampio: 73,9 su CoWorkBench contro 45,1 per DeepSeek-V4-Flash e 55,7 su JobBench - quasi il doppio del 27,6 di Qwen3.7-Plus. Il ragionamento scientifico è molto simile in tutto il campo, con Flash-Next a 91,7 su GPQA Diamond e 91,9 su LiveCodeBench v6. Claude Opus 4.6 risulta migliore solo all'Umanità's Last Exam, da 40.0 a 35.9, ed è un modello antropico più vecchio di febbraio 2026. Come sempre, i punteggi dei benchmark pubblicati e le prestazioni nel mondo reale possono differire.
Pressione sui prezzi su ogni rivale
La versione di produzione viene fornita come Qwen3.8-Flash tramite QwenCloud, al prezzo di 0,16 dollari per milione di token di input e 0,47 dollari per milione di token di output. Ciò è inferiore anche al GLM-5.3-Flash di Z.ai, rilasciato lo stesso giorno rispettivamente a $ 0,15 e $ 0,50: di fatto la parità nella parte inferiore del mercato.
Il divario rispetto al fiore all’occhiello di Alibaba è netto. Qwen3.8-Max, introdotto all'inizio di agosto per competere con Claude Opus 4.8, Gemini 3.1 Pro e GPT-5.6 Sol, costa $ 2,00 per milione di token di input e $ 6,00 per milione di token di output. Secondo i dati di Alibaba, Flash-Next si colloca appena al di sotto dell'ammiraglia, a circa un dodicesimo del prezzo sia in input che in output.
Il lungo contesto aggiunge valore pratico oltre la scheda tecnica. Con 262.144 token nativi, una singola richiesta può contenere diversi repository di codici di grandi dimensioni, un set completo di contratti o ore di riunioni trascritte; estesa a un milione di token con YaRN, l'analisi dell'intero corpus diventa fattibile senza impalcature di recupero. Per i carichi di lavoro di codifica ad agenti in cui Flash-Next registra i suoi punteggi migliori, individuando e correggendo autonomamente bug in progetti software reali, una finestra ampia significa meno errori di gestione del contesto durante l'attività. Il team Qwen ha anche pubblicato il rapporto tecnico su GitHub, invitando esattamente al tipo di controllo indipendente dell'architettura che i laboratori proprietari evitano.
Perché questa versione è importante
Qwen3.8-Flash-Next è meglio inteso come una prova generale pubblica per Qwen4. Lo strato di incorporamento di N-grammi, il rapporto aggressivo dei parametri attivi e lo scarico della RAM di parametri ingombranti ma raramente necessari delineano una filosofia di progettazione: spostare l'intelligenza per dollaro, non intelligenza per GPU. Addestrare un modello che batte Qwen3.7-Plus per un nono del costo è proprio la capacità che rende accessibili cicli di iterazione rapidi - e la velocità di iterazione, più di ogni singolo benchmark, è ciò che decide chi sarà alla frontiera tra un anno.
Anche l’arrivo nello stesso giorno di due modelli a peso aperto adiacenti alla frontiera da laboratori cinesi – GLM-5.3-Flash di Z.ai e Flash-Next di Alibaba – segna un cambiamento di cadenza, come osservato da FourWeekMBA. I laboratori occidentali detengono ancora picchi di riferimento, ma il livello open-weight ora spedisce settimanalmente qualità quasi frontiera, a prezzi di un ordine di grandezza inferiori.
Per gli sviluppatori, la conclusione pratica è semplice: il costo di un modello multimodale capace, a lungo contesto è appena diminuito di nuovo, con pesi scaricabili come assicurazione contro ogni singolo fornitore. Per i concorrenti, il messaggio è meno confortante: la frontiera dell’efficienza si sta ora muovendo più velocemente di quanto i prezzi di punta possano realisticamente seguire, e Alibaba non ha mostrato alcun segno di rallentamento.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →