Un progetto open source poco conosciuto chiamato Strata sta vivendo un momento di grande successo. Il motore con licenza MIT, che esegue Qwen3.8-Flash-Next di Alibaba - un modello di mix di esperti da 125 miliardi di parametri - su normali PC da gioco, è arrivato sulla prima pagina di Hacker News il 4 ottobre con più di 640 punti, e il suo repository GitHub ha raccolto oltre 11.000 stelle da quando è stato creato il 24 settembre.
Il concetto è semplice: un modello da 125 miliardi di parametri che normalmente risiede su un server può chattare, scrivere codice, leggere immagini e gestire agenti di codifica interamente su una scheda grafica consumer, senza che nulla esca dalla macchina.
Cosa fa realmente Strata
Strata è sia un motore di inferenza che un programma di installazione con un clic per Windows e Linux. Secondo la documentazione, i requisiti sono modesti per gli standard dei modelli di frontiera: una GPU con almeno 12 GB di VRAM delle serie RTX 20, 30, 40 o 50 di NVIDIA o delle serie Radeon RX 6000, 7000 o 9000 di AMD, almeno 32 GB di RAM di sistema e circa 80 GB di spazio libero su SSD.
Il motore fornisce versioni quantizzate di Qwen3.8-Flash-Next a diversi livelli di compressione, da Q2_0 fino a IQ3_S, oltre a una variante specializzata in codice. Espone API compatibili con OpenAI e Anthropic su localhost, il che significa che gli strumenti creati per ChatGPT o Claude, inclusi agenti di codifica come Claude Code, Cursor e Codex, possono essere indirizzati al server locale con modifiche minime. Sono inclusi input di immagini opzionali e supporto multi-GPU e il programma di installazione offre anche una modalità di configurazione assistita da intelligenza artificiale che consente a un assistente di codifica di configurare la macchina da un singolo prompt incollato.
I numeri della velocità
I benchmark pubblicati dal progetto, misurati su due desktop consumer, sono la ragione della diffusione del rilascio. Su una NVIDIA RTX 5070 con 12 GB di VRAM abbinata a un Ryzen 5 7600 e 64 GB di RAM, Strata riporta:
- Quantizzazione Q2_0: 94 token al secondo per la generazione e 2.650 token al secondo per l'elaborazione rapida su un documento da 32.000 token
- IQ3_S: 53 token alla seconda generazione, 1.620 token al secondo in fase di elaborazione
- Variante del codificatore: 55 token per seconda generazione
Dal lato AMD, un RX 9070 XT con 16 GB di VRAM ha gestito 60 token al secondo a Q2_0. La documentazione stima che una RTX 3090 con 24 GB di VRAM dovrebbe raggiungere da 100 a 140 token al secondo, più velocemente di quanto la maggior parte delle persone riesca a leggere.
Per fare un confronto, sei mesi fa, eseguire localmente anche un modello denso di 70 miliardi di parametri a velocità utilizzabili richiedeva una workstation con centinaia di gigabyte di memoria unificata o aggressivi trucchi di decodifica speculativa.
Perché un modello 125B si adatta a una scheda da gioco
Due tecnologie lo rendono possibile. Il primo è il modello stesso. Come AI Buzz Wire ha spiegato al suo rilascio, Qwen3.8-Flash-Next è un'architettura mista di esperti con circa 125 miliardi di parametri totali ma solo circa 6 miliardi attivi per token, quindi ogni parola generata tocca una piccola fetta della rete, riducendo drasticamente il calcolo per token.
Il secondo è la quantizzazione. Le preimpostazioni più veloci di Strata comprimono i pesi del modello a due o tre bit per parametro, sacrificando una certa precisione per un ingombro che si adatta a una GPU da 12 GB e RAM di sistema. Questo compromesso è l’avvertimento principale: i parametri di classe Q2 e IQ2 degradano in modo misurabile la qualità dei compiti pesanti di ragionamento e gli acquirenti dovrebbero considerare i numeri di velocità principali come un punto di partenza piuttosto che una garanzia per ogni carico di lavoro. Le pagine di benchmark della community nel repository tengono traccia dei risultati di qualità in tutte le dimensioni.
Parte di un'ondata di IA locale più ampia
Strata arriva nel mezzo di uno slancio crescente per l’inferenza locale. La famiglia Qwen di Alibaba è diventata la linea di modelli open-weight più scaricata, Meta e Google hanno propri modelli competitivi open source e un'ondata di strumenti ora consente ai consumatori di gestire assistenti capaci senza abbonamenti o dati che lasciano i loro dispositivi.
Il progetto riflette anche il modo in cui sta cambiando la definizione di "hardware di consumo". Una scheda grafica di fascia media del 2026 con 12 GB di VRAM, fornita principalmente per i giochi, è ora un valido acceleratore di inferenza per un modello nella classe di dimensioni che ha definito i sistemi di frontiera solo due anni fa.
Strata rimane uno dei primi software (il tracker dei problemi del repository documenta i bordi irregolari delle GPU più vecchie e dei processori non AVX2) ma il progetto è concesso in licenza dal MIT, è gratuito e sviluppato all'aperto, con supporto sperimentale per Intel Arc, vecchie schede Tesla e Radeon e piattaforme multi-GPU documentate dai membri della comunità.
Per gli sviluppatori, l'aspetto più pratico potrebbe essere la compatibilità dell'API localhost: qualsiasi script o agente scritto contro OpenAI o Anthropic SDK può essere reindirizzato a una distribuzione Qwen locale modificando un URL di base, rendendo Strata un'opzione a basso attrito per la prototipazione sensibile alla privacy, l'uso offline o semplicemente limitando la spesa API.
Come provarlo
Per iniziare non è necessaria una sessione terminale con un manuale. Il programma di installazione fornisce driver, pesi del modello e server locale in un unico passaggio, e il repository include un file di installazione progettato per essere incollato direttamente in un assistente di codifica AI, che quindi configura la macchina in modo autonomo. I primi lanci sono più lenti mentre i pesi vengono caricati da disco; la documentazione consiglia un SSD e avverte che le conversazioni lunghe spostano più lavoro sulla RAM di sistema.
Stai al passo con l'intelligenza artificialeSegui AI Buzz Wire per le ultime novità su modelli open source, strumenti di intelligenza artificiale locale e hardware di inferenza.
Leggi altre notizie sull'AI →