Cerebras ha aggiunto Qwen 3.8 27B agli endpoint pubblici della sua piattaforma Cerebras Inference, dove il modello a pesi aperti funziona a circa 1.500 token al secondo, secondo la documentazione del catalogo dei modelli dell'azienda. L'elenco rende disponibile una delle famiglie di modelli aperti più utilizzate di Alibaba a velocità che fanno impallidire la tipica distribuzione ospitata su GPU.
L'annuncio ha attirato immediatamente l'attenzione degli sviluppatori: la storia ha raccolto più di 600 punti su Hacker News in un giorno, un livello di popolarità che riflette quanto sia diventata forte la domanda di inferenza veloce ed economica. Per una visione più ampia del mercato dell'inferenza, il desk ultime notizie sull'intelligenza artificiale segue ogni importante aggiornamento della piattaforma non appena arriva.
Le specifiche sul catalogo
Secondo la documentazione di Cerebras, Qwen 3.8 27B trasporta 27 miliardi di parametri e supporta 64.000 token di contesto nel livello gratuito e 128.000 nei livelli a pagamento, funzionando a circa 1.500 token al secondo. Si affianca al modello GPT-OSS 120B a peso aperto di OpenAI, che lo stesso catalogo elenca circa 3.000 token al secondo con un contesto di 65.000 nel livello gratuito e 131.000 nei livelli a pagamento.
Entrambi i modelli sono disponibili nei livelli di prova gratuita e a consumo di Cerebras, soggetti a limiti tariffari. I clienti che necessitano di capacità riservata, throughput più elevato o SLA di produzione vengono indirizzati all'offerta Dedicated Endpoints dell'azienda, che la documentazione elenca anche come percorso verso famiglie di modelli aggiuntivi oltre alle due sugli endpoint pubblici.
Le finestre di contesto meritano attenzione insieme ai dati sulla velocità. Sessantaquattromila token nel livello gratuito – e 128.000 in quello a pagamento – sono sufficienti per contenere contemporaneamente basi di codici di grandi dimensioni, documenti lunghi o trascrizioni di agenti estesi in memoria, il che è importante per i carichi di lavoro esatti in cui la decodifica rapida ripaga. La documentazione di Cerebras include anche una guida alla compatibilità OpenAI, riducendo i costi di passaggio per i team il cui codice esistente è già destinato all'SDK OpenAI: in linea di principio, puntare un client esistente verso un endpoint Cerebras è una modifica della configurazione piuttosto che una riscrittura.
Modelli non potati, compressione trasparente
Un dettaglio degno di nota nella documentazione è la divulgazione da parte di Cerebras di come gestisce la compressione del modello. L'azienda afferma che tutti i modelli sui suoi endpoint pubblici sono versioni originali, non potate e che utilizza la quantizzazione selettiva del solo peso solo durante l'archiviazione per preservare la qualità. Gli strati sensibili rimangono alla massima precisione, le attivazioni, l'attenzione e la cache KV rimangono non quantizzati e la dequantizzazione avviene al volo.
Cerebras divulga anche la sua ricerca sulle tecniche di potatura come REAP (Router-weighted Expert Activation Pruning): le varianti potate sono condivise con la comunità di ricerca su Hugging Face ma non sono servite tramite l'API pubblica. Per gli sviluppatori che scelgono dove eseguire modelli aperti, la trasparenza su ciò che esattamente viene servito è insolitamente esplicita.
Perché la velocità dei token è importante
Numeri di throughput come questi sono importanti soprattutto per i carichi di lavoro con agenti e codifica. Le applicazioni che concatenano centinaia di chiamate modello (agenti di codifica, flussi di lavoro autonomi, assistenti in tempo reale) moltiplicano la latenza per token in ogni passaggio, quindi la differenza tra 50 e 1.500 token al secondo si traduce in un'esperienza qualitativamente diversa. Le applicazioni interattive che trasmettono in streaming i completamenti lunghi ne traggono i vantaggi più visibili.
Il compromesso è la portata. Un modello da 27 miliardi di parametri non corrisponderà ai sistemi di frontiera nei compiti di ragionamento più difficili, e i documenti di Cerebras indirizzano i pesanti carichi di lavoro di produzione verso capacità dedicate. Ma per l’ampia via di mezzo delle attività in cui i modelli aperti di medie dimensioni sono già abbastanza buoni – riepilogo, classificazione, utilizzo di strumenti, modifica del codice – la velocità diventa l’elemento di differenziazione.
C'è anche una dimensione del prezzo su cui gli sviluppatori peseranno. I modelli di endpoint pubblici sono utilizzabili in una prova gratuita prima di qualsiasi impegno, il che rende il benchmarking rispetto al carico di lavoro di un team essenzialmente privo di attriti: una rampa di accesso deliberata che contrasta con i contratti aziendali che richiedono conversazioni di vendita prima che venga servito il primo token. I limiti di velocità documentati sono il vincolo da tenere d'occhio: l'accesso a livello gratuito esiste per dimostrare la velocità, non per eseguire il traffico di produzione.
Un tratto impegnativo per i modelli aperti
L'aggiunta atterra durante un tratto affollato per l'IA a pesi aperti. Il laboratorio IFM con sede negli Emirati Arabi Uniti ha appena presentato K2 Horizon, una flotta connessa di sei modelli completamente aperti, e Meta continua a iterare la sua famiglia Muse per la codifica e l'uso con agenti. Nel frattempo, gli ecosistemi a modello aperto in Cina continuano a spedire a un ritmo che ha compresso i cicli di rilascio in tutto il settore.
Per gli sviluppatori, il punto pratico è che lo stack del modello aperto sta maturando su due fronti contemporaneamente: capacità, poiché i modelli di medie dimensioni colmano le lacune con le ammiraglie nelle attività quotidiane, e al servizio dell’economia, poiché i fornitori di inferenza specializzati competono sulla pura velocità. Qwen 3.8 27B su Cerebras è un punto di riferimento per entrambe le tendenze: un modello aperto di generazione attuale servito a velocità che erano esotiche un anno fa, su hardware appositamente costruito per il lavoro.
Gli sviluppatori che valutano la piattaforma dovrebbero confrontare i propri carichi di lavoro: le velocità pubblicate sono cifre di catalogo, il throughput reale dipende dalla durata dei prompt, dalla concorrenza e dalla configurazione e i limiti di velocità del livello gratuito saranno vincolanti prima della sua velocità.
Stai al passo con l'intelligenza artificiale
Ogni rilascio di modello, aggiornamento della piattaforma di inferenza e lancio di strumenti per sviluppatori, viene monitorato mentre avviene - leggi altre notizie sull'intelligenza artificiale →
