Cerebras Systems e OpenAI hanno condiviso un primo sguardo alla modalità Ultrafast, un nuovo livello di servizio lanciato per primo nell'API OpenAI e basato sulla tecnologia su scala wafer di Cerebras. La partnership consente a GPT-5.6 Sol di funzionare fino a 750 token di output al secondo, fornendo intelligence a livello di frontiera a velocità in tempo reale. Per le ultime novità sull'hardware AI, visita AI Buzz Wire.
Eliminazione del compromesso velocità-intelligenza
I costruttori di intelligenza artificiale si trovano da tempo ad affrontare un compromesso fondamentale: man mano che i modelli crescono in termini di dimensioni e intelligenza, comportano costi di calcolo e di spostamento dei dati più elevati, rallentando i tempi di risposta. Gli sviluppatori sono stati costretti a scegliere tra attendere risultati di alta qualità o accettare risultati inferiori in meno tempo.
GPT-5.6 Sol in modalità Ultraveloce è progettato per risolvere questo dilemma. Secondo Cerebras, il servizio funziona 11 volte più velocemente di Claude Fable di Anthropic e 5 volte più velocemente di Opus 4.8 in modalità Veloce, in base alle velocità di output riportate da Artificial Analysis.
L'ultimo esame dell'umanità: la prova di velocità
Cerebras ha messo alla prova Ultrafast rispetto ai modelli concorrenti nell'Humanity's Last Exam (HLE), un benchmark impegnativo composto da 2.500 domande a cui in genere può rispondere solo chi ha un dottorato di ricerca in campi come chimica, economia e letteratura.
Nelle valutazioni condotte da Cerebras, GPT-5.6 Sol in modalità ultraveloce ha risposto a tutte le 2.500 domande HLE in 11 ore e 11 minuti. Claude Fable 5 ha richiesto 78 ore e 27 minuti, più di tre giorni di calcolo continuo, per arrivare alle stesse conclusioni. In altre parole, Ultrafast ha elaborato la frontiera della conoscenza umana in un solo giorno lavorativo, raggiungendo una precisione paragonabile quasi sette volte più velocemente.
Il benchmarking è stato eseguito da Cerebras utilizzando GPT-5.6 Sol Ultrafast con Codex su impostazioni di ragionamento elevate il 10 luglio e Claude Fable 5 con Claude Code su impostazioni di ragionamento elevate dal 13 al 15 luglio.
Impatto aziendale nel mondo reale
Su GDP-Val, un punto di riferimento per attività di lavoro basato sulla conoscenza di valore economico, Ultrafast ha fornito un'accelerazione end-to-end di 5,6 volte senza alcun degrado della qualità. Ciò dimostra come un'inferenza più rapida possa accelerare un lavoro economicamente prezioso senza sacrificare la qualità dell'output.
Cerebras immagina Ultrafast come uno strumento per scenari in cui ogni secondo conta. Le aziende che gestiscono servizi web potrebbero utilizzare la tecnologia per individuare le cause e affrontare le interruzioni della produzione più rapidamente, preservando la fiducia dei clienti e prevenendo perdite di entrate. In situazioni di sicurezza informatica ad alto rischio, i team di sicurezza potrebbero sfruttare Ultrafast per rilevare e rispondere rapidamente agli attacchi.
La tecnologia dietro la velocità
Il vantaggio in termini di prestazioni deriva dall'architettura Wafer-Scale Engine di Cerebras, creata appositamente per i carichi di lavoro AI di frontiera. La sfida principale dell’inferenza di frontiera veloce è un problema di spostamento dei dati: sulle GPU tradizionali, l’inferenza su modelli di grandi dimensioni è ostacolata dalla larghezza di banda della memoria, poiché i pesi dei modelli devono essere trasferiti ripetutamente tra la memoria su chip e l’archiviazione off-chip per generare token successivi.
Cerebras adotta un approccio fondamentalmente diverso. Ogni chip delle dimensioni di un wafer racchiude 44 GB di SRAM direttamente sul silicio. I pesi dei modelli rimangono sul chip e i token fluiscono ininterrottamente attraverso gli strati del modello convogliati sui wafer. Ciò elimina lo spostamento inefficiente dei dati che rallenta l'inferenza basata su GPU e si adatta facilmente alle dimensioni del modello, aprendo la strada a un vantaggio continuo in termini di velocità sui futuri modelli di frontiera.
Disponibilità e posizionamento sul mercato
GPT-5.6 Sol in modalità Ultraveloce è attualmente disponibile in anteprima limitata per un gruppo selezionato di clienti, con accesso che si espande nel tempo man mano che la capacità aumenta. Cerebras descrive la partnership come un modo per alimentare la prossima ondata di innovazione dell’intelligenza artificiale e per aumentare il limite di ciò che le organizzazioni possono realizzare con un’intelligenza artificiale reattiva.
La collaborazione rappresenta una pietra miliare significativa per Cerebras, che da tempo persegue l’elaborazione su scala wafer come alternativa al mercato dell’hardware AI dominato dalle GPU. Collaborando direttamente con OpenAI per accelerare uno dei modelli di frontiera più capaci disponibili, Cerebras sta dimostrando con forza che la sua architettura offre un reale vantaggio competitivo per i carichi di lavoro di inferenza ad alta velocità.
Poiché i modelli continuano a diventare sempre più grandi e intelligenti, la capacità di servirli a velocità in tempo reale potrebbe diventare un fattore competitivo determinante nel mercato delle infrastrutture IA. La partnership Cerebras-OpenAI segnala che la corsa per la velocità di inferenza è ora importante quanto la corsa per l’intelligenza dei modelli.
Stai al passo con l'intelligenza artificiale
Per ulteriori notizie sull'hardware AI, analisi delle prestazioni dei modelli e sviluppi del settore, aggiungi ai segnalibri AI Buzz Wire.
Leggi altre notizie sull'AI →