Cerebras e OpenAI hanno dato al mondo un'anteprima della Ultrafast Mode, un nuovo livello di servizio che viene lanciato per primo nell'API OpenAI ed è basato sull'hardware Cerebras. Secondo l'annuncio di Cerebras pubblicato il 13 agosto 2026, GPT-5.6 Sol in esecuzione su Ultrafast offre fino a 750 token di output al secondo, senza compromessi in termini di qualità.
Il livello è inizialmente disponibile per un gruppo selezionato di clienti, con accesso in espansione nel tempo. L'annuncio, scritto da Joyce Er di Cerebras, posiziona l'offerta come una soluzione a un compromesso che ha definito per anni lo sviluppo di prodotti IA: i costruttori dovevano scegliere tra velocità e intelligenza, perché modelli più grandi e più intelligenti comportano costi di calcolo e di movimento dei dati più elevati che rallentano i tempi di risposta. I lettori che seguono la corsa per accelerare i modelli di frontiera possono seguire gli ultimi sviluppi su AI Buzz Wire.
Quanto è veloce l'ultraveloce, esattamente?
Il numero grezzo di throughput è sorprendente di per sé, ma Cerebras ha anche fornito un contesto comparativo. Secondo le velocità di output riportate da Artificial Analysis, un servizio di benchmarking indipendente, GPT-5.6 Sol in modalità Ultraveloce funziona:
- 11 volte più veloce di Fable 5
- 5 volte più veloce di Opus 4.8 in modalità Veloce
Per mettere alla prova l'affermazione, Cerebras ha testato il modello confrontandolo con concorrenti famosi nell'Humanity's Last Exam (HLE), un benchmark impegnativo composto da 2.500 domande a cui in genere possono rispondere solo persone in possesso di dottorati di ricerca in campi come chimica, economia e letteratura.
Il risultato: GPT-5.6 Sol su Ultrafast ha risposto a tutte le 2.500 domande HLE in 11 ore e 11 minuti. Claude Fable 5 ha impiegato 78 ore e 27 minuti (più di tre giorni di calcolo continuo) per arrivare alle stesse conclusioni. In altre parole, Ultrafast ha attraversato la frontiera della conoscenza umana in un solo giorno lavorativo, raggiungendo una precisione paragonabile quasi 7 volte più velocemente.
Cerebras ha sottolineato la sua metodologia di benchmarking: GPT-5.6 Sol Ultrafast è stato testato con Codex sul ragionamento xhigh il 10 luglio, mentre Claude Fable 5 è stato testato con Claude Code sul ragionamento xhigh dal 13 al 15 luglio.
Carichi di lavoro reali, non solo benchmark
I benchmark di velocità possono essere fuorvianti se la qualità peggiora lungo il percorso, motivo per cui Cerebras ha anche evidenziato i risultati su GDP-Val, un benchmark per compiti di lavoro basato sulla conoscenza economicamente preziosi. Su GDP-Val, Ultrafast ha fornito un aumento di velocità end-to-end di 5,6 volte senza alcun degrado della qualità, secondo i test eseguiti da Cerebras il 31 luglio 2026 utilizzando GPT-5.6 Sol e GPT-5.6 Sol Ultrafast con ragionamento medio all'interno del Codex.
L'azienda afferma che GPT-5.6 Sol è il miglior modello di OpenAI finora per documenti legali, modelli finanziari e rapporti tecnici, ambiti in cui la qualità dell'output e i tempi di consegna comportano entrambi conseguenze finanziarie dirette.
Perché la velocità cambia l'equazione dell'agente
Il cambiamento più significativo potrebbe riguardare il modo in cui operano gli agenti IA. Un’inferenza più rapida cambia ciò che è possibile per individui e organizzazioni, perché gli agenti possono essere collocati sul percorso critico dei problemi dove ogni secondo conta.
"Con GPT-5.6 Sol Ultrafast, Cerebras consente un'intelligenza artificiale che sta al passo con il modo in cui pensi, codifichi e collabori", ha affermato Rohan Varma, Product presso OpenAI, in una dichiarazione citata nell'annuncio. "Siamo entusiasti di vedere come i flussi di lavoro e le applicazioni verranno trasformati dall'inferenza ultraveloce."
Cerebras ha delineato diversi scenari ad alto rischio in cui l'accelerazione è importante:
Risposta all'incidente
Le aziende che gestiscono servizi Web possono utilizzare Ultrafast per individuare e risolvere le interruzioni della produzione, preservando la fiducia dei clienti, prevenendo perdite di entrate e risparmiando minuti di inattività rispetto agli SLA.Sicurezza informatica
Negli attacchi informatici contraddittori e ad alto rischio, i team di sicurezza devono rilevare e rispondere rapidamente ai malintenzionati per contenere perdite catastrofiche, un compito in cui la latenza di inferenza influisce direttamente sul controllo dei danni.Produttività dell'agente
Ultrafast consente nuove modalità di lavoro con gli agenti fornendo approfondimenti e aggiornamenti in tempo reale, riducendo la necessità di cambiare contesto tra sessioni parallele."Mentre prima dovevo aspettare un paio di minuti prima che un compito finisse, ora finisce per me prima ancora di avere l'opportunità di cambiare contesto. Mi rende molto più produttivo", ha detto Jeffrey Wang, ricercatore di OpenAI, nell'annuncio.
La strategia alla base del partenariato
For Cerebras, the deal represents another milestone in its effort to commercialize wafer-scale acceleration for AI inference. Per OpenAI, la modalità Ultrafast aggiunge un livello di velocità premium alla sua API in un momento in cui la latenza di inferenza è diventata un elemento di differenziazione competitiva, in particolare per le applicazioni agentiche che concatenano insieme molte chiamate di modello, dove i ritardi per chiamata si trasformano in minuti di attesa.
Le aziende inquadrano il livello come un vantaggio persistente per le organizzazioni che utilizzano l’intelligenza artificiale di frontiera per rispondere rapidamente alle informazioni in arrivo, abbinando l’elaborazione ultraveloce per lavori urgenti con l’elaborazione standard per attività relative alle materie prime che possono essere parallelizzate in background.
L'accesso verrà implementato gradualmente. Gli sviluppatori interessati possono monitorare la disponibilità della documentazione dell'API OpenAI, poiché Cerebras afferma che l'accesso si espanderà nel tempo dal gruppo selezionato iniziale di clienti.
Stai al passo con l'intelligenza artificiale
Per una maggiore copertura sulla corsa all'hardware e alle infrastrutture per rimodellare l'intelligenza artificiale, aggiungi AI Buzz Wire ai preferiti e segui il nostro feed Notizie sull'hardware AI.
Leggi altre notizie sull'AI →