OpenAI ha abbassato i prezzi API su due dei suoi tre modelli GPT-5.6 il 30 luglio 2026, tagliando il livello più economico dell'80% appena tre settimane dopo che la famiglia aveva raggiunto la disponibilità generale. La mossa segnala quanto aggressivamente il principale produttore di modelli stia competendo per carichi di lavoro ad alto volume e sensibili ai costi – e quanto attentamente i suoi clienti stiano ora contando ogni token. Per ulteriori informazioni sul cambiamento più ampio nell'economia dell'IA, segui i nostri ultimi sviluppi dell'IA.

Cosa è cambiato

Secondo il tariffario pubblicato da OpenAI e il registro delle modifiche API, i prezzi standard per milione di token ora recitano:

  • GPT-5.6 Luna: 20 centesimi in ingresso e $ 1,20 in uscita, in calo rispetto a $ 1 e $ 6: una riduzione dell'80%
  • GPT-5.6 Terra: $ 2 e $ 12, in calo rispetto a $ 2,50 e $ 15: un taglio del 20%
  • GPT-5.6 Sol (l'ammiraglia): $5 e $30, invariati

Tutti e tre i livelli sono stati lanciati in disponibilità generale il 9 luglio 2026 a tariffe più elevate, collocando il repricing a soli 21 giorni dall'inizio della vita commerciale della famiglia. Sia Reuters che CNBC hanno confermato i tagli, e Axios ha riferito che la riduzione più marcata è avvenuta sul modello Luna.

I tagli attraversano ogni livello di servizio

Le riduzioni non si limitano ai prezzi principali. Scorrono attraverso ogni opzione sul tariffario:

  • L'elaborazione Batch e Flex, entrambe alla metà del prezzo standard, collocano Luna a 10 centesimi in input e 60 centesimi in output per milione di token.
  • Letture input memorizzate nella cache, scontate del 90%, scendono a due centesimi per milione di token su Luna e a 20 centesimi su Terra.
  • Le richieste a contesto lungo, fatturate al doppio della tariffa di input e 1,5 volte quella di output, arrivano a 40 centesimi e $ 1,80 per Luna.

Per i team che già instradano la classificazione in blocco, l’estrazione o i lunghi loop degli agenti attraverso i livelli più economici, le stesse chiamate ora costano una frazione di quanto costavano il giorno prima.

Come i tagli si confrontano con Anthropic

A 20 centesimi in entrata e 1,20 dollari in uscita, Luna ora riduce il modello pubblicato più economico di Anthropic, Haiku 4.5, di circa cinque volte in input e quattro volte in output, secondo la pagina dei prezzi di Anthropic. La nuova tariffa di Terra è inferiore ai $ 3 e $ 15 che Claude Sonnet 5 dovrebbe addebitare una volta scaduto il suo prezzo di lancio il 31 agosto 2026.

Al vertice di entrambe le formazioni, Sol costa ancora di più in uscita rispetto a Opus 5 di Anthropic, che ha un prezzo di $ 5 e $ 25.

L'elaborazione prioritaria diventa la modalità Veloce

La stessa voce del log delle modifiche ha ritirato "Elaborazione prioritaria" e l'ha sostituita con "Modalità veloce". Per il modello di punta Sol, OpenAI afferma che la modalità Veloce funziona fino a 2,5 volte la velocità standard al doppio del prezzo e lo switch è compatibile con le versioni precedenti: richieste già contrassegnate per il percorso prioritario alla modalità Veloce senza modifica del codice.

Le tariffe in modalità veloce sono $ 10 e $ 60 per Sol, $ 4 e $ 24 per Terra e 40 centesimi e $ 2,40 per Luna. In particolare, Anthropic vende lo stesso prodotto con lo stesso nome e gli stessi termini, e i due tariffari ora convergono anche sull'inferenza geografica: OpenAI addebita un aumento del 10% sui modelli rilasciati a partire dal 5 marzo 2026 quando un cliente richiede la residenza dei dati, mentre Anthropic fattura l'inferenza solo negli Stati Uniti a 1,1 volte la sua tariffa standard.

Perché i livelli più economici sono diventati più economici

Un giorno prima del taglio, OpenAI ha pubblicato un post tecnico che descrive le ottimizzazioni nel suo stack di inferenza. Cinque membri dello staff tecnico dell'azienda hanno scritto che Sol, eseguendo il suo strumento di codifica Codex, ha riscritto i kernel GPU di produzione: il lavoro secondo OpenAI ha ridotto i costi di servizio end-to-end del 20%. Il modello ha anche ridisegnato la propria bozza di decodifica speculativa attraverso centinaia di esperimenti, un cambiamento a cui è stato attribuito il merito di aver aumentato l’efficienza di generazione dei token di oltre il 15%.

Queste sono le cifre di OpenAI per il proprio stack, ma puntano allo stesso centro di costo a cui si rivolge la riduzione dei prezzi: il cablaggio dell'agente dietro Codex e ChatGPT. OpenAI limita l'output dello strumento a 10.000 token per impostazione predefinita e mantiene la cronologia visibile del modello solo in aggiunta, quindi un ciclo dell'agente che invia nuovamente le sue istruzioni a ogni passaggio raggiunge la cache dei prompt invece di pagare le tariffe di input complete. L'azienda ha chiuso il post con l'impegno a trasmettere "miglioramenti nascosti ai nostri utenti sotto forma di informazioni più ampiamente disponibili ed economicamente vantaggiose". Il tariffario è seguito il giorno dopo.

Partner cloud e fatturazione

OpenAI ha notato che gli acquirenti che instradano il traffico attraverso Amazon Bedrock vengono fatturati da AWS e tali tariffe possono differire dalla propria carta pubblicata. Poiché sempre più aziende centralizzano l’accesso ai modelli attraverso un unico fornitore cloud, il divario tra i prezzi diretti di OpenAI e ciò che i clienti effettivamente pagano tramite gli intermediari sarà importante tanto quanto i numeri stessi.

Un mercato che conta ogni token

I tagli si verificano poiché gli acquirenti aziendali controllano le spese in modo più accurato che mai. All'inizio della settimana, alcuni report avevano documentato come l'era del "tokenmaxxing" sfrenato (spingere il volume senza tenere conto dei costi) stia svanendo mentre le fatture aziendali legate all'intelligenza artificiale aumentano sulle principali piattaforme. La decisione di OpenAI di trasferire i risparmi sui costi interni ai clienti, piuttosto che incassare il margine, è un chiaro segnale di dove ritiene che si stia combattendo la battaglia competitiva: non alla frontiera, dove Sol comanda ancora prezzi premium, ma sui livelli economici e ad alto volume in cui risiede effettivamente la maggior parte del traffico di produzione.

Con il prezzo di Sol invariato, la decisione dal vivo per gli sviluppatori rimane esattamente dove OpenAI l'ha messa da quando la famiglia è stata spedita: quale livello richiede ciascuna richiesta. La differenza è che il costo di una decisione sbagliata è semplicemente diminuito drasticamente.

---

Stai al passo con l'intelligenza artificiale

Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →