OpenAI ha corretto tre difetti che, a quanto pare, spiegano una settimana di lamentele degli utenti secondo cui GPT-6 Astra, il suo ultimo modello di frontiera, era diventato più stupido dal lancio - e sta reimpostando i limiti di utilizzo per gli abbonati al Codex come una sorta di scusa. L'aggiornamento è arrivato dal responsabile del prodotto Codex Tibo Sottiaux, che ha affermato che il team ha lavorato con gli utenti per rintracciare i guasti, quindi ha inviato le correzioni e un ripristino completo dell'utilizzo prima di mezzanotte ora locale, secondo un aggiornamento pubblicato sabato.

L'ammissione chiude un periodo difficile per quello che OpenAI ha definito il suo modello più capace fino ad oggi. Da quando Astra ha raggiunto un'ampia disponibilità all'inizio di settembre, gli sviluppatori di X hanno eseguito istruzioni identiche rispetto ad Astra il giorno del lancio e alla versione attuale, mantenendo tutte le impostazioni uguali e pubblicando confronti affiancati che sembravano mostrare un modello silenziosamente indebolito. Per ulteriori informazioni sui modelli alla base di questo dibattito, consulta la nostra copertura sugli ultimi sviluppi dell'intelligenza artificiale.

I tre difetti, per nome

Secondo Sottiaux, il primo colpevole erano le abilità: file di prompt scritti per modelli precedenti che si attivavano troppo spesso sotto Astra, a volte impedendo al modello di controllare il proprio lavoro. Il secondo era un esperimento facoltativo di gestione del contesto che poteva far chiudere anticipatamente il modello o rispondere a messaggi obsoleti. OpenAI ha disabilitato l'esperimento dopo che sono stati colpiti circa 4.000-5.000 utenti, ha affermato la società.

Il terzo difetto riguardava l’infrastruttura piuttosto che il modello stesso: alcuni motori di inferenza erano stati configurati in modo errato e la qualità del traffico in coda instradato attraverso di essi era sensibilmente degradata. OpenAI ha rimosso quei motori e ha effettuato diverse piccole riparazioni. Sottiaux ha scritto che il modello ora tiene traccia dell'ultimo messaggio di un utente in modo più accurato, un cenno alle lamentele secondo cui Astra aveva risposto a domande che l'utente aveva già superato.

Gli sviluppatori erano già andati avanti

Le denunce si sono accumulate nel corso della settimana. Lo sviluppatore Pranjal Paliwal, che giorni prima aveva elogiato Astra, è tornato indietro e ha letto il codice che aveva scritto per lui, quindi ha definito il risultato una regressione piuttosto che un progresso. Dax Raad, che costruisce lo strumento di codifica Opencode, ha riportato il suo team al vecchio GPT-5.6 Sol dopo aver raddoppiato la spesa per Astra per gli aspetti negativi che riteneva non valessero la pena. Un utente del forum ha descritto Astra come ora allo stesso livello di Sol su compiti identici, con gli stessi tentativi.

Non tutti accettarono quella lettura. Un utente pseudonimo che scrive come Antikythera ha sostenuto che il modello è sempre stato pigro e appassionato di elenchi puntati e che gli utenti avevano semplicemente smesso di essere abbagliati. Questo disaccordo evidenzia quanto sia difficile risolvere le rivendicazioni sulla qualità del modello: suggerimenti identici, verdetti diversi.

Problemi di capacità in background

La questione della qualità si è concretizzata, mentre la capacità ha ostacolato il lancio. OpenAI ha tagliato i limiti di utilizzo di Astra per gli utenti abituali di ChatGPT in base ai rapporti degli utenti e ha sospeso i nuovi abbonamenti Pro da $ 200: un passo confermato da Sottiaux il 10 settembre, citando la domanda. Il modello costa ancora 10 dollari per milione di token di input e 50 dollari per milione di token di output, ovvero 2,5 volte quello che Sol ha addebitato al momento del lancio.

C'è anche un precedente scomodo: questo è il secondo flagship di OpenAI in due mesi a ricevere la stessa accusa da parte di utenti paganti. A luglio, gli utenti hanno affermato che la modalità di ragionamento principale di Sol era diventata superficiale da un giorno all'altro. Sottiaux ha negato di averlo indebolito deliberatamente in quel momento, pur confermando che la società stava sperimentando uno sforzo di ragionamento. Cicli ripetuti di “il modello è peggiorato” seguiti da “abbiamo riscontrato dei difetti” stanno diventando un modello che l’azienda dovrà gestire: la trasparenza aiuta, ma lo stesso vale per la stabilità.

Il consiglio di OpenAI: utilizzare meno guardrail

Oltre alle correzioni, OpenAI ha pubblicato una guida alla migrazione dell’ingegnere Eric Provencher che equivale a una raccomandazione controintuitiva: i modelli più capaci necessitano di meno manovre. Descrizioni delle competenze troppo lunghe, requisiti di lettura generali e rigide regole di approvazione possono ostacolare Astra, afferma la guida. Le istruzioni che si sono accumulate nel tempo possono consumare il contesto o far sì che il modello smetta di funzionare troppo presto.

Provencher consiglia ai team di rivedere le proprie competenze, i file AGENTS.md e le richieste di attività ogni volta che cambiano modello, di legare strettamente le istruzioni a attività specifiche e di definire chiaramente quando un lavoro viene completato, perché anche senza restrizioni, Astra potrebbe interrompersi prima di quanto ha fatto GPT-5.6 Sol. I team che hanno bloccato le cose dopo che i modelli precedenti sono diventati disonesti dovrebbero rivisitare quelle regole: Astra ha un giudizio migliore, sostiene il post, ma può interpretare le vecchie restrizioni in modo così letterale che si ferma quando vuoi che vada avanti.

Cosa succede dopo

Il ripristino dell'utilizzo offre agli abbonati del Codex una tabula rasa per rivalutare il modello e OpenAI osserverà gli stessi test affiancati eseguiti dai suoi utenti. La questione più profonda è la fiducia: gli sviluppatori paganti che hanno visto un'ammiraglia degradarsi entro una settimana dal lancio ora hanno una spiegazione documentata, tre difetti nominati e un ripristino, ma anche un nuovo motivo per confrontare ogni aggiornamento del modello rispetto al giorno in cui è stato spedito.

Stai al passo con l'intelligenza artificiale

Il lancio dei modelli, l'autopsia dei difetti e gli strumenti che rimodellano il lavoro del software vengono monitorati ogni giorno.

Leggi altre notizie sull'AI →