OpenAI ha pubblicato un post sulla sicurezza il 30 settembre 2026 in cui descrive come ha identificato e interrotto una campagna coordinata per estrarre ragionamenti protetti dai suoi modelli e ha attribuito un nucleo centrale dell'attività a individui associati a Moonshot AI, il laboratorio cinese dietro la famiglia del modello Kimi.

La divulgazione arriva in un momento delicato per il settore, in cui il valore di un modello di frontiera risiede sempre più non solo nelle sue risposte ma nel modo in cui ragiona. Per i lettori che seguono gli ultimi sviluppi dell’intelligenza artificiale, il caso offre uno sguardo insolitamente dettagliato su come il modello IP viene attaccato su larga scala e su come i laboratori stanno rispondendo.

Cosa significa qui "distillazione contraddittoria".

OpenAI descrive l'attività come coerente con la distillazione contraddittoria, che definisce come l'uso sistematico e non autorizzato dei risultati o del ragionamento di un modello per aiutare ad addestrare, riprodurre o migliorare un altro modello. Il "ragionamento protetto" è la registrazione interna del modello per lo svolgimento di un'attività: informazioni che normalmente vengono nascoste dalla risposta finale visualizzata dall'utente. Estrarlo, sostiene l’azienda, può aiutare altri a riprodurre capacità che non hanno costruito.

È importante sottolineare che OpenAI afferma che gli operatori non hanno violato la crittografia, compromesso un database o ottenuto l’accesso diretto alle conversazioni degli utenti archiviate. Invece, hanno manipolato le interazioni dei modelli in modo che il ragionamento protetto potesse essere riprodotto in forme visibili al richiedente: un abuso coordinato e ad alto volume del prodotto stesso piuttosto che un hack tradizionale.

Una tecnica documentata da OpenAI prevedeva la copia di tracce di ragionamento crittografate da una conversazione e quindi la richiesta a un modello in una conversazione separata di decrittografare e trascrivere il contenuto del ragionamento nascosto. La società ha sottolineato che la manipolazione non è una vulnerabilità esclusiva dei propri modelli e ha affermato di aver condiviso i dettagli con i partner del settore attraverso il Frontier Model Forum per rafforzare le difese collettive.

La cronologia: 16.000 richieste in due giorni

Secondo il post, la campagna è iniziata il 1 luglio 2026 con un volume relativamente basso. La situazione si è intensificata bruscamente il 24 e 25 luglio, quando OpenAI ha osservato picchi di volumi elevati di 16.000 richieste utilizzando un modello di estrazione pertinente, proveniente da oltre 4.000 utenti. Una nota a piè di pagina nel post avverte che queste cifre descrivono tentativi di estrazioni, non necessariamente riuscite.

Ulteriori indagini hanno scoperto attività correlate di schemi di prompt in un cluster di oltre 15.000 utenti. OpenAI afferma di aver interrotto completamente la campagna entro il 28 luglio 2026 e che l'attività ha continuato ad evolversi nel tempo, rafforzando la sua visione secondo cui la distillazione contraddittoria richiede difese adattative e stratificate piuttosto che una soluzione una tantum.

Punti di attribuzione all'IA Moonshot

OpenAI è attento alla sua attribuzione. Non è chiaro se tutti gli operatori osservati durante il periodo provenissero da un singolo attore, ma attribuisce un nucleo centrale dell'attività a individui associati a Moonshot AI, lo sviluppatore di Kimi.

La richiesta non arriva nel vuoto. L'8 settembre 2026, la National Security Agency, la Cybersecurity and Infrastructure Security Agency e l'FBI hanno rilasciato un avviso congiunto sulla sicurezza informatica in cui si afferma che Moonshot AI ha condotto un'ampia campagna di distillazione contro le società statunitensi di intelligenza artificiale di frontiera almeno dalla metà del 2025. Secondo l'avviso, Moonshot ha estratto dati significativi di Claude Fable 5 per addestrare il suo modello Kimi-K3 e dati GPT-4o per addestrare Kimi-K2, utilizzando modelli statunitensi per distillare capacità di messa a punto supervisionata, apprendimento per rinforzo, ingegneria del software e matematica.

L'avviso va oltre, affermando che, probabilmente con la consapevolezza del governo cinese, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun e Z.AI hanno estratto collettivamente miliardi di token in milioni di scambi dai modelli di frontiera statunitensi, comprese le varianti di Claude, GPT, Gemini e Grok, almeno dalla fine del 2024. Le agenzie descrivono una pipeline logistica di API native, fornitori di cloud remoti e aggregatori di terze parti, oltre a un mercato grigio di proxy API. note come "stazioni di trasferimento" utilizzate per aggirare le restrizioni geografiche e i termini di servizio. Secondo quanto riferito, i risparmi sui costi provenivano dall’acquisto in blocco di abbonamenti premium condivisi tra i team di sviluppatori.

Perché vale la pena rubare le tracce del ragionamento

La preoccupazione per la sicurezza va oltre il vantaggio competitivo. OpenAI sostiene che il ragionamento estratto potrebbe essere utilizzato per addestrare un altro modello senza preservare le garanzie applicate agli output rivolti agli utenti del modello originale, il che significa che la distillazione su larga scala può trasferire capacità avanzate senza il corrispondente investimento in sicurezza. La società afferma che tali rischi aumentano man mano che i modelli acquisiscono competenze in settori a duplice uso.

Ricercatori indipendenti hanno lanciato lo stesso allarme. In un documento presentato ad arXiv il 10 agosto 2026, un gruppo di ricercatori tra cui Alexander Panfilov, Ilia Shumailov e Maksym Andriushchenko ha riferito che i principali fornitori non nascondono completamente le tracce di ragionamento dei loro modelli e hanno dimostrato le relative vulnerabilità dei modelli incrociati e della compattazione delle conversazioni attraverso una divulgazione responsabile. OpenAI afferma di aver indagato su questi risultati, di aver confermato che i percorsi di attacco erano reali e di aver utilizzato il lavoro per accelerare le sue mitigazioni.

Cosa verrà dopo

OpenAI afferma di aver studiato la portata della campagna e il potenziale impatto prima della pubblicazione, di aver implementato le proprie misure di mitigazione e di aver condiviso i risultati con ricercatori e partner del settore per ottenere feedback. Sono in corso ulteriori attività di mitigazione e indagine e l’azienda inquadra la distillazione contraddittoria come una sfida di sicurezza più ampia per l’intero ecosistema dei laboratori di frontiera piuttosto che come un singolo incidente.

L’episodio inoltre acuisce un dibattito politico in corso. Se le agenzie statunitensi attribuiscono formalmente le campagne di distillazione ai laboratori cinesi, si aspettano controlli più severi sull’accesso alle API, limiti di velocità e controlli di identità più aggressivi e una pressione continua sui mercati degli aggregatori e dei proxy che rendono più facile nascondere gli abusi su larga scala. Per le aziende di intelligenza artificiale su entrambe le sponde del Pacifico, il livello di ragionamento è ora una risorsa contestata e proteggerlo è diventata una disciplina di sicurezza a sé stante.

---

Stai al passo con l'intelligenza artificiale

Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →