OpenAI a publié un article de sécurité le 30 septembre 2026 décrivant comment il a identifié et perturbé une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles – et a attribué une partie centrale de l'activité à des individus associés à Moonshot AI, le laboratoire chinois derrière la famille de modèles Kimi.
Cette divulgation arrive à un moment sensible pour l’industrie, où la valeur d’un modèle frontière réside de plus en plus non seulement dans ses réponses mais aussi dans la manière dont il raisonne. Pour les lecteurs qui suivent les derniers développements de l’IA, le cas offre un aperçu inhabituellement détaillé de la manière dont les modèles IP sont attaqués à grande échelle – et de la manière dont les laboratoires réagissent.
Que signifie ici « distillation contradictoire »
OpenAI décrit l'activité comme compatible avec la distillation contradictoire, qu'il définit comme l'utilisation systématique et non autorisée des résultats ou du raisonnement d'un modèle pour aider à former, reproduire ou améliorer un autre modèle. Le « raisonnement protégé » est l'enregistrement interne du modèle pour l'exécution d'une tâche : des informations qui sont normalement cachées dans la réponse finale vue par l'utilisateur. L’extraire, affirme l’entreprise, peut aider d’autres à reproduire des capacités qu’ils n’ont pas construites.
Il est important de noter qu'OpenAI affirme que les opérateurs n'ont pas brisé son cryptage, compromis une base de données ou obtenu un accès direct aux conversations des utilisateurs stockées. Au lieu de cela, ils ont manipulé les interactions du modèle afin que le raisonnement protégé puisse être reproduit sous des formes visibles pour le demandeur – un abus coordonné et massif du produit lui-même plutôt qu’un piratage traditionnel.
Une technique documentée par OpenAI impliquait de copier les traces de raisonnement cryptées d'une conversation, puis de demander à un modèle dans une conversation distincte de décrypter et de transcrire le contenu de raisonnement caché. La société a souligné que la manipulation n'est pas une vulnérabilité propre à ses propres modèles et a déclaré qu'elle partageait des détails avec des partenaires industriels par le biais du Frontier Model Forum afin de renforcer les défenses collectives.
Le timeline : 16 000 demandes en deux jours
Selon le message, la campagne a débuté le 1er juillet 2026 avec un volume relativement faible. La situation s'est fortement intensifiée les 24 et 25 juillet, lorsqu'OpenAI a observé des pics de volume élevés de 16 000 requêtes utilisant un modèle d'extraction pertinent, provenant de plus de 4 000 utilisateurs. Une note de bas de page prévient que ces chiffres décrivent des tentatives d’extraction – pas nécessairement réussies.
Une enquête plus approfondie a révélé une activité de modèle d'invite associée sur un cluster de plus de 15 000 utilisateurs. OpenAI affirme avoir complètement perturbé la campagne le 28 juillet 2026 et que l'activité a continué d'évoluer au fil du temps, renforçant son point de vue selon lequel la distillation contradictoire nécessite des défenses adaptatives à plusieurs niveaux plutôt qu'une solution ponctuelle.
L'attribution pointe vers Moonshot AI
OpenAI est prudent avec son attribution. Il indique qu'il n'est pas clair si tous les opérateurs observés au cours de la période provenaient d'un seul acteur, mais qu'il attribue un noyau central de l'activité à des individus associés à Moonshot AI, le développeur de Kimi.
La réclamation n’arrive pas dans le vide. Le 8 septembre 2026, la National Security Agency, la Cybersecurity and Infrastructure Security Agency et le FBI ont publié un avis conjoint en matière de cybersécurité indiquant que Moonshot AI a mené une vaste campagne de distillation contre les sociétés américaines d’IA frontalières depuis au moins la mi-2025. Selon l'avis, Moonshot a extrait des données importantes de Claude Fable 5 pour entraîner son modèle Kimi-K3 et des données GPT-4o pour entraîner Kimi-K2, en utilisant des modèles américains pour distiller des capacités de réglage fin supervisé, d'apprentissage par renforcement, d'ingénierie logicielle et de mathématiques.
L'avis va plus loin, déclarant que – probablement avec la connaissance du gouvernement chinois – DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun et Z.AI ont collectivement extrait des milliards de jetons sur des millions d'échanges à partir de modèles frontières américains, y compris des variantes de Claude, GPT, Gemini et Grok, depuis au moins fin 2024. Les agences décrivent un pipeline logistique d'API natives, de fournisseurs de cloud distants et d'agrégateurs tiers, ainsi qu'un marché gris de proxys d'API. connues sous le nom de « stations de transfert » utilisées pour contourner les restrictions géographiques et les conditions de service. Les économies de coûts proviendraient de l'achat groupé d'abonnements premium partagés entre les équipes de développeurs.
Pourquoi les traces de raisonnement valent la peine d'être volées
Le problème de la sécurité va au-delà de l’avantage concurrentiel. OpenAI soutient que le raisonnement extrait pourrait être utilisé pour former un autre modèle sans préserver les garanties appliquées aux résultats destinés aux utilisateurs du modèle d'origine – ce qui signifie que la distillation à grande échelle peut transférer des capacités avancées sans l'investissement correspondant en matière de sécurité. La société affirme que ces risques augmentent à mesure que les modèles acquièrent des capacités dans les domaines à double usage.
Des chercheurs indépendants tirent la même alarme. Dans un article soumis à arXiv le 10 août 2026, un groupe de chercheurs comprenant Alexander Panfilov, Ilia Shumailov et Maksym Andriushchenko ont rapporté que les principaux fournisseurs ne dissimulent pas entièrement les traces de raisonnement de leurs modèles et ont démontré des vulnérabilités liées aux modèles croisés et au compactage des conversations grâce à une divulgation responsable. OpenAI affirme avoir enquêté sur ces résultats, confirmé que les chemins d'attaque étaient réels et utilisé ces travaux pour accélérer ses mesures d'atténuation.
La suite
OpenAI affirme avoir étudié la portée et l'impact potentiel de la campagne avant de la publier, déployé ses propres mesures d'atténuation et partagé ses conclusions avec les chercheurs et les partenaires industriels pour obtenir leurs commentaires. Des travaux supplémentaires d’atténuation et d’enquête se poursuivent, et la société considère la distillation contradictoire comme un défi de sécurité plus large pour l’ensemble de l’écosystème des laboratoires frontaliers plutôt que comme un seul incident.
L’épisode aiguise également un débat politique en cours. Si les agences américaines attribuent officiellement les campagnes de distillation aux laboratoires chinois, attendez-vous à des contrôles plus stricts sur l’accès aux API, à des limitations de débit et à des contrôles d’identité plus agressifs, ainsi qu’à une pression continue sur les marchés des agrégateurs et des proxys qui faciliteront la dissimulation des abus à grande échelle. Pour les entreprises d’IA des deux côtés du Pacifique, la couche de raisonnement est désormais un atout contesté – et sa protection est devenue une discipline de sécurité en soi.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →