OpenAI veröffentlichte am 30. September 2026 einen Sicherheitsbeitrag, in dem beschrieben wurde, wie es eine koordinierte Kampagne identifizierte und störte, um geschützte Argumente aus seinen Modellen zu extrahieren – und eine Kerngruppe der Aktivität Personen zuschrieb, die mit Moonshot AI, dem chinesischen Labor hinter der Kimi-Modellfamilie, in Verbindung stehen.
Die Offenlegung erfolgt zu einem sensiblen Zeitpunkt für die Branche, in dem der Wert eines Grenzmodells zunehmend nicht nur in seinen Antworten, sondern auch in der Art und Weise liegt, wie es begründet. Für Leser, die die neuesten KI-Entwicklungen verfolgen, bietet der Fall einen ungewöhnlich detaillierten Blick darauf, wie Modell-IP in großem Umfang angegriffen wird – und wie Labore reagieren.
Was „gegnerische Destillation“ hier bedeutet
OpenAI beschreibt die Aktivität als konsistent mit kontradiktorischer Destillation, die es als die systematische und unbefugte Verwendung der Ergebnisse oder Argumente eines Modells definiert, um beim Trainieren, Reproduzieren oder Verbessern eines anderen Modells zu helfen. „Geschütztes Denken“ ist die interne Aufzeichnung des Modells für die Bearbeitung einer Aufgabe – Informationen, die normalerweise in der endgültigen Antwort, die ein Benutzer sieht, zurückgehalten werden. Die Extraktion, so argumentiert das Unternehmen, kann anderen dabei helfen, Fähigkeiten zu reproduzieren, die sie nicht entwickelt haben.
Wichtig ist, dass die Betreiber laut OpenAI weder die Verschlüsselung gebrochen, eine Datenbank kompromittiert noch direkten Zugriff auf gespeicherte Benutzerkonversationen erhalten haben. Stattdessen manipulierten sie Modellinteraktionen, sodass geschützte Argumente in für den Antragsteller sichtbaren Formen reproduziert werden konnten – ein koordinierter, großvolumiger Missbrauch des Produkts selbst und kein traditioneller Hack.
Eine von OpenAI dokumentierte Technik bestand darin, verschlüsselte Argumentationsspuren aus einer Konversation zu kopieren und dann ein Modell in einer separaten Konversation zu bitten, den verborgenen Argumentationsinhalt zu entschlüsseln und zu transkribieren. Das Unternehmen betonte, dass es sich bei der Manipulation nicht um eine Schwachstelle handele, die nur in seinen eigenen Modellen zu finden sei, und teilte mit, dass es über das Frontier Model Forum Einzelheiten mit Industriepartnern geteilt habe, um die kollektive Verteidigung zu stärken.
Der Zeitplan: 16.000 Anfragen in zwei Tagen
Dem Beitrag zufolge begann die Kampagne am 1. Juli 2026 mit relativ geringem Volumen. Am 24. und 25. Juli eskalierte es stark, als OpenAI unter Verwendung eines relevanten Extraktionsmusters große Spitzen von 16.000 Anfragen beobachtete, die von mehr als 4.000 Benutzern stammten. In einer Fußnote im Beitrag wird darauf hingewiesen, dass diese Zahlen versuchte Extraktionen beschreiben – nicht unbedingt erfolgreiche.
Weitere Untersuchungen ergaben entsprechende Prompt-Pattern-Aktivitäten in einem Cluster von mehr als 15.000 Benutzern. OpenAI sagt, dass es die Kampagne bis zum 28. Juli 2026 vollständig unterbrochen hat und dass sich die Aktivität im Laufe der Zeit weiterentwickelt hat, was seine Ansicht bekräftigt, dass die gegnerische Destillation mehrschichtige, adaptive Abwehrmaßnahmen und keine einmalige Lösung erfordert.
Zuordnung weist auf Moonshot AI hin
OpenAI ist mit seiner Namensnennung vorsichtig. Darin heißt es, es sei unklar, ob alle in diesem Zeitraum beobachteten Betreiber von einem einzigen Akteur stammten, ein Kerncluster der Aktivität werde jedoch Personen zugeschrieben, die mit Moonshot AI, dem Entwickler von Kimi, in Verbindung stehen.
Der Anspruch kommt nicht im luftleeren Raum. Am 8. September 2026 veröffentlichten die National Security Agency, die Cybersecurity and Infrastructure Security Agency und das FBI eine gemeinsame Cybersicherheitswarnung, in der es heißt, dass Moonshot AI seit mindestens Mitte 2025 eine weitreichende Destillationskampagne gegen US-Grenz-KI-Unternehmen durchgeführt hat. Dem Gutachten zufolge extrahierte Moonshot wichtige Claude-Fable-5-Daten, um sein Kimi-K3-Modell zu trainieren, und GPT-4o-Daten, um Kimi-K2 zu trainieren. Dabei nutzte es US-Modelle, um Fähigkeiten in den Bereichen überwachte Feinabstimmung, Reinforcement Learning, Software-Engineering und Mathematik zu destillieren.
Das Gutachten geht noch weiter und besagt, dass DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun und Z.AI – wahrscheinlich mit Kenntnis der chinesischen Regierung – seit mindestens Ende 2024 gemeinsam Milliarden von Token über Millionen von Börsen von US-Grenzmodellen extrahiert haben, darunter Varianten von Claude, GPT, Gemini und Grok. Die Agenturen beschreiben eine Logistikpipeline aus nativen APIs, Remote-Cloud-Anbietern und Drittanbieter-Aggregatoren sowie einen grauen API-Markt Proxys, sogenannte „Transferstationen“, dienen zur Umgehung geografischer Beschränkungen und Nutzungsbedingungen. Berichten zufolge wurden Kosteneinsparungen durch die Massenbeschaffung von Premium-Abonnements erzielt, die von allen Entwicklerteams gemeinsam genutzt werden.
Warum es sich lohnt, Argumentationsspuren zu stehlen
Die Sicherheitsbedenken gehen über den Wettbewerbsvorteil hinaus. OpenAI argumentiert, dass extrahierte Argumentation zum Trainieren eines anderen Modells verwendet werden könnte, ohne die Sicherheitsmaßnahmen beizubehalten, die auf die benutzerorientierten Ausgaben des ursprünglichen Modells angewendet wurden – was bedeutet, dass eine Destillation in großem Maßstab erweiterte Fähigkeiten übertragen kann, ohne dass entsprechende Investitionen in die Sicherheit erforderlich sind. Das Unternehmen sagt, dass diese Risiken wachsen, wenn die Modelle Fähigkeiten in Dual-Use-Bereichen erlangen.
Unabhängige Forscher haben den gleichen Alarm geschlagen. In einem am 10. August 2026 bei arXiv eingereichten Artikel berichtete eine Gruppe von Forschern, darunter Alexander Panfilov, Ilia Shumailov und Maksym Andriushchenko, dass führende Anbieter die Argumentationsspuren ihrer Modelle nicht vollständig verbergen, und zeigte durch verantwortungsvolle Offenlegung damit verbundene modellübergreifende und Konversationskomprimierungsschwachstellen auf. OpenAI sagt, es habe diese Ergebnisse untersucht, bestätigt, dass die Angriffspfade real seien, und die Arbeit genutzt, um seine Abhilfemaßnahmen zu beschleunigen.
Was als nächstes kommt
OpenAI sagt, es habe vor der Veröffentlichung den Umfang und die möglichen Auswirkungen der Kampagne untersucht, eigene Gegenmaßnahmen ergriffen und die Ergebnisse mit Forschern und Industriepartnern geteilt, um Feedback zu erhalten. Weitere Abhilfe- und Untersuchungsarbeiten werden fortgesetzt, und das Unternehmen betrachtet die gegnerische Destillation als eine umfassendere Sicherheitsherausforderung für das gesamte Frontier-Lab-Ökosystem und nicht als einen einzelnen Vorfall.
Die Episode schärft auch eine laufende politische Debatte. Wenn US-Behörden Destillationskampagnen formell chinesischen Labors zuschreiben, müssen Sie mit strengeren Kontrollen des API-Zugriffs, aggressiveren Ratenbegrenzungen und Identitätsprüfungen sowie anhaltendem Druck auf die Aggregator- und Proxy-Märkte rechnen, der es einfacher macht, groß angelegten Missbrauch zu verbergen. Für KI-Unternehmen auf beiden Seiten des Pazifiks ist die Argumentationsschicht mittlerweile ein umstrittenes Gut – und ihr Schutz ist zu einer eigenen Sicherheitsdisziplin geworden.
---
Der KI einen Schritt voraus seinErhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →