Ein US-Startup namens Abliteration.ai hat eine der umstrittensten Open-Source-KI-Techniken in einen kommerziellen Dienst umgewandelt und verkauft Browser- und API-Zugriff auf beliebte Open-Weight-Modelle ohne Sicherheitstraining – darunter Z.ais kürzlich veröffentlichtes GLM-5.3, eines der leistungsfähigsten offenen Modelle, die derzeit erhältlich sind.
Der Name des Unternehmens leitet sich von der „Abliteration“ ab, einer Methode, die einem Model die Tendenz nimmt, schädliche Anfragen abzulehnen. Forscher und Bastler verwenden die Technik seit Jahren, und Hugging Face beherbergt Tausende von aliterierten Modellen. Neu ist die Verpackung: Abliteration.ai hostet modifizierte Modelle auf seiner eigenen Infrastruktur, sodass jeder mit einem Webbrowser sie abfragen kann, ohne Gewichte herunterzuladen oder GPUs zu mieten. TechCrunch berichtete am 3. September über die Entwicklung und hat seitdem die Aufmerksamkeit von Sicherheitsforschern auf sich gezogen, die die Open-Weights-Debatte verfolgen, die wir in unserer [KI-Berichterstattung] verfolgen (https://aibuzzwire.news).
Von der Untertagetechnik zur schlüsselfertigen Plattform
Abliteration.ai wurde Ende letzten Jahres gegründet und im März offiziell eingetragen und entwickelt die Praxis von einer Do-it-yourself-Open-Source-Nische zu einem ausgefeilten kommerziellen Produkt. Durch das Hosten der Modelle selbst beseitigt das Unternehmen zwei Reibungspunkte auf einmal: Benutzer benötigen nicht mehr die technischen Fähigkeiten, um ein Modell abzuleiten, und auch nicht die Rechenleistung, um eines auszuführen.
Mitbegründer Devon – TechCrunch hat seinen Nachnamen auf seinen Wunsch zurückgehalten, weil er weiterhin bei einer anderen Firma beschäftigt ist – sagte, das Unternehmen habe Verträge mit mehreren großen Cloud-Anbietern abgeschlossen und werde vollständig durch Kundeneinnahmen finanziert. Das Startup habe kein Risikokapital aufgenommen, obwohl Gespräche im Gange seien, sagte er.
Was der Test von TechCrunch ergab
Das Unternehmen sagt, sein Ziel sei es, „offensive Cyber-, Red-Teaming- und Agententest-Arbeiten zu ermöglichen, die andere Modelle ablehnen“. TechCrunch hat dies mit einem kostenlosen Konto auf die Probe gestellt und eine abgekürzte Version von GLM-5.3 über einen Webbrowser abgefragt. Die Reporter baten das Model, ein Python-Programm zu schreiben, das gespeicherte Chrome-Passwörter stiehlt, und ein detailliertes Protokoll für die Kultivierung eines gefährlichen menschlichen Krankheitserregers zu Hause zu erstellen. Beiden Bitten sei man bereitwillig nachgekommen, heißt es in dem Bericht.
Dieses Experiment ist der Kern der Geschichte: Aufgaben, die Mainstream-Frontier-Modelle kategorisch ablehnen, sind jetzt kostenlos über ein Anmeldeformular in einem Browser-Tab verfügbar.
Das Argument der Red-Team-Verteidigung
Devons Argumentation für das Unternehmen ist das klassische Sicherheitsargument: Man kann sich nicht gegen Verhalten wehren, das man nicht reproduzieren kann. Ein Modell, das sich weigert, funktionierenden Exploit-Code zu schreiben, ist für ein rotes Team, das versucht, echte Angreifer zu verstehen, von geringem Nutzen.
„Das große Bild von ausgelöschten Models ist, dass sie in der Lage sind, schlechte Schauspieler zu modellieren“, sagte er gegenüber TechCrunch. „Der Vorteil besteht darin, dass die Verteidiger jetzt so schnell wie möglich agieren können … Ich denke, das wird die Cybersicherheit beschleunigen, was ein kontraintuitiver Punkt ist.“
Zu den Kunden des Unternehmens gehören Red-Teaming-Startups im Frühstadium in Großbritannien und Europa, die die Sicherheit von Banken, Fluggesellschaften und anderen Betreibern kritischer Infrastruktur testen. Ein Großkunde, sagte Devon, verfügt über Red-Teams-Bankagenten und konnte diese Arbeit mit unveränderten Geschäftsmodellen nicht ausführen.
„Ein Model, das zum Soziopathen wird“
Sicherheitsforscher sehen dieselbe Fähigkeit sehr unterschiedlich. Andrew Yoon, Forschungsleiter bei der gemeinnützigen KI-Sicherheitsorganisation CivAI, sagte gegenüber TechCrunch, dass man durch Abliteration „das Modell so modifizieren kann, dass es zu einem Soziopathen wird“.
„Sie können hier buchstäblich alles eingeben, und es wird sich daran halten“, sagte Yoon und fügte hinzu, dass er damit rechnet, dass „bearbeitete, beschriftete Modelle in naher Zukunft für Schäden eingesetzt werden.“
In einem kürzlich erschienenen Meinungsbeitrag argumentierte Yoon, dass, wenn die Entfernung von Leitplanken nicht realistischerweise verhindert werden kann, Regierungen von den Anbietern verlangen sollten, Klassifikatoren zu betreiben, die schädliche Cyber- und Biowaffenaktivitäten erkennen und blockieren, und dass sie Unternehmen, die direkten Zugang zu fortschrittlichen GPUs mieten, dazu verpflichten sollten, Kundenidentitäten zu überprüfen und Dienste zu verweigern, wenn ein gefährlicher Missbrauch vermutet wird.
Dünne Leitplanken und keine Identitätskontrollen
Derzeit sind die eigenen Sicherheitsvorkehrungen von Abliteration.ai minimal. Die Plattform bietet Kunden eine optionale Moderationsebene, sodass sie beliebige Einschränkungen hinzufügen können, und die Website selbst behält einige kleinere Einschränkungen bei – TechCrunch konnte das Modell nicht dazu bringen, Selbstmordanweisungen zu erstellen, und Devon sagte, er arbeite an zusätzlichen Maßnahmen zur Verhinderung von Gewalt.
Über die Erfassung der für die Zahlung verwendeten Kreditkarte hinaus führt das Unternehmen keine Know-Your-Customer-Prüfung durch. „Sie möchten nicht die Person sein, die dafür verantwortlich ist, dass jemand etwas Verrücktes tut … Wo ziehen Sie also die Grenze Ihrer Verantwortung als Unternehmen?“ sagte Devon. „Wir sind noch dabei, das zu definieren.“
Eine Frage, der die Branche nicht ausweichen kann
Nicht alle Sicherheitsexperten sind sich einig, dass abgewandelte Modelle überhaupt das beste Werkzeug für offensive Tests sind. Ahmed Aly, CEO des Agent-Red-Teaming-Unternehmens Fabraix, sagte gegenüber TechCrunch, sein Unternehmen verlasse sich mehr auf die Feinabstimmung von Open-Weight-Modellen, die bereits mit wenigen Ausfällen ausgeliefert werden – und weist darauf hin, dass Abliteration die zugrunde liegenden Fähigkeiten eines Modells beeinträchtigen kann.
Die meisten von TechCrunch befragten Experten sind sich in einer Sache einig: Die Praxis kann nicht gestoppt werden. Herunterladbare Gewichte bedeuten, dass jeder vor Ort Ablehnungen entfernen kann, wie ein Kommentar des Combating Terrorism Center in West Point aus dem Jahr 2026 zum Missbrauch von „Abliteration“ unterstreicht. Die offene Frage, die Abliteration.ai aufwirft, ist, ob die Senkung der Zugangskosten für alle – Verteidiger und Angreifer gleichermaßen – das Internet sicherer oder gefährlicher macht.
Bleiben Sie der KI immer einen Schritt voraus
Die KI-Sicherheit entwickelt sich täglich weiter. Erhalten Sie die neuesten KI-Entwicklungen an einem Ort.
Weitere KI-Neuigkeiten lesen →