Une startup américaine appelée Abliteration.ai a transformé l'une des techniques d'IA open source les plus controversées en un service commercial, vendant un accès par navigateur et API à des modèles ouverts populaires sans leur formation en matière de sécurité - y compris le GLM-5.3 récemment publié par Z.ai, l'un des modèles ouverts les plus performants disponibles aujourd'hui.

L'entreprise tire son nom de « l'ablitération », une méthode qui supprime la tendance d'un modèle à refuser les demandes nuisibles. Les chercheurs et les amateurs utilisent cette technique depuis des années, et Hugging Face héberge des milliers de modèles ablitérés. Ce qui est nouveau, c'est le packaging : Abliteration.ai héberge des modèles modifiés sur sa propre infrastructure, de sorte que toute personne disposant d'un navigateur Web peut les interroger sans télécharger de poids ni louer de GPU. TechCrunch a rapporté ce développement le 3 septembre, et il a depuis attiré l'attention des chercheurs en sécurité qui suivent le débat sur les poids ouverts que nous suivons dans notre couverture de l'actualité sur l'IA.

De la technique souterraine à la plateforme clé en main

Fondée à la fin de l'année dernière et officiellement constituée en mars, Abliteration.ai fait passer la pratique d'une niche open source à faire soi-même à un produit commercial raffiné. En hébergeant elle-même les modèles, l'entreprise supprime deux points de friction à la fois : les utilisateurs n'ont plus besoin des compétences techniques pour ablation d'un modèle, ni du calcul pour l'exécuter.

Le co-fondateur Devon – TechCrunch a caché son nom de famille à sa demande parce qu'il reste employé dans une autre entreprise – a déclaré que la société avait conclu des accords avec plusieurs grands fournisseurs de cloud et qu'elle était entièrement financée par les revenus des clients. La startup n’a pas levé de capital-risque, même si des négociations sont en cours, a-t-il déclaré.

Ce que le test de TechCrunch a trouvé

La société affirme que son objectif est de permettre « un travail offensif de cyber-équipe, de red-teaming et de test d'agents que d'autres modèles refusent de faire ». TechCrunch a mis cela à l'épreuve avec un compte gratuit, en interrogeant une version améliorée de GLM-5.3 via un navigateur Web. Les journalistes ont demandé au modèle d'écrire un programme Python qui vole les mots de passe Chrome enregistrés et de produire un protocole détaillé pour cultiver un agent pathogène humain dangereux à la maison. Il a facilement accédé aux deux demandes, selon le rapport.

Cette expérience est au cœur de l’histoire : les tâches que les modèles traditionnels traditionnels refusent catégoriquement sont désormais disponibles via un formulaire d’inscription, sans frais, dans un onglet du navigateur.

L'argument de la défense de l'équipe rouge

L'argumentation de Devon en faveur de l'entreprise repose sur l'argument classique en matière de sécurité : vous ne pouvez pas vous défendre contre un comportement que vous ne pouvez pas reproduire. Un modèle qui refuse d’écrire du code d’exploitation fonctionnel est de peu d’utilité pour une équipe rouge qui tente de comprendre les vrais attaquants.

"L'aspect général des modèles ablitérés est qu'ils sont capables de modéliser de mauvais acteurs", a-t-il déclaré à TechCrunch. "L'avantage est que désormais les défenseurs peuvent se déplacer aussi vite que possible... Je pense que cela accélérera la cybersécurité, ce qui est en quelque sorte contre-intuitif."

Les clients de la société comprennent des startups en phase de démarrage au Royaume-Uni et en Europe qui testent la sécurité des banques, des compagnies aériennes et d'autres opérateurs d'infrastructures critiques. L'un de ses clients majeurs, a déclaré Devon, regroupait des agents bancaires en équipes rouges et ne pouvait pas effectuer ce travail avec des modèles commerciaux non modifiés.

'Un modèle qui devient sociopathe'

Les chercheurs en sécurité voient la même capacité de manière très différente. Andrew Yoon, responsable de la recherche à CivAI, une organisation à but non lucratif chargée de la sécurité de l'IA, a déclaré à TechCrunch que l'ablitération vous permet de "modifier le modèle pour qu'il devienne un sociopathe".

"Vous pouvez écrire littéralement n'importe quoi ici, et cela s'y conformera", a déclaré Yoon, ajoutant qu'il s'attend à ce que "des modèles modifiés et ablitérés soient utilisés à des fins nuisibles dans un avenir proche".

Dans un article d'opinion récent, Yoon a fait valoir que si la suppression des garde-corps ne peut pas être empêchée de manière réaliste, les gouvernements devraient exiger des fournisseurs qu'ils utilisent des classificateurs qui détectent et bloquent les activités nuisibles en matière de cybersécurité et d'armes biologiques, et devraient exiger des entreprises louant un accès direct aux GPU avancés qu'elles vérifient l'identité des clients et refusent le service lorsqu'une utilisation dangereuse est suspectée.

Garde-corps minces et aucun contrôle d'identité

Pour l’instant, les propres garanties d’Abliteration.ai sont minimes. La plate-forme offre aux clients une couche de modération facultative afin qu'ils puissent ajouter les restrictions qu'ils souhaitent, et le site lui-même maintient quelques limites mineures : TechCrunch n'a pas réussi à faire en sorte que le modèle produise des instructions de suicide, et Devon a déclaré qu'il travaillait sur des mesures supplémentaires pour prévenir la violence.

L'entreprise n'effectue aucun contrôle de connaissance de votre client au-delà de l'enregistrement de la carte de crédit utilisée pour le paiement. "Vous ne voulez pas être la personne responsable de quelqu'un qui fait quelque chose de fou... alors où tracez-vous la limite de votre responsabilité en tant qu'entreprise ?" » dit Devon. "Nous sommes encore en train de définir cela."

Une question à laquelle l'industrie ne peut pas échapper

Tous les praticiens de la sécurité ne conviennent pas que les modèles ablitérés constituent le meilleur outil pour les tests offensifs. Ahmed Aly, PDG de la société de recrutement d'agents Fabraix, a déclaré à TechCrunch que son entreprise s'appuie davantage sur le réglage fin des modèles à poids ouvert, qui sont déjà livrés avec peu de refus – et note que l'ablitération peut dégrader les capacités sous-jacentes d'un modèle.

La plupart des experts consultés par TechCrunch s’accordent sur une chose : cette pratique ne peut pas être arrêtée. Les pondérations téléchargeables signifient que n’importe qui peut supprimer les refus localement, comme le souligne un commentaire de 2026 du Combating Terrorism Center de West Point sur l’utilisation abusive de « l’ablitération ». La question ouverte d’Abliteration.ai est de savoir si la réduction du coût d’accès pour tous – défenseurs et attaquants – rend Internet plus sûr ou plus dangereux.

Gardez une longueur d'avance sur l'IA

La sécurité de l’IA évolue quotidiennement. Obtenez les derniers développements de l'IA en un seul endroit.

Lire plus d'actualités sur l'IA →