OpenAI a augmenté la récompense pour la découverte de « jailbreaks universels » dans ses modèles d'IA à 50 000 $, soit plus du double de la prime précédente et signalant que l'entreprise considère certaines classes de contournements de sécurité comme suffisamment sérieuses pour justifier un paiement majoré.

Le programme Bio Bug Bounty mis à jour, annoncé par OpenAI le 9 juillet 2026, demande aux chercheurs en sécurité de trouver des invites qui peuvent universellement briser les garde-fous de sécurité du modèle – des contournements qui fonctionnent dans plusieurs conversations et contextes plutôt que dans des cas extrêmes isolés. Le programme cible spécifiquement les jailbreaks liés aux menaces biologiques, où un modèle d'IA pourrait être contraint de fournir des conseils pratiques sur la création d'agents pathogènes ou d'armes dangereux.

Pour plus d’actualités sur l’IA et une analyse approfondie, visitez AI Buzz Wire.

Pourquoi 50 000 $ ?

L’augmentation de la prime reflète l’inquiétude croissante quant à l’écart entre ce que les modèles d’IA frontaliers sont censés ne pas faire et ce que les utilisateurs déterminés peuvent réellement en extraire. Un jailbreak universel est particulièrement dangereux car, contrairement à une astuce ponctuelle d’injection rapide, il représente une faiblesse systématique qui peut être reproduite et partagée.

TechRepublic a rapporté le 10 juillet que l'augmentation des récompenses intervient dans un contexte de surveillance accrue des modèles les plus puissants d'OpenAI. L'administration Trump avait précédemment demandé à OpenAI de limiter la sortie de son nouveau modèle cyber-capable à un groupe d'utilisateurs triés sur le volet, selon National Technology News, reflétant les inquiétudes du gouvernement concernant le potentiel offensif des systèmes d'IA frontaliers.

Une agence britannique constate que les cybercapacités de l'IA s'accélèrent

L'annonce de la prime coïncide avec un avertissement sévère de l'AI Security Institute (AISI) du Royaume-Uni, qui évalue de manière indépendante les cybercapacités des modèles frontières depuis 2024.

Dans une évaluation d'avril 2026 du GPT-5.5 d'OpenAI, l'AISI a constaté que le modèle atteignait un taux de réussite de 71,4 % pour les tâches de cybersécurité de niveau expert – le plus élevé de tous les modèles testés, surpassant Claude Mythos Preview d'Anthropic à 68,6 %, GPT-5.4 à 52,4 % et Opus 4.7 à 48,6 %.

Un point de référence était particulièrement frappant. AISI a conçu un défi personnalisé de rétro-ingénierie de machine virtuelle : une tâche en plusieurs étapes exigeant qu'un attaquant crée un décodeur d'instructions personnalisé, procède à la rétro-ingénierie d'un authentificateur et récupère un mot de passe valide. Le testeur de jeu humain expert de Crystal Peak Security a résolu le défi en 12 heures environ à l'aide d'outils professionnels. GPT-5.5 l'a résolu en 10 minutes et 22 secondes pour un coût de 1,73 $ en utilisation de l'API, sans assistance humaine.

Doubler tous les quelques mois

Dans une analyse distincte publiée en mai 2026, l’AISI a constaté que la durée des cybertâches que les modèles d’IA frontaliers peuvent accomplir de manière autonome a doublé tous les 4,7 mois depuis fin 2024 – une accélération par rapport à son estimation de novembre 2025 de 8 mois.

"Le rythme actuel du changement indique un potentiel croissant pour les cybercapacités de l'IA de se traduire par des risques tangibles – des risques que les organisations britanniques devront gérer dans les mois à venir", écrit l'AISI.

Claude Mythos Preview et GPT-5.5 ont tous deux largement dépassé la tendance de doublement précédente, soulevant la question de savoir si le rythme s'accélère encore.

Jailbreaks universels : les enjeux les plus élevés

La distinction entre un jailbreak restreint et un jailbreak universel est essentielle. Un jailbreak restreint pourrait inciter un modèle à produire une seule réponse non autorisée dans des conditions spécifiques. En revanche, un jailbreak universel représente une fissure fondamentale dans l’architecture de sécurité du modèle – une méthode qui contourne de manière fiable les garde-fous sur un large éventail d’entrées.

La décision d'OpenAI d'offrir 50 000 $ pour de telles découvertes suggère que la société estime que les jailbreaks universels sont à la fois suffisamment rares pour justifier une prime importante et suffisamment dangereux pour justifier l'investissement. Si un jailbreak universel pour les requêtes liées aux menaces biologiques était découvert par un acteur malveillant avant d’être corrigé, les conséquences pourraient être graves.

Le programme remplit également une fonction de transparence. En invitant des chercheurs externes à tester ses modèles, OpenAI peut identifier et corriger les vulnérabilités avant qu'elles ne soient exploitées dans la nature, à condition que la prime soit suffisamment importante pour attirer le calibre de talents nécessaire.

Une course entre attaque et défense

Les développements parallèles – l’augmentation des primes d’OpenAI et les évaluations des capacités de l’AISI – illustrent la tension centrale dans la sécurité de l’IA aujourd’hui. Les modèles deviennent considérablement plus performants dans les cybertâches, l’horizon temporel des tâches qu’ils peuvent accomplir doublant tous les quelques mois. Dans le même temps, les entreprises s’efforcent de corriger les vulnérabilités qui rendent leurs modèles dangereux.

La question reste ouverte de savoir si les primes et le red-teaming peuvent suivre le rythme de l’accélération de la courbe des capacités. Mais le chiffre de 50 000 $ envoie un signal clair : OpenAI estime que la menace est suffisamment grave pour payer le prix fort à quiconque peut prouver l’existence des fissures.

Gardez une longueur d'avance sur l'IA

À mesure que les modèles pionniers deviennent plus puissants, la bataille entre les garde-fous de sécurité et ceux qui tentent de les briser ne fera que s’intensifier. Suivez les derniers développements sur AI Buzz Wire.

En savoir plus sur Couverture de l'industrie de l'IA sur AI Buzz Wire.