Google DeepMind a annoncé le 27 août ce qu'il appelle la première évaluation en double aveugle au monde d'un modèle d'IA exclusif de classe frontière – une configuration cryptographique conçue pour permettre à des experts externes de tester les modèles de Google sans qu'aucune des parties ne découvre les secrets de l'autre.

Le pilote, décrit dans un article de blog DeepMind par William Isaac, Sol Messing et Kristian Lum, exécute un modèle Gemini Flash Lite via des tests confidentiels dans un environnement cryptographiquement sécurisé. Google DeepMind s'associe au Singapore AI Safety Institute, OpenMined, AVERI et MLCommons dans ce cadre et a publié un rapport technique décrivant la méthodologie.

L’annonce s’attaque à l’une des faiblesses les plus persistantes de l’évaluation de l’IA : la contamination des benchmarks. Pour les lecteurs qui suivent l'actualité de la recherche sur l'IA, il s'agit de l'une des tentatives les plus concrètes visant à rendre les tests de modèles tiers d'une propreté vérifiable.

Le problème de la contamination, expliqué

DeepMind ouvre son annonce avec une analogie avec une salle de classe. Si un étudiant voit accidentellement les questions de l’examen à l’avance, une note parfaite ne signifie rien. La même logique s'applique aux modèles frontières : si un modèle a déjà été exposé aux questions d'un benchmark (via des données de formation, des fuites d'ensembles d'évaluation ou une optimisation préalable), les scores qui en résultent peuvent surestimer considérablement ses capacités réelles.

Il ne s’agit pas d’une préoccupation hypothétique. La contamination des benchmarks sévit dans le domaine depuis des années, les chercheurs démontrant à plusieurs reprises que les ensembles de tests populaires s'infiltrent dans des corpus de formation à l'échelle du Web et que les modèles peuvent être réglés en silence pour fonctionner correctement sur les évaluations connues. Lorsque les gouvernements et les entreprises utilisent des scores de référence pour prendre des décisions en matière d’achats et de politiques, des chiffres gonflés ont des conséquences réelles.

À mesure que les modèles deviennent plus performants, affirme DeepMind, les enjeux sont les plus élevés pour les catégories d’évaluation sensibles – les tests de cybersécurité et les évaluations gouvernementales en tête d’entre elles – où un score contaminé est non seulement trompeur mais potentiellement dangereux.

L'ancien compromis : vos invites ou nos pondérations

Historiquement, les évaluations externes aux enjeux élevés ont contraint à un choix inconfortable. Soit l’évaluateur a transmis ses invites de test au fournisseur du modèle – au risque que le fournisseur voie les questions du test à l’avance – soit le fournisseur a remis les pondérations du modèle à l’évaluateur – au risque de perdre sa propriété intellectuelle la plus précieuse.

Les protocoles de journalisation zéro et les garanties contractuelles rigoureuses ont longtemps gardé confidentielles les invites de tests externes, écrit DeepMind, mais ce sont des promesses imposées par la politique plutôt que par les mathématiques. Les évaluations en double aveugle remplacent cette confiance par une preuve cryptographique.

Comment fonctionne la boîte cryptographique

Le pilote utilise Confidential Space, qui fait partie du portefeuille Confidential Computing de Google Cloud, pour créer ce que DeepMind décrit comme une « boîte » cryptographique. À l’intérieur, les deux moitiés d’une évaluation – le benchmark confidentiel et le modèle propriétaire – restent privées pour leurs propriétaires respectifs, et l’environnement vérifie ce fait par cryptographie.

Le résultat est véritablement en double aveugle : l'évaluateur externe ne peut pas voir les pondérations du modèle Gemini, et Google ne peut pas voir les invites de test de l'évaluateur. Aucune des deux parties ne doit faire confiance aux promesses de l’autre, car l’architecture elle-même rend en principe les fuites impossibles. Surtout, la configuration empêche également que les données d'évaluation soient utilisées ultérieurement pour optimiser les performances du modèle avant de futurs tests, fermant ainsi la boucle par laquelle la contamination réapparaît généralement.

Pourquoi c'est important pour la surveillance de l'IA

La signification plus large va au-delà d’un seul modèle Gemini. Les organisations indépendantes – instituts de sécurité de l’IA, laboratoires universitaires, régulateurs – ont du mal depuis des années à évaluer rigoureusement les modèles à frontières fermées, précisément parce que les fournisseurs ne peuvent pas attribuer de poids et que les évaluateurs ne fourniront pas de références. Tous les grands instituts de sécurité de l’IA ont été confrontés à des versions de ce problème lors de la signature d’accords d’évaluation avec des laboratoires pionniers.

Si le projet pilote tient le coup, il propose un modèle dans lequel la souveraineté des données et la propriété intellectuelle survivent au contact avec un examen indépendant. DeepMind espère que le projet pilote « établira une nouvelle frontière pour la surveillance des modèles, en aidant l'industrie dans son ensemble à construire des systèmes d'IA plus sûrs, plus fiables et plus largement fiables ».

La liste des partenaires est remarquable en soi. Le Singapore AI Safety Institute est l’un des organismes d’évaluation nationaux les plus actifs ; OpenMined crée des outils de calcul préservant la confidentialité ; MLCommons standardise l'analyse comparative de l'industrie. AVERI complète un consortium regroupant des organismes de normalisation gouvernementaux, universitaires et industriels – les groupes qui devraient adopter une évaluation en double aveugle pour qu'elle devienne une norme plutôt qu'une démonstration.

Une course aux armements pour l’intégrité des évaluations

Cette annonce intervient dans un contexte d’examen minutieux croissant de la manière dont les entreprises d’IA se notent. Les laboratoires sont de plus en plus accusés de sélectionner des références favorables, et les classements indépendants sont devenus influents précisément parce qu'ils échappent au contrôle des fournisseurs. L'évaluation en double aveugle étend ce mouvement d'indépendance au sein de la propre infrastructure du fournisseur – un changement notable pour les entreprises qui ont toujours insisté sur le contrôle de chaque détail de la manière dont leurs modèles sont testés.

Pour l’instant, le projet pilote couvre un modèle et un ensemble de références confidentielles. Mais si une évaluation cryptographiquement vérifiée et sans contamination devient techniquement courante, elle pourrait changer ce que les entreprises et les régulateurs attendent de chaque laboratoire pionnier – et rendre « faites confiance à notre score » plus difficile à vendre dans un marché de plus en plus fondé sur des allégations vérifiables.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →