Google DeepMind anunció el 27 de agosto lo que llama la primera evaluación doble ciego del mundo de un modelo de inteligencia artificial patentado de clase fronteriza: una configuración criptográfica diseñada para permitir que expertos externos realicen pruebas de estrés en los modelos de Google sin que ninguna de las partes vea los secretos de la otra.
El piloto, descrito en una publicación del blog de DeepMind por William Isaac, Sol Messing y Kristian Lum, ejecuta un modelo Gemini Flash Lite a través de puntos de referencia confidenciales dentro de un entorno criptográficamente seguro. Google DeepMind se está asociando con el Instituto de Seguridad de IA de Singapur, OpenMined, AVERI y MLCommons en este esfuerzo y ha publicado un informe técnico que describe la metodología.
El anuncio aborda una de las debilidades más persistentes en la evaluación de la IA: la contaminación de los puntos de referencia. Para los lectores que siguen [noticias de investigación de IA] (https://aibuzzwire.news), representa uno de los intentos más concretos de hacer que las pruebas de modelos de terceros sean verificablemente limpias.
El problema de la contaminación, explicado
DeepMind abre su anuncio con una analogía en el aula. Si un estudiante ve accidentalmente las preguntas del examen con anticipación, una puntuación perfecta no significa nada. La misma lógica se aplica a los modelos de frontera: si un modelo ya ha sido expuesto a las preguntas de un punto de referencia (a través de datos de entrenamiento, conjuntos de evaluaciones filtrados u optimización previa), las puntuaciones resultantes pueden exagerar enormemente la capacidad real.
Esta no es una preocupación hipotética. La contaminación de los puntos de referencia ha perseguido el campo durante años, y los investigadores han demostrado repetidamente que los conjuntos de pruebas populares se filtran en corpus de entrenamiento a escala web y que los modelos pueden ajustarse silenciosamente para funcionar bien en evaluaciones conocidas. Cuando los gobiernos y las empresas utilizan puntuaciones de referencia para tomar decisiones políticas y de adquisiciones, las cifras infladas conllevan consecuencias reales.
A medida que los modelos se vuelven más capaces, sostiene DeepMind, lo que está en juego es mayor para las categorías de evaluación sensibles (las pruebas de ciberseguridad y las evaluaciones gubernamentales son las principales entre ellas), donde una puntuación contaminada no solo es engañosa sino potencialmente peligrosa.
El viejo equilibrio: sus indicaciones o nuestros pesos
Históricamente, las evaluaciones externas de alto riesgo obligaban a tomar una decisión incómoda. O el evaluador entregó sus indicaciones de prueba al proveedor del modelo, arriesgándose a que el proveedor viera las preguntas de la prueba con anticipación, o el proveedor entregó las ponderaciones del modelo al evaluador, arriesgándose a perder su propiedad intelectual más valiosa.
Los protocolos de registro cero y las rigurosas salvaguardas contractuales han mantenido durante mucho tiempo la confidencialidad de las indicaciones de las pruebas externas, escribe DeepMind, pero esas son promesas impuestas por políticas más que por matemáticas. Las evaluaciones doble ciego reemplazan esa confianza con pruebas criptográficas.
Cómo funciona la caja criptográfica
El piloto utiliza Confidential Space, parte del portafolio de Confidential Computing de Google Cloud, para crear lo que DeepMind describe como una "caja" criptográfica. En su interior, ambas mitades de una evaluación (el punto de referencia confidencial y el modelo propietario) permanecen privadas para sus respectivos propietarios, y el entorno verifica criptográficamente ese hecho.
El resultado es genuinamente doble ciego: el evaluador externo no puede ver los pesos del modelo Gemini y Google no puede ver las indicaciones de prueba del evaluador. Ninguna de las partes tiene que confiar en las promesas de la otra, porque la propia arquitectura hace que la filtración sea, en principio, imposible. Fundamentalmente, la configuración también evita que los datos de evaluación se utilicen más adelante para optimizar el rendimiento del modelo antes de futuras pruebas, cerrando el círculo a través del cual la contaminación normalmente regresa.
Por qué es importante para la supervisión de la IA
El significado más amplio va más allá del modelo de Géminis. Las organizaciones independientes (institutos de seguridad de IA, laboratorios académicos, reguladores) han luchado durante años para evaluar rigurosamente los modelos de frontera cerrada, precisamente porque los proveedores no pueden entregar ponderaciones y los evaluadores no entregarán puntos de referencia. Todos los principales institutos de seguridad de la IA se han enfrentado a versiones de este problema al firmar acuerdos de evaluación con laboratorios fronterizos.
Si el piloto tiene éxito, ofrecerá un modelo bajo el cual la soberanía de los datos y la propiedad intelectual sobreviven al contacto con un escrutinio independiente. DeepMind dice que espera que el piloto "establezca una nueva frontera para la supervisión de modelos, ayudando a la industria en general a construir sistemas de IA más seguros, confiables y ampliamente confiables".
La lista de socios es notable en sí misma. El Instituto de Seguridad de la IA de Singapur es uno de los organismos nacionales de evaluación más activos; OpenMined crea herramientas informáticas que preservan la privacidad; MLCommons estandariza la evaluación comparativa de la industria. AVERI completa un consorcio que abarca organismos de normalización gubernamentales, académicos y de la industria: los grupos que necesitarían adoptar una evaluación doble ciego para que se convierta en una norma en lugar de una demostración.
Una carrera armamentista por la integridad de la evaluación
El anuncio llega en medio de un creciente escrutinio sobre cómo se califican a sí mismas las empresas de IA. Los laboratorios enfrentan crecientes acusaciones de seleccionar puntos de referencia favorables, y las tablas de clasificación independientes se han vuelto influyentes precisamente porque están fuera del control de los proveedores. La evaluación doble ciego extiende ese movimiento de independencia dentro de la propia infraestructura del proveedor, un cambio notable para las empresas que históricamente han insistido en controlar cada detalle de cómo se prueban sus modelos.
Por ahora, el piloto cubre un modelo y un conjunto de puntos de referencia confidenciales. Pero si la evaluación criptográficamente verificada y libre de contaminación se vuelve técnicamente rutinaria, podría cambiar lo que las empresas y los reguladores esperan de cada laboratorio fronterizo, y hacer que "confiar en nuestra puntuación" sea más difícil de vender en un mercado cada vez más basado en afirmaciones verificables.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →