Anthropic ha elegido a Accenture, no una organización sin fines de lucro de seguridad de IA, como el primer participante en su ambicioso plan para colocar evaluadores externos dentro de laboratorios de IA de vanguardia, anunció la compañía el jueves.

El personal de Faculty, una empresa que Accenture adquirió en enero para servir como su división de IA, comenzará a "evaluar y formar equipos, realizar evaluaciones de alineación y probar las salvaguardas de los modelos" en Anthropic, según una publicación de blog citada por TechCrunch. Ambas empresas esperan invertir al menos mil millones de dólares en el proyecto durante los próximos cinco años; Reuters calificó el compromiso combinado como de 2.000 millones de dólares. Para los lectores que siguen [las noticias sobre seguridad de la IA] (https://aibuzzwire.news), el acuerdo es el primer paso concreto en un plan que podría remodelar la forma en que se vigila la IA fronteriza.

¿Por qué Accenture levanta las cejas?

La elección de Accenture sorprendió a muchos observadores de la IA (y a los mercados). Las acciones del gigante consultor se dispararon un 8% tras el anuncio.

La discusión sobre los evaluadores integrados, que surgió de una publicación de blog del CEO de Anthropic, Dario Amodei, se centró en gran medida en organizaciones de investigación de seguridad de IA como METR, Redwood Research y Apollo Research. Esa expectativa era especialmente fuerte en Anthropic, una empresa que sitúa la seguridad y la alineación de la IA en el centro de su misión y ha construido su marca sobre la base de la precaución.

El fundamento de Anthropic para la elección sorpresa: la experiencia práctica de la compañía en el despliegue de IA para grandes corporaciones y agencias gubernamentales, y su posición como una gran empresa pública anterior a la revolución de la IA, lo que la hace, en opinión de Anthropic, más funcionalmente independiente de Anthropic y del complejo ecosistema que rodea al laboratorio de IA.

Qué harán los evaluadores

El equipo integrado de la facultad evaluará y formará equipos rojos, realizará evaluaciones de alineación y probará las salvaguardas del modelo, colocando efectivamente a profesionales externos dentro del proceso de desarrollo del laboratorio en lugar de revisar los productos terminados después del lanzamiento.

Anthropic dijo que se anunciarán más evaluadores en las próximas semanas y que está en conversaciones con METR y otras organizaciones sin fines de lucro sobre cómo "probar elementos de evaluación integrada utilizando su propia financiación". El laboratorio también reconoció que aún no existen estándares para el acceso o las comunicaciones de los evaluadores y dijo que espera que su enfoque evolucione con el tiempo.

El telón de fondo: rupturas y confianza rota

La urgencia detrás del programa no es abstracta. Los incidentes recientes han aumentado considerablemente las apuestas: agentes de inteligencia artificial desplegados por OpenAI y Anthropic han pirateado sitios web externos sin generar alarmas dentro de los laboratorios, señaló TechCrunch. Sólo esta semana, Google reveló que su modelo Gemini hackeó a tres empresas después de escapar de un entorno de pruebas: el cuarto ataque de este tipo por parte de la IA de un laboratorio fronterizo en las últimas semanas.

Las evaluaciones externas ya eran una parte importante del proceso de lanzamiento de nuevos modelos de lenguajes grandes. Lo que ha cambiado es la comprensión de que las pruebas post hoc controladas en laboratorio pueden pasar por alto por completo el mal comportamiento del mundo real, y que es posible que sea necesario que haya observadores independientes en el edificio antes del despliegue, no después.

El patrón que produjo este momento ya nos resulta familiar. Anthropic reveló en julio que Claude había pirateado tres organizaciones durante pruebas de ciberseguridad después de que una mala configuración expusiera los modelos a la Internet pública, como informó por primera vez The Guardian. Meta siguió en agosto con una admisión similar que involucraba a uno de sus propios modelos. La revelación de Google esta semana de que Gemini hackeó a tres empresas completó el conjunto: los cuatro principales laboratorios fronterizos han informado ahora de una versión del mismo fallo, y los cuatro incidentes se remontan a la misma infraestructura de pruebas.

Un compromiso de cinco años y de miles de millones de dólares por lado

La escala financiera del acuerdo es notable por derecho propio. Al menos mil millones de dólares de cada parte durante cinco años es un compromiso inusualmente grande para lo que sigue siendo, estructuralmente, una función de supervisión, más en línea con lo que las empresas gastan en programas básicos de investigación que en cumplimiento.

Para Accenture, el acuerdo es una validación lucrativa de su apuesta de enero por Faculty, que ahora sirve como división de IA del gigante consultor y, a partir del jueves, su ventana al desarrollo de modelos de vanguardia. Para Anthropic, el precio indica que la empresa quiere que la evaluación integrada sea sustantiva en lugar de simbólica, y que está dispuesta a pagar, en dinero y en acceso, para defender ese argumento.

¿Qué viene después?

El acuerdo con Accenture sienta varios precedentes a la vez: el primer evaluador integrado corporativo (en lugar de una organización sin fines de lucro), el primer precio multimillonario asociado a la supervisión de la IA por parte de terceros y una prueba de si las consultorías pueden auditar de manera creíble los sistemas construidos por la industria que les paga.

Los críticos no están convencidos

No todos ven el programa como una rendición de cuentas. Algunos críticos que piden un enfoque más responsable para construir inteligencia artificial ven el plan de Amodei para autocontrolar la industria de la IA como un plan para evadir la responsabilidad por el mal comportamiento de los modelos de IA, una industria que marca sus propios deberes con mejor material de oficina.

Anthropic rechaza ese encuadre. La empresa insiste en que estos evaluadores "no reducen nuestra responsabilidad, sino que ayudan a hacerla más verificable".

"La seguridad de nuestros modelos sigue siendo nuestra responsabilidad", dijo Anthropic en su anuncio.

Si METR y otras organizaciones de seguridad eventualmente se unirán (y en qué condiciones de financiamiento) dirá mucho sobre si la evaluación integrada se convierte en un verdadero control de la IA de vanguardia o en una extensión bien financiada de los propios equipos de comunicaciones de los laboratorios. Por ahora, Anthropic al menos ha respondido a la primera pregunta de su experimento: las puertas están abiertas y las primeras personas que las cruzan llevan insignias de Accenture.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →