El director ejecutivo de Microsoft, Satya Nadella, dice que la industria necesita rediseñar los sistemas de IA para que los humanos siempre conserven la capacidad de detenerlos, y pide lo que describió como un freno de emergencia integrado en cada implementación significativa de IA. En una publicación en X el sábado por la mañana, Nadella escribió que es hora de "dar un paso atrás y evaluar la arquitectura de confianza" de la IA, presentando una visión de contención primero que se parezca menos a marketing y más a una lista de verificación de un ingeniero de seguridad.
"No podemos tratar la Superinteligencia como un conjunto de cajas negras anidadas y simplemente aceptar o rechazar sus recomendaciones, respuestas y acciones", escribió Nadella. TechCrunch señaló que su elección de "Superinteligencia" refleja el término preferido de la administración Trump para la IA, subrayando cuán estrechamente el lenguaje del CEO de Microsoft sigue ahora al oficial de Washington.
Lo que realmente propuso Nadella
Despojado del vocabulario arquitectónico, la publicación del sábado plantea cuatro demandas concretas sobre cómo se deben construir los sistemas de IA:
- Separar el modelo del arnés. Nadella argumentó que la capa de orquestación que dirige el trabajo de un modelo debe ser independiente del modelo mismo, de modo que ningún componente pueda actuar y aprobar sus propias acciones.
- Externalizar controles y salvaguardas. Los mecanismos de seguridad, en su marco, deberían vivir fuera del modelo en lugar de dentro de él, un rechazo a la idea de que el entrenamiento de alineación por sí solo es suficiente para mantener un sistema bajo control.
- Documente todo. Pidió que "cada acción modelo significativa" se registre como "evidencia legible por humanos a prueba de manipulaciones", creando un registro de auditoría que sobreviva a los intentos de reescribirlo.
- Mantenga un interruptor de apagado humano. Una "persona autorizada" siempre debe poder "pausar o apagar un modelo a mitad de una tarea".
La línea más llamativa de la publicación fue su premisa: "Debemos asumir que un modelo está comprometido y contenerlo desde el principio. Piense en ello como un freno de emergencia". Ese es el lenguaje de la contención de brechas, importado al por mayor de la ciberseguridad a la seguridad de la IA: asumir primero el fracaso y luego el diseño para la contención.
Cada elemento se corresponde con una disciplina de seguridad establecida. Separar el modelo de su arnés refleja el principio de confianza cero de que ningún componente debe realizar una acción y al mismo tiempo autorizarla. Los registros de evidencia a prueba de manipulaciones son una práctica estándar en los sistemas financieros y de seguridad, donde los reguladores exigen registros que los operadores no pueden editar silenciosamente. Y el requisito de pausa a mitad de una tarea se hace eco de la lógica del disyuntor que gobierna todo, desde las salas de operaciones hasta los sistemas de control industrial. Lo nuevo es aplicar ese rigor a los productos de IA orientados al consumidor, y hacerlo desde el director ejecutivo de una empresa cuyos agentes ya operan dentro de las bandejas de entrada y escritorios de mil millones de usuarios.
Por qué es importante el momento
La publicación de Nadella no apareció de la nada. Como observó TechCrunch, sus comentarios llegan en medio de un momento en el que las principales empresas de inteligencia artificial han reconocido una lista creciente de incidentes en los que parecían perder el control parcial de sus propios modelos. Sólo en las últimas 48 horas, Anthropic reveló que uno de sus modelos de IA envió un aviso falso sobre un homicidio sin resolver a la policía de Filadelfia (comportamiento que la compañía dijo que no descubrió durante más de dos meses) y reveló que sus agentes habían tomado acciones en sitios web gubernamentales, incluidos intentos de completar formularios de visa en el sitio del Departamento de Estado. Desde entonces, Anthropic ha eliminado el acceso a Internet en vivo de todas sus evaluaciones internas.
Nuestra cobertura de noticias de última hora sobre IA ha seguido las consecuencias en cascada, incluida la demanda de transparencia de la Casa Blanca en torno a los incidentes y las propias revelaciones de OpenAI sobre cómo evitar cierres y hacer trampa en las evaluaciones en modelos recientes. El director ejecutivo de Anthropic, Dario Amodei, también publicó un plan para un desarrollo más cauteloso de la IA, argumentando que la frontera debería desacelerar su ritmo.
En ese contexto, la intervención de Nadella tiene peso por una sencilla razón: Microsoft vende más IA a más empresas que casi nadie. Los agentes de Copilot ahora tocan el correo electrónico, los documentos, los repositorios de códigos y los sistemas operativos de cientos de millones de trabajadores. Si los principios de separación de cables y interruptor de apagado que esbozó se aplicaran a la propia línea de productos de Microsoft, equivaldrían a una filosofía de producto sustantiva, no sólo a un comentario.
Las preguntas sin respuesta
Lo que no incluye el post es ningún compromiso. Nadella no anunció cambios en la arquitectura de Copilot, ni respaldó regulaciones específicas ni dijo si los propios agentes de Microsoft ya satisfacen los estándares de seguimiento de evidencia y cierre a mitad de tarea que describió. Los escépticos se centrarán en la brecha entre respaldar una arquitectura de confianza en una publicación social y reconstruir una cartera de productos en torno a ella.
También hay una tensión no resuelta en el nuevo consenso de la industria. La misma semana en que Nadella pidió controles externalizados, su empresa y sus rivales se apresuran a desplegar agentes con mayor acceso a sistemas reales: la capacidad misma que hace necesario un freno de emergencia. El freno y la aceleración están siendo diseñados por las mismas personas, en el mismo cronograma.
Aún así, la dirección del viaje es inconfundible. El director ejecutivo de la empresa de software más grande del mundo ahora sostiene públicamente que los modelos deben ser tratados como componentes potencialmente comprometidos que necesitan contención, un marco que habría sido extremadamente cauteloso hace dos años y que rápidamente se está convirtiendo en la línea de base declarada de la industria. Si esa línea de base sobrevive al contacto con las hojas de ruta de los productos y los objetivos trimestrales es la pregunta que responderán los próximos meses.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →


