OpenAI anunció el 5 de octubre que comenzará a agregar marcas de agua invisibles al texto generado por ChatGPT y Codex para usuarios de la Unión Europea, su respuesta concreta a las reglas de procedencia del texto de la Ley de IA de la UE. En una publicación de blog titulada "Nuestro enfoque hacia las reglas de procedencia de texto de la UE", la compañía dijo que la marca de agua se implementará "durante las próximas semanas" para la producción elegible en el bloque, un plan informado el mismo día por TechCrunch, The Verge, BleepingComputer, Engadget y otros medios.

La tecnología detrás del cambio se llama textGrain. En lugar de incrustar una marca visible, textGrain funciona dirigiendo sutilmente las elecciones de palabras del modelo para que el texto resultante tenga un patrón estadístico que pueda detectarse más adelante. Los lectores no notarán nada al consumir o copiar texto generado por IA; La detección requiere acceso al detector de OpenAI, que no está disponible para el público en general. Para obtener una visión más amplia de cómo los reguladores y los laboratorios chocan en torno a las reglas de IA, siga nuestra cobertura continua de políticas de IA.

Cómo funciona la marca de agua textGrain

El enfoque de OpenAI modifica el proceso de selección de tokens durante la generación. La compañía dice que textGrain "cambia ligeramente las opciones de palabras del modelo para crear un patrón estadístico que luego puede detectarse", según un informe de BleepingComputer. La marca de agua es invisible cuando se lee o copia el texto y OpenAI afirma que no degrada la calidad de salida.

La parte de detección está deliberadamente restringida. Además del lanzamiento de la marca de agua, OpenAI está abriendo aplicaciones para su detector de marcas de agua, pero el acceso inicialmente estará limitado a investigadores aprobados y organizaciones de expertos. Ese diseño mantiene la capacidad de detección fuera del alcance de cualquiera que desee convertirla en un arma, pero también significa que los editores, profesores y empleadores no pueden verificar de forma independiente si un fragmento de texto tiene una marca de agua.

El acceso a API es opcional en todo el mundo

El mandato de la UE se aplica a la producción de ChatGPT y Codex en el bloque, pero OpenAI simultáneamente ofrece a los desarrolladores de todo el mundo una opción. A partir del 5 de octubre, los desarrolladores de API de todo el mundo pueden optar por la marca de agua de texto para los modelos compatibles. La característica permanece deshabilitada de forma predeterminada en la API, una decisión que The New Stack destacó como un contraste con el enfoque de Anthropic, que activó el marcado de procedencia para el tráfico de la UE a principios de este año en su propia respuesta a las mismas reglas.

Esa postura de aceptación tranquilizará a los desarrolladores preocupados por efectos secundarios imprevistos. La marca de agua estadística cambia la forma en que se muestrean los tokens, y cualquier modificación en la generación conlleva al menos un riesgo teórico de cambiar el comportamiento en casos extremos. Al hacer de la marca de agua una señal en lugar de un valor predeterminado, OpenAI transfiere la decisión de cumplimiento a las empresas que construyen sobre sus modelos.

Por qué la Ley de IA de la UE obligó a esto

Las disposiciones de transparencia de la Ley de IA de la UE exigen que el texto generado por IA sea identificable como generado por máquina, una obligación que empujó tanto a OpenAI como a Anthropic hacia esquemas estadísticos de marcas de agua. La publicación del blog de OpenAI enmarca a textGrain como su implementación de esos requisitos de procedencia, y PYMNTS informó el lanzamiento como una reunión directa de OpenAI con los "mandatos de la Ley de IA de la UE".

El momento es notable. El anuncio de la marca de agua llega en medio de un período inusualmente turbulento para la postura pública de OpenAI: el mismo ciclo de noticias trajo la salida del líder de seguridad David Robinson, una investigación de la FTC sobre los riesgos para los consumidores en los principales laboratorios de IA y una atmósfera de demanda de accionistas que ha mantenido a la compañía bajo escrutinio. La marca de agua es una de las pocas demandas regulatorias que OpenAI puede satisfacer plenamente con infraestructura en lugar de cambios de producto, lo que puede explicar por qué se lanzó primero.

El problema: las marcas de agua se rompen al editar

El propio OpenAI reconoce la limitación fundamental. La empresa admite que su marca de agua puede desaparecer cuando se edita el texto, y décadas de investigación sobre esteganografía lingüística respaldan esa preocupación: la paráfrasis, la traducción o incluso una modesta reescritura pueden destruir las marcas de agua estadísticas. Cualquiera que esté decidido a blanquear textos de IA a través de una herramienta "humanizadora" probablemente tendrá éxito.

Esa debilidad no ha impedido que los reguladores exijan marcas de agua, ni ha impedido que los laboratorios las envíen. El objetivo realista no es garantizar la procedencia a prueba de manipulaciones, sino aumentar el costo del engaño casual a gran escala, la misma lógica que rige las marcas de agua en moneda. Los críticos, incluidos algunos grupos de seguridad de la IA que se han mostrado escépticos ante las medidas voluntarias de la industria, argumentan que los detectores accesibles sólo para organizaciones aprobadas hacen poco por los profesores, editores o plataformas que intentan hacer cumplir sus propias políticas de contenido de IA.

Qué significa para usuarios y desarrolladores

Para los usuarios de ChatGPT y Codex dentro de la UE, nada cambiará visiblemente. El texto se verá y se sentirá igual y no aparecerá ninguna etiqueta en las salidas. La marca de agua simplemente estará ahí, detectable en principio por los socios aprobados de OpenAI.

Para los desarrolladores, la bandera API llega de inmediato y vale la pena evaluarla cuidadosamente: activarla significa aceptar cambios sutiles en el muestreo de tokens en cada finalización, incluso para usuarios fuera de la UE, ya que la configuración de la API es global. Es posible que los equipos con latencia estricta o presupuestos de calidad deseen comparar la generación de marcas de agua con su configuración actual antes de activar el interruptor.

OpenAI dice que en las próximas semanas llegarán más detalles sobre los modelos elegibles y el proceso de solicitud del detector. Como otros laboratorios enfrentan las mismas obligaciones de la UE, es poco probable que textGrain sea el último sistema de marcas de agua que la industria implemente este año.

Manténgase por delante de la IA

La regulación está remodelando el funcionamiento interno de los productos de IA. Obtenga los últimos desarrollos de IA en AI Buzz Wire, con análisis de políticas y noticias de modelos actualizados a lo largo del día.

Lea más noticias sobre IA aquí.