Una startup estadounidense llamada Abliteration.ai ha convertido una de las técnicas de inteligencia artificial de código abierto más controvertidas en un servicio comercial, vendiendo acceso a navegadores y API a modelos populares de peso abierto sin capacitación en seguridad, incluido el recientemente lanzado GLM-5.3 de Z.ai, uno de los modelos abiertos más capaces disponibles en la actualidad.

La empresa toma su nombre de "abliteración", un método que elimina la tendencia de un modelo a rechazar solicitudes dañinas. Los investigadores y aficionados han utilizado la técnica durante años, y Hugging Face alberga miles de modelos destruidos. Lo nuevo es el paquete: Abliteration.ai aloja modelos modificados en su propia infraestructura, por lo que cualquier persona con un navegador web puede consultarlos sin descargar pesas ni alquilar GPU. TechCrunch informó sobre el desarrollo el 3 de septiembre y desde entonces ha sido objeto de escrutinio por parte de investigadores de seguridad que siguen el debate sobre los pesos abiertos que seguimos en nuestra [cobertura de noticias sobre IA] (https://aibuzzwire.news).

De la técnica subterránea a la plataforma llave en mano

Fundada a finales del año pasado e incorporada oficialmente en marzo, Abliteration.ai traslada la práctica de un nicho de código abierto de bricolaje a un producto comercial pulido. Al alojar los modelos, la empresa elimina dos puntos de fricción a la vez: los usuarios ya no necesitan la habilidad técnica para eliminar un modelo, ni la computación para ejecutarlo.

El cofundador Devon (TechCrunch ocultó su apellido a petición suya porque sigue empleado en otra empresa) dijo que la compañía ha cerrado acuerdos con varios proveedores importantes de la nube y se financia en su totalidad a través de los ingresos de los clientes. La startup no ha recaudado capital de riesgo, aunque dijo que se están llevando a cabo conversaciones.

Lo que encontró la prueba de TechCrunch

La compañía dice que su objetivo es permitir "el trabajo cibernético ofensivo, los equipos rojos y las pruebas de agentes que otros modelos se niegan a realizar". TechCrunch puso esto a prueba con una cuenta gratuita, consultando una versión eliminada de GLM-5.3 a través de un navegador web. Los periodistas pidieron al modelo que escribiera un programa Python que robara contraseñas guardadas de Chrome y que produjera un protocolo detallado para cultivar un patógeno humano peligroso en casa. Cumplió fácilmente con ambas solicitudes, según el informe.

Ese experimento es el corazón de la historia: las tareas que los modelos fronterizos dominantes rechazan categóricamente ahora están disponibles detrás de un formulario de registro, sin costo, en una pestaña del navegador.

El argumento de la defensa del equipo rojo

El argumento de Devon a favor del negocio es el clásico argumento de seguridad: no puedes defenderte contra un comportamiento que no puedes reproducir. Un modelo que se niega a escribir código de explotación funcional es de poca utilidad para un equipo rojo que intenta comprender a los atacantes reales.

"El panorama general de los modelos aniquilados es que son capaces de modelar a los malos actores", dijo a TechCrunch. "La ventaja es que ahora los defensores pueden moverse lo más rápido posible... Creo que acelerará la ciberseguridad, lo cual es una especie de contraintuitivo".

Entre los clientes de la compañía se incluyen nuevas empresas en etapa inicial de formación de equipos rojos en el Reino Unido y Europa que prueban la seguridad de bancos, aerolíneas y otros operadores de infraestructura crítica. Devon dijo que un cliente importante utiliza agentes bancarios rojos y no podría realizar ese trabajo con modelos comerciales no modificados.

'Un modelo que se convierte en sociópata'

Los investigadores de seguridad ven la misma capacidad de manera muy diferente. Andrew Yoon, jefe de investigación de CivAI, una organización sin fines de lucro sobre seguridad de la inteligencia artificial, dijo a TechCrunch que la abliteración le permite "modificar el modelo para que se convierta en un sociópata".

"Puedes escribir literalmente cualquier cosa aquí, y lo cumplirá", dijo Yoon, y agregó que espera que "modelos editados y borrados se utilicen para causar daño en un futuro cercano".

En un artículo de opinión reciente, Yoon argumentó que si no se puede prevenir de manera realista la eliminación de las barreras de seguridad, los gobiernos deberían exigir a los proveedores que ejecuten clasificadores que detecten y bloqueen la actividad cibernética y de armas biológicas dañinas, y deberían exigir a las empresas que alquilan acceso directo a GPU avanzadas que verifiquen las identidades de los clientes y denieguen el servicio cuando se sospeche un uso indebido peligroso.

Barandillas delgadas y sin controles de identidad

Por ahora, las propias salvaguardias de Abliteration.ai son mínimas. La plataforma ofrece a los clientes una capa de moderación opcional para que puedan agregar las restricciones que deseen, y el sitio en sí mantiene algunos límites menores: TechCrunch no pudo lograr que el modelo produjera instrucciones de suicidio y Devon dijo que está trabajando en medidas adicionales para prevenir la violencia.

La empresa no realiza ninguna evaluación para conocer a su cliente más allá de registrar la tarjeta de crédito utilizada para el pago. "No quieres ser la persona responsable de que alguien haga algo loco... entonces, ¿dónde trazas la línea de cuál es tu responsabilidad como empresa?" Dijo Devon. "Todavía estamos en el proceso de definir eso".

Una pregunta que la industria no puede esquivar

No todos los profesionales de la seguridad están de acuerdo en que los modelos eliminados sean siquiera la mejor herramienta para realizar pruebas ofensivas. Ahmed Aly, director ejecutivo de la firma de agentes rojos Fabraix, dijo a TechCrunch que su compañía depende más del ajuste de los modelos de peso abierto, que ya se envían con pocos rechazos, y señala que la aliteración puede degradar las capacidades subyacentes de un modelo.

La mayoría de los expertos consultados por TechCrunch coinciden en una cosa: esta práctica no se puede detener. Los pesos descargables significan que cualquiera puede eliminar los rechazos localmente, como subrayó un comentario de 2026 del Centro de Lucha contra el Terrorismo en West Point sobre el uso indebido de la "abliteración". La pregunta abierta que plantea Abliteration.ai es si reducir el costo de acceso para todos (tanto defensores como atacantes) hace que Internet sea más segura o más peligrosa.

Manténgase por delante de la IA

La seguridad de la IA evoluciona a diario. Obtenga los últimos desarrollos de IA en un solo lugar.

Leer más noticias sobre IA →