Anthropic anunció el martes una importante expansión de sus esfuerzos de acceso a modelos centrados en la seguridad, reestructurando su iniciativa de acceso examinado en un Programa de Verificación Cibernética (CVP) formal con tres niveles distintos para profesionales de la ciberseguridad. La medida se produce cuando la compañía reveló que su iniciativa Proyecto Glasswing ha descubierto al menos 129.000 vulnerabilidades de software verificadas desde abril.
El programa reestructurado permite a los equipos de seguridad examinados ejecutar los modelos más capaces de Anthropic, incluidos Claude Opus 5.5, Claude Sonnet 5.5 y Claude Mythos 5.1, con salvaguardias reducidas y clasificadores de bloqueo, permisos que normalmente no están disponibles para los usuarios generales. Según Anthropic, el objetivo es poner capacidades de IA de vanguardia en manos de los defensores antes de que actores maliciosos utilicen las mismas herramientas como armas. Para más contexto sobre esta historia, consulta nuestra novedades de IA.
Tres niveles de acceso, tres escenarios de amenazas
El nuevo programa se organiza en torno a tres niveles de acceso, cada uno de ellos adaptado a un tipo diferente de trabajo de seguridad:
- Defense Access cubre operaciones defensivas como respuesta a incidentes, ingeniería inversa de malware y análisis y validación de vulnerabilidades.
- Red Team Access agrega pruebas de penetración autorizadas y equipos rojos a los casos de uso defensivos, lo que permite ataques simulados contra sistemas que las organizaciones tienen permiso para probar.
- El Acceso especializado tiene la menor cantidad de salvaguardas y está reservado para un conjunto limitado de organizaciones verificadas que están autorizadas a probar los sistemas de seguridad de IA por sí mismas.
Las organizaciones y los equipos de seguridad individuales solicitan el nivel que coincida con su trabajo, y Anthropic revisa cada aplicación antes de otorgar acceso. La compañía dijo que los tres niveles incluyen acceso a sus modelos insignia actuales, así como a los nuevos modelos lanzados en el futuro.
Las salvaguardias siguen vigentes: selectivamente
Anthropic combinó el anuncio con datos de evaluación destinados a mostrar que el sistema de niveles separa el trabajo defensivo benigno de la capacidad genuinamente peligrosa. En una evaluación de CyScenarioBench sobre Claude Opus 5.5, la compañía informó que las salvaguardas bloquearon 46 de 50 tareas en el nivel de Acceso de Defensa. En el nivel Red Team Access del mismo modelo, ninguna de las tareas se bloqueó y el modelo completó 34 de 50, la misma tasa de finalización registrada cuando no se aplicó ninguna protección.
Por el contrario, sin acceso al CVP, todas las tareas se bloqueaban en el primer mensaje, según Anthropic.
"Estas evaluaciones nos dan confianza en que podemos poner a disposición de un conjunto más amplio de defensores capacidades cibernéticas avanzadas de forma segura, ampliando los esfuerzos defensivos que iniciamos con el Proyecto Glasswing", dijo la compañía en su anuncio, que fue ampliamente reportado por The Hacker News, Reuters y SecurityWeek.
El diseño refleja una apuesta a que la mayor parte del trabajo de seguridad defensiva (parches, análisis de registros, clasificación de malware) puede realizarse bajo estrictas barreras de seguridad, mientras que las pruebas ofensivas legítimas necesitan un corredor más amplio. También refleja cómo la industria de la seguridad ha manejado durante mucho tiempo las herramientas de doble uso: examinar al profesional, no solo a la herramienta.
La huella en expansión de Glasswing
La expansión del programa está estrechamente relacionada con el Proyecto Glasswing, la iniciativa de Anthropic para aplicar sus modelos al fortalecimiento del software crítico. La compañía dijo que Glasswing descubrió al menos 129.000 vulnerabilidades de software verificadas entre abril y julio de 2026, y 5.500 vulnerabilidades verificadas adicionales entre abril y octubre mediante esfuerzos de escaneo de código abierto.
De las vulnerabilidades verificadas, más de 33.000 han sido clasificadas hasta ahora como críticas o de alta gravedad, una cifra que Anthropic describe como probablemente un recuento insuficiente, ya que se basa en datos de encuestas de sólo un subconjunto de socios de Glasswing. La empresa estima que el impacto real podría ser al menos cinco veces mayor.
Una visión medida del descubrimiento de vulnerabilidades impulsado por IA
Un análisis independiente sugiere que la avalancha de fallas encontradas en la IA no se traduce directamente en una ola equivalente de infracciones explotadas. En un análisis publicado a finales del mes pasado, el investigador de VulnCheck, Patrick Garrity, descubrió que sólo 2 de las 300 vulnerabilidades descubiertas por Anthropic o Project Glasswing (aproximadamente el 0,67 por ciento) han sido explotadas en la naturaleza.
Las dos fallas explotadas son CVE-2026-26980, una vulnerabilidad de inyección SQL en Ghost CMS, y CVE-2026-61500, una falla de falsificación de sesión en Rejetto HTTP File Server. Los datos respaldan un matiz que los investigadores de seguridad han estado enfatizando: la IA está reduciendo la barrera para el descubrimiento de vulnerabilidades, pero la mayoría de las fallas que descubre nunca estuvieron en los radares de los atacantes.
El anuncio también llega en medio de un debate más amplio sobre el trabajo de seguridad generado por IA. La investigación de 1Password y Veracode ha demostrado que los parches de vulnerabilidad escritos por IA pueden introducir nuevos fallos, lo que subraya que la automatización ayuda, pero no reemplaza, la verificación humana.
Qué significa para la industria de la seguridad
Para los equipos de seguridad, el CVP reduce la energía de activación para utilizar modelos de frontera en trabajos defensivos reales. Los equipos de respuesta a incidentes obtienen un camino autorizado hacia la asistencia en el análisis de malware; los evaluadores de penetración obtienen un entorno gobernado para ataques asistidos por IA; y el pequeño conjunto de organizaciones que auditan los sistemas de seguridad de IA reciben el acceso menos restringido.
Para Anthropic, el programa es a la vez una estrategia de seguridad y comercial. Concreta la posición de la compañía de que las poderosas capacidades cibernéticas deberían liberarse deliberadamente, a defensores examinados, en lugar de suprimirlas por completo, en contraste con sus rivales que han enfrentado el escrutinio por modelos con controles cibernéticos más débiles. También profundiza las relaciones de Anthropic con las empresas que tienen más probabilidades de pagar por el acceso al modelo fronterizo: gobiernos, operadores de infraestructura crítica y grandes proveedores de seguridad.
La compañía no anunció cambios de precios relacionados con el programa y las solicitudes se procesan a través de los canales de acceso examinados existentes de Anthropic. Dada la escala de lo que Glasswing ya ha revelado (y la propia admisión de la compañía de que las cifras probablemente subestiman la realidad), la industria de la seguridad estará observando cuántos de esos 129.000 hallazgos se solucionan antes de que los atacantes los encuentren primero.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →