Anthropic publicó el sábado un conjunto detallado de automediciones destinadas a permitir que el público, los periodistas y los gobiernos rastreen qué tan rápido se está desarrollando realmente la IA de frontera, incluido un índice, el primero en su tipo, de cuánta investigación propia de la compañía ahora realiza la IA, y la revelación de que aproximadamente 30.000 agentes de IA están realizando trabajos de investigación e ingeniería dentro de la empresa en un momento dado.

La publicación, titulada "Medidas para comprender el ritmo del desarrollo de la IA dentro de los laboratorios fronterizos", llega al centro del argumento más trascendental en la industria: si el desarrollo fronterizo debería frenarse deliberadamente. Dario Amodei ha pedido coordinación para "marcar el ritmo de la frontera", una propuesta que ha sacudido los mercados, ha provocado una demanda de consumidores alegando colusión entre laboratorios importantes y ha llevado al presidente Trump a anunciar una "Fuerza de IA" dedicada a prevenir cualquier desaceleración. El marco de Anthropic es explícito sobre ese contexto: "A medida que el mundo considera desacelerar el ritmo del desarrollo de la IA de vanguardia, el público necesita más información".

Tres medidas para seguir el progreso de la IA

La compañía estableció tres áreas de medición que, según afirma, cualquier laboratorio de vanguardia podría publicar periódicamente:

1. Cuánto de la I+D de IA es realizada por la propia IA. Anthropic creó un prototipo de "Índice de automatización de I+D de Anthropic" catalogando todo tipo de trabajo de investigación y desarrollo de IA realizado en la empresa, calificando qué tan automatizada está actualmente cada tarea y agregando los resultados. Las calificaciones utilizan la escala pública de "Nivel de automatización" de Epoch AI, que va desde AL0 (sin participación de la IA) hasta AL5 (la IA funciona de forma totalmente autónoma sin ningún ser humano en el circuito). En esta escala, AL3 significa que la IA "colabora" (realiza grandes cantidades de trabajo bajo una estrecha dirección humana), mientras que AL4 significa que la IA "lidera", completando la mayor parte de una tarea de principio a fin a partir de un aviso de alto nivel mientras un humano supervisa.

El objetivo del índice es medir qué tan cerca está cualquier laboratorio de la superación personal recursiva: un modelo que construye de forma totalmente autónoma su propio sucesor. Anthropic señala que los modelos que aceleran el desarrollo de la IA "podrían hacer que a los humanos les resulte más difícil comprender o controlar estos sistemas".

2. Qué tan bien se supervisan las acciones de los agentes de IA. Aquí es donde aparece la cifra de 30.000. En agosto de 2026, aproximadamente 30.000 agentes estaban realizando trabajos de investigación e ingeniería al mismo tiempo dentro de la plataforma interna más utilizada de Anthropic, delegando tareas entre sí y trabajando de forma semiautónoma durante largos períodos. La empresa mide tres cosas sobre la supervisión de esos agentes: cobertura (la proporción de acciones de los agentes que pasan por un monitor antes o después de la ejecución), latencia de revisión (la rapidez con la que se revisan las acciones marcadas, primero por un monitor automatizado y luego por un humano) y tasa de escalamiento (la proporción de actividades bloqueadas, redirigidas o marcadas para revisión).

Los datos de seguimiento de Anthropic hasta ahora sugieren que los agentes individuales rara vez se portan mal, pero la compañía advierte que "cuando hay millones o miles de millones de agentes operando en la economía, incluso eventos raros pueden ocurrir regularmente".

3. Cómo se asigna la computación. La tercera medición rastrea cómo se distribuyen los recursos informáticos del laboratorio: la entrada sin procesar que se correlaciona con las capacidades del modelo. Junto con las otras dos métricas, Anthropic sostiene que esto brinda a los externos una forma de correlacionar las entradas del modelo con los resultados del modelo, complementando las evaluaciones de capacidad que la compañía ya publica a través de sus informes de riesgo de Política de Escalamiento Responsable.

Las cifras se moverían en caso de desaceleración

La línea más políticamente señalada en la publicación está dirigida directamente al debate sobre el ritmo: Anthropic afirma que "esperaría que estos números cambiaran si hubiera coordinación en el ritmo de la frontera, como lo pidió el CEO de Anthropic, Dario Amodei". En otras palabras, si la industria realmente se desacelera, estas métricas son la forma en que el público podría verificarlo, y si las empresas afirman estar avanzando mientras sus números siguen aumentando, las mediciones también lo expondrían.

La verificación independiente es la pieza que falta

Anthropic reconoce la debilidad central de las métricas autoinformadas: está utilizando sus propios modelos para evaluar sus propios sistemas, lo que significa que el modelo "juez" podría compartir los puntos ciegos del modelo que se está verificando. La empresa también señala la falta de una metodología común entre los laboratorios, lo que dificulta las comparaciones.

La solución propuesta es incorporar evaluadores externos independientes de múltiples organizaciones dentro de Anthropic, dándoles acceso a procesos, sistemas y datos internos comparables a los que ven los equipos internos de evaluación de riesgos. Esos terceros verificarían las prácticas de seguridad, informarían incidentes y monitorearían las nuevas métricas. La compañía dice que METR, la organización sin fines de lucro de evaluación, anteriormente formó un equipo independiente con su plataforma de monitoreo fuera de línea y que planea publicar estas mediciones regularmente en una forma que otros puedan verificar.

Las mediciones se relacionan con la propuesta más amplia del Marco Avanzado de IA de Anthropic, que establece "reglas de camino" para los lanzamientos de modelos fronterizos, incluidas las obligaciones de transparencia que los gobiernos podrían exigir, como informes de riesgo estandarizados.

Una prueba para toda la industria

La importancia más profunda del puesto puede ser competitiva. Anthropic está desafiando efectivamente a todos los laboratorios fronterizos a publicar las mismas cifras, argumentando que "cualquier desarrollador fronterizo podría publicar estas medidas regularmente, utilizando una metodología pública". Si los rivales declinan, el contraste se convierte en su propio dato en el debate sobre la seguridad; si están de acuerdo, la industria obtendrá el primer criterio común sobre qué tan rápido avanza realmente la IA.

Por ahora, las cifras las proporciona una empresa con un interés evidente en la conversación sobre el ritmo. Pero representan algo de lo que ha carecido el debate: mediciones concretas y repetibles que mostrarían si la frontera se está acelerando, manteniéndose estable o realmente desacelerando.

Manténgase por delante de la IA

Divulgaciones de laboratorios fronterizos como este llegan semanalmente. Para obtener más investigaciones de última hora sobre la IA y cobertura de la industria, siga AI Buzz Wire.

Lea las últimas noticias sobre IA →