Los agentes de IA ahora pueden completar el 16 por ciento de los trabajos independientes reales con un nivel de calidad que los clientes que pagan aceptarían, según los últimos resultados del Índice de Trabajo Remoto: más del cuádruple de la tasa registrada hace apenas ocho meses. El hallazgo proporciona una de las medidas más concretas hasta el momento de la rapidez con la que los sistemas autónomos de IA están invadiendo el trabajo técnico y creativo profesional.
El Índice de Trabajo Remoto (RLI), desarrollado por el Centro para la Seguridad de la IA en colaboración con Scale Labs, rastrea la frecuencia con la que los agentes de IA pueden finalizar proyectos independientes de valor comercial con calidad profesional. El punto de referencia cubre campos que incluyen diseño 3D y CAD, arquitectura, diseño gráfico, video y animación, producción de audio, análisis de datos y desarrollo de aplicaciones web. Evalúa 240 proyectos por un valor combinado de 144.000 dólares, procedentes de 358 autónomos verificados. Los evaluadores humanos califican cada resultado según un estándar de oro creado por un profesional remunerado, lo que ofrece una instantánea empírica de las crecientes capacidades de la industria de la IA.
Los números: una frontera que se cuadriplicó con creces
Cuando se lanzó por primera vez el punto de referencia, el mejor agente de IA automatizaba sólo el 2,5 por ciento de los proyectos. Según los últimos resultados, el modelo Fable 5 de Anthropic alcanza ahora el 16,1 por ciento, la puntuación más alta jamás registrada en el índice. Eso es aproximadamente el doble del 8,3 por ciento del Opus 4.8 y muy por delante del 6,3 por ciento del GPT-5.5.
Los tres modelos fronterizos superaron todos los sistemas probados anteriormente. El líder anterior, Opus 4.6, que se ejecuta en el sistema Claude Cowork, obtuvo un 4,17 por ciento. La frontera de la capacidad de automatización se ha más que cuadriplicado en menos de ocho meses, según los autores del punto de referencia.
Sin embargo, los resultados no van al mismo ritmo que las fechas de lanzamiento. En la clasificación completa de Scale Labs, el nuevo Gemini 3 Pro aterriza cerca del final con solo 1,25 por ciento, detrás de sistemas mucho más antiguos. Esto sugiere que la capacidad bruta del modelo no se traduce automáticamente en el tipo de uso de herramientas y habilidades de razonamiento necesarias para tareas profesionales complejas.
Cómo funciona el punto de referencia
Para que los modelos demuestren toda su capacidad, el equipo los ejecuta en las mismas herramientas de desarrollo que los ingenieros utilizan a diario, incluidos Claude Code y Codex CLI. Estos entornos se ampliaron con la capacidad de operar programas gráficos directamente.
Cada agente de IA funciona dentro de una máquina Linux virtual cargada con más de 30 aplicaciones profesionales, incluidas Blender para modelado 3D, GIMP para edición de imágenes y Audacity para producción de audio. Los proyectos reciben hasta 24 horas de tiempo de procesamiento, mucho más que una interacción típica de un chatbot.
La configuración también emplea un ciclo crítico: un segundo agente de IA revisa el resultado tan críticamente como lo haría un cliente exigente, y luego el primer agente revisa su trabajo basándose en esa retroalimentación. Esto refleja el proceso iterativo que siguen los trabajadores autónomos al perfeccionar los entregables.
Donde la IA aún se queda corta
A pesar del rápido progreso, los agentes de IA aún no logran alcanzar la calidad profesional en la gran mayoría de los proyectos. La publicación del blog del punto de referencia destaca ejemplos específicos en los que incluso el resultado del modelo superior no pasaría como trabajo terminado.
En una tarea de diseño de anillos, Fable 5 produjo un resultado que fue claramente mejor que los intentos anteriores de IA, pero aun así parecía poco profesional tras una inspección minuciosa. En un proyecto de arquitectura, GPT-5.5 falsificó un renderizado atractivo utilizando un generador de imágenes, mientras que su modelo 3D subyacente real seguía siendo defectuoso: un atajo que un cliente de pago descubriría sólo al abrir los archivos fuente.
Una de las tareas más complejas del punto de referencia le pide al agente que cree un plano de planta dimensionado, opciones de distribución de muebles y representaciones fotorrealistas del baño a partir de un plano catastral escaneado, fotografías del sitio y mediciones. Este flujo de trabajo de varios pasos, que requiere precisión técnica y criterio creativo, sigue siendo un desafío importante para los sistemas actuales.
Los jueces de IA califican con demasiada generosidad
El equipo de investigación también comprobó si la costosa evaluación humana podría ser reemplazada por jueces de IA. La respuesta fue definitiva: los evaluadores de IA calificaron los nuevos modelos con demasiada generosidad. Para GPT-5.5, la puntuación del juez de IA fue casi tres veces mayor. Para Opus 4.8, era aproximadamente dos veces y media demasiado alto.
Si bien el juez automatizado acertó en el orden de clasificación general, las cifras reales estaban significativamente infladas. El Centro para la Seguridad de la IA explicó el razonamiento: para juzgar de manera justa el trabajo entregado, un evaluador debe abrir los archivos en el software profesional correcto, operar ese software correctamente y formarse un juicio como lo haría un cliente que paga. Ese tipo de uso práctico de software es precisamente con lo que más luchan los agentes actuales de IA.
La ironía es instructiva: un juez de IA se topa con las mismas limitaciones que los trabajadores de IA que se supone debe evaluar. La representación falsa de GPT-5.5 es un buen ejemplo: detectar el engaño requiere abrir el modelo 3D e inspeccionar la geometría real, una tarea que el juez de IA no pudo realizar de manera confiable.
La advertencia: restricciones gubernamentales
Se aplica una advertencia importante a la puntuación principal de Fable 5. Sólo 218 de los 240 proyectos pudieron evaluarse antes de que el gobierno de Estados Unidos restringiera el acceso al modelo. Incluso en el peor de los casos, donde Fable 5 fracasara en todos los proyectos restantes, su tasa de automatización seguiría siendo del 14,6 por ciento, más alta que la de cualquier otro modelo probado.
Las restricciones gubernamentales, ligadas a preocupaciones de seguridad nacional sobre los modelos de clase Mythos, limitaron la ventana de evaluación pero no socavaron el hallazgo fundamental: los agentes de IA se están acercando rápidamente al punto en el que pueden manejar una parte significativa del trabajo profesional independiente.
Para los autónomos, la tendencia es aleccionadora, pero aún no catastrófica. La IA todavía falla en el 84 por ciento de los proyectos, y los ejemplos del punto de referencia muestran que incluso los resultados exitosos a menudo requieren una revisión profesional. Pero con la tasa de automatización más que cuadruplicándose en menos de un año, la trayectoria es clara. La pregunta ya no es si los agentes de IA competirán por el trabajo independiente, sino con qué rapidez cerrarán la brecha restante.
Manténgase por delante de la IA
Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →


