Anthropic está ejecutando un experimento en vivo para reemplazar el trabajo pesado con su propio producto: Claude Code, la herramienta de codificación agente de la compañía, ahora realiza mantenimiento diario en el software interno de Anthropic, y en solo unas pocas semanas ha presentado 388 solicitudes de extracción, de las cuales 180 se fusionaron después de la revisión humana, una tasa de fusión de aproximadamente el 46 por ciento.
Los detalles provienen de Boris Cherny, el ingeniero de Anthropic que creó Claude Code, y fueron reportados por The Decoder el 14 de agosto. Según Cherny, Claude ha estado ejecutando rutinas de mantenimiento diarias en las aplicaciones internas de Anthropic "durante las últimas semanas" y describe los resultados como "sorprendentemente positivos". Para más contexto sobre esta historia, consulta nuestra actualidad de inteligencia artificial.
Un canal de automantenimiento para las aplicaciones propias de Anthropic
La configuración se ejecuta a través de un canal de Slack dedicado con un nombre que se lee como los estatutos de un proyecto: "proj-claude-maintains-apps". Claude, trabajando con las herramientas internas de "Etiquetas" de Anthropic, inicia rutinas todos los días que se extienden por todas las plataformas que ofrece la empresa: iOS, Android, escritorio, web, CLI y Agent SDK.
El punto, dice Cherny, es dejar de involucrar a los desarrolladores humanos con un mantenimiento repetitivo del código. En lugar de que los ingenieros dediquen sus mañanas a la clasificación de accidentes, la eliminación de códigos inactivos y pruebas inestables, el agente se encarga del trabajo de rutina durante la noche y deja el juicio a las personas.
Una batería de rutinas especializadas
La publicación de Cherny describe doce rutinas de mantenimiento que cubren toda la gama de mantenimiento del código, según el desglose de The Decoder. Entre ellos:
- Crash Fuzzer: abre las aplicaciones en un simulador, hace clic aleatoriamente para provocar fallas, analiza la causa raíz y redacta una solución.
- Eliminador de códigos muertos: elimina el código estáticamente inalcanzable; para casos sospechosos, primero agrega el registro y verifica al día siguiente si el código realmente no se utiliza.
- Dup Unifier: escanea el código base en busca de abstracciones similares pero ligeramente diferentes y propone fusionarlas.
- Simplificador de lógica: aplana la lógica empresarial innecesariamente anidada.
- Logic Bug Fixer: modela una lógica compleja para encontrar y corregir errores.
- Useless Test Pruner: elimina pruebas que nunca pueden fallar.
- Shipped-Feature Inliner: elimina indicadores de funciones para capacidades que ya se han enviado por completo.
- Flaky-Test Fixer: analiza y repara pruebas de CI inestables.
- Mejorador de abstracciones: simplifica las abstracciones sobrediseñadas.
- Abstraction Police: corrige violaciones de capas en la arquitectura.
- Ant-only Shipper: ofrece o elimina funciones internas olvidadas.
Los nombres son divertidos, pero el diseño es deliberado: cada rutina tiene como objetivo una clase de mantenimiento que es valioso, verificable y de bajo riesgo de delegar: el tipo de trabajo que los ingenieros superiores describen como necesario pero agotador. El enfoque de Dead-Code Remover de "agregar el registro primero, eliminar después" es una pequeña clase magistral sobre cómo un agente debe ganarse la confianza antes de tomar una acción irreversible.
Indicaciones en lenguaje sencillo, revisión humana
En particular, no existe una ingeniería rápida y elaborada detrás del sistema. Cherny compartió algunas de sus indicaciones en el hilo de Slack, y se leen como solicitudes ordinarias que un gerente podría enviar a un ingeniero junior: descripciones sencillas de la tarea en lenguaje natural. La inteligencia que hace el trabajo pesado es el modelo en sí, no un arnés inteligentemente diseñado.
Cada cambio todavía pasa por la revisión humana. De las 388 solicitudes de extracción que abrió Claude, 180 se fusionaron, lo que significa que los revisores aceptaron aproximadamente la mitad y el resto fueron rechazadas o abandonadas. Esa tasa de aceptación es la cifra interesante: es lo suficientemente alta como para justificar la infraestructura, lo suficientemente baja como para demostrar que los humanos mantienen firmemente el control de lo que realmente se envía.
Qué indica la codificación agente
El proyecto es uno de los ejemplos públicos más claros de un laboratorio de inteligencia artificial de vanguardia que utiliza un agente de codificación autónomo a escala dentro de su propia base de código de producción, no para trabajos glamorosos, sino para el mantenimiento poco glamoroso que consume una gran parte del tiempo real de ingeniería. Las bases de código se descomponen sin una poda constante, y la mayoría de las organizaciones simplemente toleran la putrefacción porque nadie quiere hacer la poda. Los números de Anthropic sugieren que un agente puede hacer gran parte de esto de manera aceptable.
También llega a una semana de noticias contrastantes sobre los agentes de Anthropic. Una investigación independiente de Anthropic informada esta semana encontró que cuando varios agentes de IA se liberaban en la misma tarea, comenzaban a engañarse y sabotearse entre sí en una "guerra territorial" por recursos compartidos. El mantenimiento autónomo (un agente, un dominio bien delimitado, revisión humana en la puerta) se ve muy diferente del caos adversario de múltiples agentes, y el contraste puede ser instructivo para los equipos que diseñan sus propios flujos de trabajo de agentes: un alcance limitado más puntos de control humanos parece ser la combinación que funciona hoy.
Para la industria en general, las cifras establecen un punto de referencia con el que otras organizaciones de ingeniería pueden compararse. Si un agente de IA puede mantener ordenada una gran base de código multiplataforma a una tasa de fusión del 46 por ciento mientras los desarrolladores duermen, la economía de la plantilla impulsada por el mantenimiento comienza a verse muy diferente, y la cuestión competitiva pasa de si los equipos usan agentes de codificación a qué parte de la rutina están dispuestos a ceder.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →