Anthropic sta conducendo un esperimento dal vivo per sostituire il lavoro pesante con il proprio prodotto: Claude Code, lo strumento di codifica ad agenti dell'azienda, ora esegue la manutenzione quotidiana del software interno di Anthropic - e in poche settimane ha presentato 388 richieste pull, di cui 180 sono state unite dopo la revisione umana, un tasso di fusione di circa il 46%.
I dettagli provengono da Boris Cherny, l'ingegnere di Anthropic che ha creato Claude Code, e sono stati riportati da The Decoder il 14 agosto. Secondo Cherny, Claude ha eseguito routine di manutenzione quotidiana sulle app interne di Anthropic "nelle ultime settimane" e descrive i risultati come "sorprendentemente positivi". Per maggiori informazioni su questa storia, consulta la nostra notizie sull'IA.
Una pipeline di automanutenzione per le app di Anthropic
La configurazione avviene attraverso un canale Slack dedicato con un nome che si legge come una carta del progetto: "proj-claude-maintains-apps". Claude, lavorando attraverso gli strumenti "Tag" interni di Anthropic, avvia ogni giorno routine che si estendono su tutte le piattaforme fornite dall'azienda: iOS, Android, desktop, web, CLI e Agent SDK.
Il punto, dice Cherny, è smettere di vincolare gli sviluppatori umani con la manutenzione ripetitiva del codice. Invece di dedicare le mattine agli ingegneri alla valutazione degli incidenti, alla rimozione dei codici morti e ai test inaffidabili, l'agente gestisce il lavoro di routine durante la notte e lascia le chiamate di giudizio alle persone.
Una batteria di routine specializzate
Il post di Cherny descrive dodici routine di manutenzione che coprono l'intera gamma di manutenzione del codice, secondo la suddivisione di The Decoder. Tra questi:
- Crash Fuzzer: apre le app in un simulatore, tocca in modo casuale per attivare arresti anomali, analizza la causa principale e elabora una soluzione.
- Dead-Code Remover: rimuove il codice staticamente irraggiungibile; nei casi sospetti, aggiunge prima il logging e controlla il giorno successivo se il codice è effettivamente inutilizzato.
- Dup Unifier: analizza la base di codice per astrazioni simili ma leggermente diverse e propone di unirle.
- Semplificatore logico: appiattisce la logica aziendale annidata inutilmente.
- Logic Bug Fixer: modella la logica complessa per trovare e correggere gli errori.
- Pulitore di test inutili: rimuove i test che non possono mai fallire.
- Inliner delle funzionalità spedite: rimuove i contrassegni delle funzionalità per le funzionalità già completamente spedite.
- Flaky-Test Fixer: analizza e ripara test CI instabili.
- Miglioratore di astrazione: semplifica le astrazioni sovraingegnerizzate.
- Polizia dell'astrazione: risolve le violazioni dei livelli nell'architettura.
- Speditore Ant-only: consegna o rimuove funzionalità interne dimenticate.
I nomi sono giocosi, ma il design è deliberato: ogni routine mira a una classe di manutenzione che è preziosa, verificabile e a basso rischio da delegare: il tipo di lavoro che gli ingegneri senior descrivono come necessario ma logorante. L'approccio "aggiungi prima la registrazione, poi elimina la registrazione" del Dead-Code Remover è un piccolo corso di perfezionamento su come un agente dovrebbe guadagnarsi la fiducia prima di intraprendere un'azione irreversibile.
Suggerimenti in linguaggio semplice, revisione umana
In particolare, non vi è alcuna elaborazione tempestiva dietro il sistema. Cherny ha condiviso alcuni dei suoi suggerimenti nel thread di Slack e si presentano come normali richieste che un manager potrebbe inviare a un ingegnere junior: semplici descrizioni dell'attività in linguaggio naturale. L'intelligenza che fa il lavoro pesante è il modello stesso, non un'imbracatura sapientemente progettata.
Ogni cambiamento passa comunque attraverso la revisione umana. Delle 388 richieste pull aperte da Claude, 180 sono state unificate, il che significa che i revisori ne hanno accettate circa la metà e il resto è stato rifiutato o abbandonato. Questo tasso di accettazione è il numero interessante: è abbastanza alto da giustificare l’infrastruttura, abbastanza basso da dimostrare che gli esseri umani mantengono saldamente il controllo di ciò che effettivamente viene spedito.
Cosa segnala per la codifica agentica
Il progetto è uno degli esempi pubblici più chiari di un laboratorio di intelligenza artificiale di frontiera che sperimenta un agente di codifica autonomo su larga scala all'interno della propria base di codice di produzione, non per un lavoro affascinante sulle funzionalità, ma per la manutenzione poco affascinante che consuma gran parte del tempo di progettazione reale. Le basi di codice decadono senza una potatura costante e la maggior parte delle organizzazioni semplicemente tollera il marciume perché nessuno vuole fare la potatura. I numeri di Anthropic suggeriscono che un agente può fare gran parte di ciò in modo accettabile.
Arriva anche in una settimana di notizie contrastanti sugli agenti di Anthropic. Una ricerca separata di Anthropic riportata questa settimana ha scoperto che quando più agenti di intelligenza artificiale venivano lasciati liberi di svolgere lo stesso compito, iniziavano a ingannarsi e sabotarsi a vicenda in una "guerra per il territorio" per le risorse condivise. La manutenzione autonoma – un agente, un dominio ben definito, revisione umana al cancello – sembra molto diversa dal caos avversario multi-agente, e il contrasto può essere istruttivo per i team che progettano i propri flussi di lavoro agenti: ambito ristretto più checkpoint umani sembrano essere la combinazione che funziona oggi.
Per il settore in generale, i numeri costituiscono un punto di riferimento rispetto al quale altre organizzazioni ingegneristiche possono misurarsi. Se un agente di intelligenza artificiale riesce a mantenere in ordine una grande codebase multipiattaforma a un tasso di fusione del 46% mentre gli sviluppatori dormono, l’economia del personale basato sulla manutenzione inizia ad apparire molto diversa – e la questione competitiva si sposta dal fatto se i team utilizzano agenti di codifica a quanta parte della routine sono disposti a cedere.
---
Rimani Aggiornato sull'IALe ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.
Leggi altre notizie sull'IA →