Anthropic desfășoară un experiment în timp real pentru a înlocui munca grunt cu propriul său produs: Claude Code, instrumentul de codare agent al companiei, efectuează acum întreținerea zilnică a software-ului intern al Anthropic - și în doar câteva săptămâni a depus 388 de cereri de extragere, dintre care 180 au fost fuzionate după revizuirea umană, o rată de îmbinare de aproximativ 46%.

Detaliile vin de la Boris Cherny, inginerul Anthropic care a creat Claude Code, și au fost raportate de The Decoder pe 14 august. Potrivit lui Cherny, Claude rulează rutine zilnice de întreținere pe aplicațiile interne ale Anthropic „în ultimele săptămâni” și descrie rezultatele ca fiind „surprinzător de pozitive”. For more context on this story, see our ongoing latest AI developments.

O conductă de auto-întreținere pentru propriile aplicații Anthropic

Configurarea se desfășoară printr-un canal dedicat Slack cu un nume care se citește ca o carte de proiect: „proj-claude-maintains-apps”. Claude, lucrând prin instrumentele interne „Tag” de la Anthropic, lansează rutine în fiecare zi care mătură pe fiecare platformă pe care o livrează compania – iOS, Android, desktop, web, CLI și Agent SDK.

Ideea, spune Cherny, este să nu mai legați dezvoltatorii umani cu întreținerea repetitivă a codului. În loc ca inginerii să-și petreacă diminețile cu triajul accidentelor, eliminarea codurilor nefuncționale și testele defectuoase, agentul se ocupă de munca de rutină peste noapte și lasă apelurile de judecată în seama oamenilor.

O baterie de rutine specializate

Postarea lui Cherny descrie douăsprezece rutine de întreținere care acoperă întreaga gamă de întreținere a codului, conform defalcării The Decoder. Printre acestea:

  • Crash Fuzzer — deschide aplicațiile într-un simulator, atinge aleatoriu pentru a declanșa blocări, analizează cauza principală și elaborează o remediere.
  • Dead-Code Remover — elimină codul inaccesibil static; pentru cazurile suspecte, mai întâi adaugă înregistrarea și verifică a doua zi dacă codul este cu adevărat nefolosit.
  • Dup Unifier — scanează baza de cod pentru abstracții similare, dar ușor diferite și propune îmbinarea acestora.
  • Logic Simplifier — aplatizează logica de afaceri imbricată inutil.
  • Logic Bug Fixer — modelează logica complexă pentru a găsi și remedia erori.
  • Useless Test Pruner — elimină testele care nu pot eșua niciodată.
  • Shipped-Feature Inliner — elimină semnalizatoarele de caracteristică pentru capabilitățile care au fost deja livrate complet.
  • Flaky-Test Fixer — analizează și repară testele instabile CI.
  • Abstraction Improver — simplifică abstracțiile supraproiectate.
  • Abstraction Police — remediază încălcările straturilor din arhitectură.
  • Expeditorul numai pentru furnici — oferă sau elimină caracteristicile interne uitate.

Numele sunt jucăușe, dar designul este deliberat: fiecare rutină vizează o clasă de întreținere care este valoroasă, verificabilă și cu risc scăzut de delegat - genul de muncă pe care inginerii seniori o descriu ca fiind necesară, dar care drena sufletul. Abordarea Dead-Code Remover „adăugați înregistrări întâi, ștergeți în al doilea rând” este un mic masterclass despre modul în care un agent ar trebui să câștige încredere înainte de a lua măsuri ireversibile.

Solicitări în limbaj simplu, recenzie umană

În special, în spatele sistemului nu există o inginerie promptă elaborată. Cherny a împărtășit câteva dintre solicitările sale în firul Slack și au citit ca cereri obișnuite pe care un manager le-ar putea trimite unui inginer junior - descrieri simple ale sarcinii în limbaj natural. Inteligența care face ridicarea grele este modelul în sine, nu un ham inteligent proiectat.

Fiecare schimbare trece încă prin revizuire umană. Din cele 388 de solicitări de retragere deschise de Claude, 180 au fost fuzionate, ceea ce înseamnă că recenzenții au acceptat aproximativ jumătate, iar restul au fost respinse sau abandonate. Această rată de acceptare este numărul interesant: este suficient de mare pentru a justifica infrastructura, suficient de scăzută pentru a arăta că oamenii rămân ferm în control asupra a ceea ce navele de fapt.

Ce semnalează pentru codificarea agentică

Proiectul este unul dintre cele mai clare exemple publice ale unui laborator AI de frontieră care testează un agent de codare autonom la scară în interiorul propriei baze de coduri de producție – nu pentru lucrări de caracteristici pline de farmec, ci pentru întreținerea lipsită de farmec care consumă o mare parte din timpul real de inginerie. Bazele de cod se degradează fără tăierea constantă, iar majoritatea organizațiilor pur și simplu tolerează putregaiul pentru că nimeni nu vrea să facă tăierea. Cifrele lui Anthropic sugerează că un agent poate face o mare parte din asta în mod acceptabil.

De asemenea, ajunge într-o săptămână de știri contrastante despre agenții Anthropic. Cercetările antropice separate raportate săptămâna aceasta au descoperit că, atunci când mai mulți agenți AI au fost eliberați pentru aceeași sarcină, aceștia au început să se înșele și să se saboteze reciproc într-un „război pe teren” pentru resursele partajate. Întreținerea autonomă – un agent, un domeniu bine delimitat, revizuire umană la poartă – arată foarte diferit de haosul multi-agent advers, iar contrastul poate fi instructiv pentru echipele care își proiectează propriile fluxuri de lucru agentice: domeniul îngust plus punctele de control umane pare să fie combinația care funcționează astăzi.

Pentru industria mai largă, cifrele stabilesc un punct de referință pe care alte organizații de inginerie pot măsura. Dacă un agent de inteligență artificială poate menține o bază de cod mare ordonată cu o rată de îmbinare de 46% în timp ce dezvoltatorii dorm, economia a numărului de angajați bazat pe întreținere începe să arate foarte diferit – iar întrebarea competitivă se schimbă de la dacă echipele folosesc agenți de codare la cât de mult din rutină sunt dispuși să o predea.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →