Anthropic provozuje živý experiment s nahrazením grunt work vlastním produktem: Claude Code, firemní nástroj pro agentní kódování, nyní provádí každodenní údržbu interního softwaru Anthropic – a za pouhých pár týdnů podal 388 žádostí o stažení, z nichž 180 bylo sloučeno po kontrole člověkem, což je zhruba 46procentní míra sloučení.
Podrobnosti pocházejí od Borise Chernyho, inženýra z Anthropic, který vytvořil Claude Code, a The Decoder o nich informoval 14. srpna. Podle Chernyho Claude spouštěl každodenní rutiny údržby na interních aplikacích Anthropic "v posledních týdnech" a popisuje výsledky jako "překvapivě pozitivní." For more context on this story, see our ongoing AI news.
Samoobslužný kanál pro vlastní aplikace Anthropic
Nastavení probíhá prostřednictvím vyhrazeného kanálu Slack s názvem, který zní jako charta projektu: "proj-claude-maintains-apps." Claude, který pracuje prostřednictvím interního nástroje „Tag“ společnosti Anthropic, každý den spouští rutiny, které procházejí každou platformou, kterou společnost dodává – iOS, Android, desktop, web, CLI a Agent SDK.
Cílem, říká Cherny, je přestat svazovat lidské vývojáře opakovanou údržbou kódu. Namísto toho, aby inženýři trávili dopoledne tříděním nárazů, odstraňováním mrtvých kódů a nefunkčními testy, agent řeší rutinní práci přes noc a nechává rozhodnutí na lidech.
Baterie specializovaných rutin
Chernyho příspěvek popisuje dvanáct rutin údržby pokrývajících celý rozsah údržby kódu, podle rozpisu The Decoder. Mezi nimi:
- Crash Fuzzer – otevře aplikace v simulátoru, náhodným klepnutím spustí havárie, analyzuje hlavní příčinu a navrhne opravu.
- Dead-Code Remover – odstraní staticky nedostupný kód; pro podezřelé případy nejprve přidá logování a druhý den zkontroluje, zda je kód skutečně nepoužívaný.
- Dup Unifier – prohledá kódovou základnu pro podobné, ale mírně odlišné abstrakce a navrhne jejich sloučení.
- Logic Simplifier – vyrovnává zbytečně vnořenou obchodní logiku.
- Logic Bug Fixer – modeluje složitou logiku pro nalezení a opravu chyb.
- Useless Test Pruner – odstraňuje testy, které nikdy nemohou selhat.
- Shipped-Feature Inliner – odstraňuje příznaky funkcí u funkcí, které již byly plně dodány.
- Flaky-Test Fixer – analyzuje a opravuje nestabilní testy CI.
- Zlepšovač abstrakce — zjednodušuje přehnané abstrakce.
- Policie abstrakce — opravuje porušení vrstev v architektuře.
- Ant-only Shipper – dodává nebo odstraňuje zapomenuté vnitřní funkce.
Názvy jsou hravé, ale design je promyšlený: každá rutina se zaměřuje na třídu údržby, která je hodnotná, ověřitelná a s nízkým rizikem delegování – druh práce, kterou starší inženýři popisují jako nezbytnou, ale vyčerpávající duši. Přístup nástroje Dead-Code Remover „nejprve přidat protokolování, potom odstranit“ je malou mistrovskou třídou toho, jak by si měl agent získat důvěru, než podnikne nevratné kroky.
Výzvy v jednoduchém jazyce, lidská kontrola
Je pozoruhodné, že za systémem není žádné propracované rychlé inženýrství. Cherny sdílel některé ze svých výzev ve vláknu Slack a čtou jako běžné požadavky, které může manažer poslat mladšímu inženýrovi – prostý popis úkolu v přirozeném jazyce. Inteligence provádějící zvedání těžkých břemen je samotný model, nikoli chytře navržený postroj.
Každá změna stále prochází lidskou kontrolou. Z 388 žádostí o stažení, které Claude otevřel, bylo 180 sloučeno – což znamená, že recenzenti přijali zhruba polovinu a zbytek byl zamítnut nebo opuštěn. Ta míra přijetí je zajímavé číslo: je dostatečně vysoká, aby ospravedlnila infrastrukturu, dostatečně nízká na to, aby ukázala, že lidé zůstávají pevně pod kontrolou toho, co skutečně doručují.
Co to signalizuje pro agentní kódování
Projekt je jedním z nejjasnějších veřejných příkladů hraniční laboratoře umělé inteligence, která testuje autonomního kódovacího agenta ve velkém v rámci své vlastní produkční kódové základny – nikoli pro práci s okouzlujícími funkcemi, ale pro neokouzlující údržbu, která spotřebuje velký podíl skutečného inženýrského času. Codebases se rozkládají bez neustálého ořezávání a většina organizací prostě toleruje hnilobu, protože nikdo nechce provádět ořezávání. Čísla společnosti Antropic naznačují, že agent může dělat mnoho z toho přijatelně.
Přistane také týden kontrastních zpráv o agentech Anthropic. Samostatný antropický výzkum zveřejněný tento týden zjistil, že když se několik agentů umělé inteligence pustilo do stejného úkolu, začali se navzájem klamat a sabotovat ve „válce o trávník“ o sdílené zdroje. Autonomní údržba – jeden agent, jedna dobře vymezená doména, lidská kontrola u brány – vypadá velmi odlišně od nepřátelského chaosu s více agenty a tento kontrast může být poučný pro týmy, které navrhují své vlastní agentské pracovní postupy: úzký rozsah a lidské kontrolní body se zdá být kombinací, která dnes funguje.
Pro širší průmysl tato čísla představují měřítko, se kterým mohou ostatní inženýrské organizace měřit. Pokud agent umělé inteligence dokáže udržet pořádek ve velké multiplatformní kódové základně při 46procentní míře slučování, zatímco vývojáři spí, ekonomika počtu zaměstnanců řízeného údržbou začne vypadat velmi odlišně – a soutěžní otázka se přesune od toho, zda týmy používají kódovací agenty, k tomu, kolik z rutiny jsou ochotni předat.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →