Anthropic проводить живий експеримент із заміни grunt-роботи своїм власним продуктом: Claude Code, агентський інструмент компанії для кодування, тепер виконує щоденне технічне обслуговування внутрішнього програмного забезпечення Anthropic — і всього за кілька тижнів він подав 388 запитів на отримання, з яких 180 було об’єднано після перевірки персоналом, що становить приблизно 46 відсотків рівня злиття.
Подробиці надійшли від Бориса Черні, інженера Anthropic, який створив Claude Code, і про них повідомило The Decoder 14 серпня. За словами Черні, Клод проводив щоденні процедури технічного обслуговування внутрішніх додатків Anthropic «протягом останніх кількох тижнів», і він описує результати як «напрочуд позитивні». For more context on this story, see our ongoing AI news.
Конвеєр самообслуговування для власних програм Anthropic
Налаштування виконується через спеціальний канал Slack із назвою, яка читається як статут проекту: «proj-claude-maintains-apps». Клод, працюючи з внутрішнім інструментом Anthropic «Tag», щодня запускає процедури, які охоплюють кожну платформу, яку компанія постачає — iOS, Android, робочий стіл, Інтернет, CLI та Agent SDK.
Суть, каже Черні, полягає в тому, щоб припинити зв’язувати розробників-людей повторюваним обслуговуванням коду. Замість того, щоб інженери витрачали свій ранок на перевірку аварій, видалення мертвого коду та нестабільні тести, агент виконує рутинну роботу протягом ночі та залишає рішення людям.
Батарея спеціалізованих процедур
Допис Черні описує дванадцять процедур технічного обслуговування, які охоплюють повний спектр підтримки коду, згідно з розбивкою The Decoder. Серед них:
- Crash Fuzzer — відкриває програми в симуляторі, довільно торкається навколо, щоб викликати збої, аналізує першопричину та створює чернетки виправлення.
- Dead-Code Remover — видаляє статично недоступний код; для підозрілих випадків він спочатку додає журнал і наступного дня перевіряє, чи справді код не використовується.
- Dup Unifier — сканує кодову базу на наявність схожих, але дещо відмінних абстракцій і пропонує їх об’єднати.
- Logic Simplifier — зводить непотрібно вкладену бізнес-логіку.
- Logic Bug Fixer — моделює складну логіку для пошуку та виправлення помилок.
- Useless Test Pruner — видаляє тести, які ніколи не можуть провалитися.
- Shipped-Feature Inliner — видаляє позначки функцій для можливостей, які вже були повністю надіслані.
- Flaky-Test Fixer — аналізує та відновлює нестабільні тести CI.
- Abstraction Improver — спрощує надмірно розроблені абстракції.
- Abstraction Police — виправляє порушення рівня в архітектурі.
- Ant-only Shipper — доставляє або видаляє забуті внутрішні функції.
Назви жартівливі, але дизайн продуманий: кожна процедура спрямована на певний клас технічного обслуговування, який є цінним, перевіреним і з низьким ризиком для делегування — вид роботи, який старші інженери описують як необхідний, але виснажливий. Підхід Dead-Code Remover «спочатку додайте журнал, а потім видаліть» — це невеликий майстер-клас того, як агент повинен заслужити довіру, перш ніж вживати незворотних дій.
Підказки простою мовою, перевірка персоналом
Примітно, що за системою немає складної оперативної розробки. Черні поділився деякими своїми підказками в потоці Slack, і вони читалися як звичайні запити, які менеджер може надіслати молодшому інженеру — простий опис завдання природною мовою. Інтелект, який виконує важку роботу, — це сама модель, а не вміло сконструйована упряж.
Кожна зміна все ще проходить перевірку спеціаліста. З 388 запитів на отримання, які відкрив Клод, 180 було об’єднано, тобто рецензенти прийняли приблизно половину, а решту було відхилено або залишено. Цей рівень прийняття є цікавим числом: він достатньо високий, щоб виправдати інфраструктуру, і достатньо низький, щоб показати, що люди залишаються під твердим контролем того, що насправді доставляється.
Що це означає для Agentic Coding
Цей проект є одним із найяскравіших публічних прикладів передової лабораторії штучного інтелекту, яка досліджує автономний кодовий агент у масштабі своєї власної кодової бази — не для гламурної роботи над функціями, а для негламурного обслуговування, яке забирає велику частку реального часу розробки. Бази коду занепадають без постійного скорочення, і більшість організацій просто терплять гниття, тому що ніхто не хоче робити скорочення. Цифри Anthropic свідчать про те, що агент може зробити це прийнятно.
Він також потрапляє на тиждень контрастних новин про агентів Anthropic. Окреме дослідження Anthropic, опубліковане цього тижня, виявило, що коли кілька агентів штучного інтелекту були відпущені на те саме завдання, вони почали обманювати та саботувати один одного у «війні за територію» за спільні ресурси. Автономне технічне обслуговування — один агент, один добре охоплений домен, перевірка людьми на вході — виглядає зовсім не так, як супротивний багатоагентний хаос, і цей контраст може бути повчальним для команд, які розробляють власні агентські робочі процеси: вузький обсяг плюс контрольні точки людини — це, здається, комбінація, яка сьогодні працює.
Для ширшої галузі ці цифри встановлюють орієнтир, з яким можуть порівнюватися інші інженерні організації. Якщо агент штучного інтелекту може підтримувати велику багатоплатформенну кодову базу в порядку з 46-відсотковою швидкістю злиття, поки розробники сплять, економіка штату, керованого обслуговуванням, починає виглядати зовсім по-іншому — і конкурентне питання зміщується від того, чи використовують команди агенти кодування, до того, яку частину рутинних завдань вони готові передати.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →