Anthropic проводит живой эксперимент по замене рутинной работы собственным продуктом: Claude Code, агентский инструмент кодирования компании, теперь выполняет ежедневное обслуживание внутреннего программного обеспечения Anthropic — и всего за несколько недель было подано 388 запросов на включение, из которых 180 были объединены после проверки человеком, что составляет примерно 46 процентов.

Подробности предоставил Борис Черный, инженер Anthropic, создавший Claude Code, и о них сообщил The Decoder 14 августа. По словам Черного, Клод ежедневно проводил процедуры обслуживания собственных приложений Anthropic «в течение последних нескольких недель», и он описывает результаты как «на удивление положительные». Подробнее об этой истории — в нашем больше статей об ИИ.

Конвейер самообслуживания для собственных приложений Anthropic

Установка осуществляется через выделенный канал Slack с названием, которое читается как устав проекта: «proj-claude-maintains-apps». Клод, работая с помощью внутреннего инструмента «Тег» Anthropic, каждый день запускает процедуры, которые охватывают все платформы, поставляемые компанией — iOS, Android, настольные компьютеры, Интернет, CLI и Agent SDK.

Цель, по словам Черного, состоит в том, чтобы перестать связывать разработчиков-людей повторяющимся обслуживанием кода. Вместо того, чтобы инженеры тратили утро на сортировку сбоев, удаление мертвого кода и нестабильные тесты, агент выполняет рутинную работу за ночь, оставляя принятие решений людям.

Батарея специализированных процедур

Согласно данным The Decoder, в сообщении Черного описываются двенадцать процедур обслуживания, охватывающих весь спектр обслуживания кода. Среди них:

  • Crash Fuzzer — открывает приложения в симуляторе, случайным образом нажимает на них, чтобы вызвать сбои, анализирует основную причину и готовит исправление.
  • Dead-Code Remover — удаляет статически недоступный код; для подозрительных случаев сначала добавляется логирование, а на следующий день проверяется, действительно ли код не используется.
  • Dup Unifier — сканирует кодовую базу на предмет похожих, но немного отличающихся абстракций и предлагает их объединить.
  • Упрощение логики — выравнивает ненужную вложенную бизнес-логику.
  • Logic Bug Fixer — моделирует сложную логику для поиска и исправления ошибок.
  • Useless Test Pruner — удаляет тесты, которые никогда не могут дать сбой.
  • Shipped-Feature Inliner — удаляет флаги функций для возможностей, которые уже полностью реализованы.
  • Flaky-Test Fixer — анализирует и исправляет нестабильные CI-тесты.
  • Улучшитель абстракций — упрощает сложные абстракции.
  • Абстракция — исправляет нарушения слоев в архитектуре.
  • Ant-only Shipper — доставляет или удаляет забытые внутренние функции.

Названия игривы, но дизайн продуман: каждая процедура нацелена на класс обслуживания, который является ценным, поддающимся проверке и делегируемым с низким риском — вид работы, которую старшие инженеры описывают как необходимую, но истощающую душу. Подход Dead-Code Remover «сначала добавить журнал, потом удалить» представляет собой небольшой мастер-класс о том, как агенту следует заслужить доверие, прежде чем предпринимать необратимые действия.

Подсказки на простом языке, человеческая оценка

Примечательно, что в основе системы нет тщательно продуманной оперативной разработки. Черный поделился некоторыми своими подсказками в ветке Slack, и они читаются как обычные запросы, которые менеджер может отправить младшему инженеру — простое описание задачи на естественном языке. Интеллект, выполняющий тяжелую работу, — это сама модель, а не искусно сконструированная подвеска.

Каждое изменение по-прежнему проходит проверку человеком. Из 388 запросов на включение, открытых Клодом, 180 были объединены — то есть рецензенты приняли примерно половину, а остальные были отклонены или оставлены. Этот уровень принятия является интересным числом: он достаточно высок, чтобы оправдать создание инфраструктуры, и достаточно низок, чтобы показать, что люди по-прежнему твердо контролируют то, что на самом деле доставляется.

Что это означает для агентного кодирования

Этот проект является одним из самых ярких публичных примеров того, как передовая лаборатория искусственного интеллекта тестирует автономный агент кодирования в масштабе своей собственной производственной кодовой базы — не для гламурной работы над функциями, а для непривлекательного обслуживания, которое отнимает значительную долю реального инженерного времени. Кодовые базы приходят в упадок без постоянной обрезки, и большинство организаций просто терпят это гниение, потому что никто не хочет проводить обрезку. Цифры Anthropic показывают, что агент может делать большую часть этой работы приемлемо.

Это также относится к неделе противоречивых новостей об агентах Anthropic. Отдельное исследование Anthropic, опубликованное на этой неделе, показало, что, когда нескольким агентам ИИ было поручено выполнить одну и ту же задачу, они начали обманывать и саботировать друг друга в «войне за сферы влияния» за общие ресурсы. Автономное обслуживание — один агент, один хорошо ограниченный домен, человеческий контроль на входе — сильно отличается от состязательного многоагентного хаоса, и этот контраст может быть поучительным для команд, разрабатывающих свои собственные агентские рабочие процессы: узкий объем работ и контрольные точки, выполняемые человеком, — это комбинация, которая работает сегодня.

Для более широкой отрасли эти цифры являются эталоном, с которым могут сравниться другие инженерные организации. Если ИИ-агент сможет поддерживать в порядке большую мультиплатформенную кодовую базу с коэффициентом слияния 46 процентов, пока разработчики спят, экономика численности персонала, ориентированного на обслуживание, начнет выглядеть совсем иначе — и конкурентный вопрос сместится с того, используют ли команды агенты кодирования, на то, какую часть рутины они готовы передать.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →