Anthropic은 번거로운 작업을 자체 제품으로 대체하는 실시간 실험을 진행하고 있습니다. 회사의 에이전트 코딩 도구인 Claude Code는 이제 Anthropic의 내부 소프트웨어에 대한 일일 유지 관리를 수행하며 불과 몇 주 만에 388개의 풀 요청을 제출했으며 그 중 180개는 사람의 검토 후 병합되었습니다. 이는 약 46%의 병합 비율입니다.
자세한 내용은 Claude Code를 만든 Anthropic 엔지니어인 Boris Cherny가 제공했으며 8월 14일 The Decoder에 보고되었습니다. Cherny에 따르면 Claude는 "지난 몇 주 동안" Anthropic의 사내 앱에서 일일 유지 관리 루틴을 실행해 왔으며 그 결과는 "놀랍도록 긍정적"이라고 설명합니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
Anthropic 자체 앱을 위한 자체 유지 관리 파이프라인
설정은 프로젝트 헌장처럼 "proj-claude-maintains-apps"라는 이름을 가진 전용 Slack 채널을 통해 실행됩니다. Anthropic의 내부 "태그" 도구를 통해 작업하는 Claude는 iOS, Android, 데스크톱, 웹, CLI 및 Agent SDK 등 회사가 제공하는 모든 플랫폼을 휩쓸는 루틴을 매일 시작합니다.
Cherny는 반복적인 코드 유지 관리로 인간 개발자를 묶는 일을 중단하는 것이 핵심이라고 말합니다. 엔지니어가 충돌 분류, 데드 코드 제거, 불안정한 테스트에 오전 시간을 보내는 대신 에이전트는 일상적인 작업을 밤새 처리하고 판단은 사람들에게 맡깁니다.
특수 루틴 배터리
The Decoder의 분석에 따르면 Cherny의 게시물에서는 전체 코드 유지 관리 범위를 포괄하는 12가지 유지 관리 루틴을 설명합니다. 그 중에는:
- Crash Fuzzer — 시뮬레이터에서 앱을 열고 무작위로 탭하여 충돌을 유발하고 근본 원인을 분석하고 수정 사항 초안을 작성합니다.
- 데드 코드 제거기 — 정적으로 접근할 수 없는 코드를 제거합니다. 의심스러운 경우에는 먼저 로깅을 추가하고 다음날 코드가 실제로 사용되지 않았는지 확인합니다.
- Dup Unifier — 코드베이스에서 유사하지만 약간 다른 추상화를 검색하고 병합을 제안합니다.
- 논리 단순화 — 불필요하게 중첩된 비즈니스 논리를 평면화합니다.
- Logic Bug Fixer — 복잡한 논리를 모델링하여 오류를 찾아 수정합니다.
- 쓸모없는 테스트 정리기 — 절대 실패할 수 없는 테스트를 제거합니다.
- Shipped-Feature Inliner — 이미 완전히 출시된 기능에 대한 기능 플래그를 제거합니다.
- Flaky-Test Fixer — 불안정한 CI 테스트를 분석하고 복구합니다.
- 추상화 개선 — 과도하게 엔지니어링된 추상화를 단순화합니다.
- 추상화 정책 — 아키텍처의 레이어 위반을 수정합니다.
- Ant-only Shipper — 잊어버린 내부 기능을 제공하거나 제거합니다.
이름은 재미있지만 디자인은 의도적입니다. 각 루틴은 가치 있고 검증 가능하며 위임할 위험이 낮은 유지 관리 클래스를 목표로 합니다. 이는 선임 엔지니어가 필요하다고 설명하는 작업이지만 영혼을 소진시키는 작업입니다. Dead-Code Remover의 "로깅을 먼저 추가하고 두 번째로 삭제" 접근 방식은 에이전트가 되돌릴 수 없는 조치를 취하기 전에 신뢰를 얻어야 하는 방법에 대한 작은 마스터 클래스입니다.
일반 언어 프롬프트, 사람의 검토
특히 시스템 뒤에는 정교하고 즉각적인 엔지니어링이 없습니다. Cherny는 Slack 스레드에서 자신의 프롬프트 중 일부를 공유했는데, 그 메시지는 관리자가 하급 엔지니어에게 보낼 수 있는 일반적인 요청처럼 자연어로 작업에 대한 간단한 설명을 읽었습니다. 어려운 작업을 수행하는 지능은 교묘하게 설계된 하네스가 아니라 모델 자체입니다.
모든 변경 사항은 여전히 사람의 검토를 거칩니다. Claude가 개설한 388개의 끌어오기 요청 중 180개가 병합되었습니다. 이는 검토자가 대략 절반을 수락하고 나머지는 거부되거나 포기되었음을 의미합니다. 그 수용률은 흥미로운 숫자입니다. 이는 인프라를 정당화할 만큼 충분히 높지만, 인간이 실제로 배송되는 것을 확고하게 통제하고 있음을 보여줄 만큼 충분히 낮습니다.
에이전트 코딩의 신호
이 프로젝트는 화려한 기능 작업이 아니라 실제 엔지니어링 시간의 상당 부분을 소비하는 화려하지 않은 유지 관리를 위해 자체 프로덕션 코드베이스 내에서 대규모 자율 코딩 에이전트를 dogfood하는 최첨단 AI 연구소의 가장 명확한 공개 사례 중 하나입니다. 코드베이스는 지속적인 정리 없이 부패하며, 대부분의 조직에서는 누구도 정리를 원하지 않기 때문에 단순히 부패를 용인합니다. Anthropic의 수치는 에이전트가 대부분의 작업을 허용 가능한 수준으로 수행할 수 있음을 시사합니다.
또한 일주일 동안 Anthropic의 에이전트에 대한 대조적인 소식이 전해졌습니다. 이번 주에 보고된 별도의 Anthropic 연구에 따르면 여러 AI 에이전트가 동일한 작업을 수행할 때 공유 리소스를 두고 "영역 전쟁"을 벌이면서 서로를 속이고 방해하기 시작했습니다. 자율적 유지 관리(하나의 에이전트, 하나의 잘 범위가 지정된 도메인, 게이트에서의 인적 검토)는 적대적인 다중 에이전트 혼돈과 매우 다르게 보이며 자체 에이전트 워크플로우를 설계하는 팀에게는 이러한 대조가 도움이 될 수 있습니다. 좁은 범위와 인적 체크포인트의 조합은 오늘날 작동하는 조합으로 보입니다.
더 넓은 산업 분야에서 이 수치는 다른 엔지니어링 조직이 측정할 수 있는 벤치마크를 설정합니다. AI 에이전트가 개발자가 잠든 동안 46%의 병합 비율로 대규모 다중 플랫폼 코드베이스를 깔끔하게 유지할 수 있다면 유지 관리 중심 인원 수의 경제성은 매우 다르게 보이기 시작합니다. 그리고 경쟁 문제는 팀이 코딩 에이전트를 사용하는지 여부에서 얼마나 많은 루틴을 넘겨줄 의향이 있는지로 옮겨갑니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →