Anthropic은 어떻게 clude.ai와 Claude 데스크톱 앱을 2주간의 스프린트 안에 대략 3배 더 빠르게 만들었는지에 대한 상세한 엔지니어링 설명을 발표했으며, 반전은 대부분의 작업이 Claude가 직접 수행했다는 것입니다. Anthropic의 엔지니어링 블로그에 게시된 이 게시물은 모든 스레드의 AI 모델을 사용하여 단일 Slack 채널에서 실행되는 성능 캠페인, 병목 현상 찾기, 벤치마크 구축, 배송 개선 및 모든 배포 관찰에 대해 설명합니다.

75번째 백분위수로 측정된 수치는 상당합니다. clude.ai를 새로 로드할 때 입력 가능한 페이지에 도달하는 시간이 3.1초에서 0.55초로 단축되었습니다. 새로운 Claude Code 세션 시작 시간이 0.8초에서 0.3초로 단축되었고, Claude Cowork 클라우드 세션 로딩 시간이 2.6초에서 0.73초로 단축되었습니다. 전체적으로 Anthropic은 개선을 통해 매일 수만 명의 사용자 대기 시간을 절약할 수 있다고 추정합니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

먼저 측정한 후 이동

스프린트는 코드보다는 측정으로 시작되었습니다. Claude를 사용하여 Datadog MCP 서버를 통해 사용 데이터를 분석한 결과, 팀은 활동의 95%를 차지하는 4가지 사용자 여정(앱 실행, 대화 시작, 기존 대화 로드, 메시지 보내기)을 식별했습니다. 웹과 데스크탑 전반에 걸쳐 이러한 여정은 13개의 개별 측정으로 분류되었으며 팀은 각각이 직접 비교할 수 있을 때까지 계측을 추가했습니다. 즉, 사용자 상호 작용에서 시작하여 결과가 렌더링되면 끝납니다.

기준을 마련한 후 팀은 각각 특정 여정을 목표로 하는 대략 20개의 엄선된 프로젝트 목록을 작성하고 Claude에게 각 프로젝트의 영향을 밀리초 단위로 추정하여 스프린트 목표를 설정하도록 했습니다. 계획은 일찍 이루어졌습니다. Anthropic은 3일차까지 13개의 목표 중 12개를 달성했다고 보고했습니다. 이로 인해 Claude가 추가 기회를 식별하고 새로운 작업 흐름을 제안할 수 있는 여지가 생겼으며, 이를 통해 신속하게 전체 프로젝트를 진행하고 원래 목표를 뛰어넘는 결과를 얻을 수 있었습니다.

실제로 배송된 것

기술적 변화는 최신 웹 성능 작업의 체크리스트처럼 읽혀집니다. 더 빠른 실행을 위해 팀은 사용자가 React 초기화 중에 입력을 시작할 수 있도록 정적 작성기를 HTML에 굽고 V8 코드 캐시를 미리 컴파일하여 데스크톱 셸의 기본 프로세스가 시작 시 더 이상 처음부터 다시 컴파일되지 않도록 했습니다. 대화 간의 빠른 탐색을 위해 작성기는 해체 및 재구축되지 않고 마운트된 상태로 유지되며, 사용자가 해당 세션 위로 마우스를 가져가면 세션이 미리 가져오고 사이드바 다시 렌더링이 90% 감소했습니다.

게시물에 따르면 병합 내역의 규모는 헤드라인 수치입니다. 게시물에 따르면 단일 고객 관련 사고나 롤백 없이 스프린트 동안 3,000개 이상의 변경 사항이 도착했습니다.

클로드 태그: 가드레일을 가진 요원

스프린트는 Anthropic이 현재 베타 버전이며 Opus 5.5와 대략 비슷한 내부 연구 모델로 설명되는 Claude Tag라고 부르는 방식으로 실행되었습니다. 노동 분업은 이야기의 가장 중요한 부분입니다. Claude는 병목 현상을 발견하고, 벤치마크를 구축하고, 수정 사항을 구현하고, 모든 배포를 모니터링하면서 한 번에 몇 시간 동안, 심지어 밤새도록 비동기식으로 작업했습니다. 인간은 목표를 설정하고, 절충안을 적용하고, 병합되기 전에 모든 변경 사항을 승인했습니다.

또한 팀은 배포 주기보다 더 빠르게 반복하기를 원했기 때문에 실제 읽기를 위한 프록시로 랩 측정값을 구축했습니다. 엔지니어들이 묻는 질문 중에는 JavaScript 명령어 수가 배포 전 프로토타입 검증을 위한 더 빠른 피드백 신호로서 벽시계 타이밍을 대체할 수 있습니까?

AI 지원 엔지니어링이 중요한 이유

Anthropic의 게시물은 생산 규모의 AI 기반 개발에 대해 보여주는 것보다 특정 최적화(정적 셸, 프리페칭 및 렌더링 감소가 확립된 기술)에 대해서는 덜 주목할 만합니다. 한 프론티어 연구소에서는 AI 에이전트가 대부분의 식별, 구현 및 검증 작업을 수행하는 동안 주력 소비자 제품의 3,000가지 변경 성능 점검을 방금 출시했으며, 인간은 모든 변경에 대한 승인 권한을 유지했습니다.

결과는 또한 반응성이 제품 기능인 경쟁 상황에 놓이게 됩니다. Claude는 소비자 및 개발자의 관심을 끌기 위해 OpenAI의 ChatGPT 및 Google의 Gemini와 직접 경쟁하며 인지된 속도는 모델 품질만큼 보조 제품의 일일 사용량을 결정합니다. 상호 작용 시간을 3.1초에서 0.55초로 단축하여 사용자가 제품에 대해 가지고 있는 가장 일반적인 불만 사항을 해결합니다.

외부에서 관찰하는 엔지니어링 팀의 경우 Anthropic 계정에서 전달 가능한 교훈은 루프 구조입니다. 즉, 사용자 여정을 정확하게 측정하고, 모델이 해당 측정에 대한 변경 사항을 제안 및 검증하도록 하고, 인간 승인 게이트를 유지하고, 측정 시스템이 확인할 수 있는 만큼 빠르게 범위를 확장합니다. Anthropic의 자체 프레임은 Claude가 무언가를 측정할 수 있으면 더 빠르게 만들 수 있다는 것입니다. 그래서 팀은 측정할 더 많은 것을 계속 찾았습니다.

유사한 에이전트 중심 스프린트가 소프트웨어 산업 전반에 걸쳐 표준 관행이 될지는 아직 알 수 없지만 Anthropic은 대규모로 작동할 수 있는 가장 구체적인 공개 데이터 포인트 중 하나를 제공했습니다. AI가 소프트웨어 개발을 어떻게 재구성하는지 추적하는 독자는 추가 개발을 위해 AI 연구 범위를 따를 수 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →