Anthropic đang tiến hành một thử nghiệm trực tiếp trong việc thay thế công việc nặng nhọc bằng sản phẩm của chính mình: Claude Code, công cụ mã hóa tác nhân của công ty, hiện thực hiện bảo trì hàng ngày trên phần mềm nội bộ của Anthropic — và chỉ trong vài tuần, nó đã gửi 388 yêu cầu kéo, trong đó 180 yêu cầu được hợp nhất sau khi con người đánh giá, tỷ lệ hợp nhất khoảng 46%.
Thông tin chi tiết đến từ Boris Cherny, kỹ sư Anthropic, người đã tạo ra Claude Code, và được The Decoding báo cáo vào ngày 14 tháng 8. Theo Cherny, Claude đã thực hiện các quy trình bảo trì hàng ngày trên các ứng dụng nội bộ của Anthropic "trong vài tuần qua" và anh ấy mô tả kết quả là "tích cực đáng ngạc nhiên". For more context on this story, see our ongoing artificial intelligence updates.
Quy trình tự bảo trì cho các ứng dụng riêng của Anthropic
Quá trình thiết lập chạy qua kênh Slack chuyên dụng với tên giống như điều lệ dự án: "proj-claude-maintains-apps". Claude, làm việc thông qua công cụ "Thẻ" nội bộ của Anthropic, bắt đầu các quy trình mỗi ngày trên mọi nền tảng mà công ty cung cấp — iOS, Android, máy tính để bàn, web, CLI và SDK đại lý.
Cherny nói, vấn đề là ngừng ràng buộc các nhà phát triển con người với việc bảo trì mã lặp đi lặp lại. Thay vì các kỹ sư dành buổi sáng để phân loại sự cố, loại bỏ mã chết và kiểm tra lỗi, nhân viên sẽ xử lý công việc thường ngày qua đêm và để lại quyết định cho mọi người.
Một loạt các thói quen chuyên biệt
Bài đăng của Cherny mô tả 12 quy trình bảo trì bao gồm toàn bộ phạm vi bảo trì mã, theo phân tích của The Decoding. Trong số đó:
- Crash Fuzzer — mở ứng dụng trong trình mô phỏng, chạm ngẫu nhiên để gây ra sự cố, phân tích nguyên nhân gốc rễ và đưa ra cách khắc phục.
- Dead-Code Remover — loại bỏ các mã tĩnh không thể truy cập được; đối với các trường hợp đáng ngờ, trước tiên, nó sẽ thêm tính năng ghi nhật ký và kiểm tra vào ngày hôm sau xem mã có thực sự không được sử dụng hay không.
- Dup Unifier — quét cơ sở mã để tìm các phần trừu tượng tương tự nhưng hơi khác một chút và đề xuất hợp nhất chúng.
- Bộ đơn giản hóa logic — làm phẳng logic kinh doanh lồng nhau không cần thiết.
- Trình sửa lỗi logic — lập mô hình logic phức tạp để tìm và sửa lỗi.
- Công cụ cắt tỉa bài kiểm tra vô dụng — loại bỏ các bài kiểm tra không bao giờ có thể thất bại.
- Shipped-Feature Inliner — xóa cờ tính năng cho các chức năng đã được vận chuyển đầy đủ.
- Flaky-Test Fixer — phân tích và sửa chữa các bài kiểm tra CI không ổn định.
- Trình cải thiện tính trừu tượng — đơn giản hóa các phần trừu tượng được thiết kế quá mức.
- Cảnh sát trừu tượng — sửa các vi phạm về lớp trong kiến trúc.
- Người gửi hàng chỉ có kiến — cung cấp hoặc loại bỏ các tính năng nội bộ bị lãng quên.
Những cái tên này rất vui nhộn nhưng thiết kế có chủ ý: mỗi quy trình nhắm đến một lớp bảo trì có giá trị, có thể kiểm chứng và có ít rủi ro để ủy quyền — loại công việc mà các kỹ sư cấp cao mô tả là cần thiết nhưng khiến tâm hồn mệt mỏi. Phương pháp "thêm nhật ký trước, xóa thứ hai" của Dead-Code Remover là một lớp tổng thể nhỏ về cách một tổng đài viên phải có được sự tin cậy trước khi thực hiện hành động không thể thay đổi được.
Lời nhắc bằng ngôn ngữ đơn giản, Đánh giá của con người
Đáng chú ý, không có kỹ thuật nhanh chóng phức tạp đằng sau hệ thống. Cherny đã chia sẻ một số lời nhắc của anh ấy trong chuỗi Slack và chúng giống như những yêu cầu thông thường mà người quản lý có thể gửi cho kỹ sư cấp dưới - những mô tả đơn giản về nhiệm vụ bằng ngôn ngữ tự nhiên. Trí thông minh thực hiện công việc nặng nhọc chính là mô hình chứ không phải là dây nịt được thiết kế khéo léo.
Mọi thay đổi vẫn trải qua sự xem xét của con người. Trong số 388 yêu cầu kéo mà Claude đã mở, 180 yêu cầu đã được hợp nhất - nghĩa là người đánh giá đã chấp nhận gần một nửa và phần còn lại bị từ chối hoặc bị bỏ rơi. Tỷ lệ chấp nhận đó là một con số thú vị: nó đủ cao để biện minh cho cơ sở hạ tầng, đủ thấp để cho thấy rằng con người vẫn nắm quyền kiểm soát chặt chẽ những gì thực sự được vận chuyển.
Nó báo hiệu điều gì cho mã hóa tác nhân
Dự án này là một trong những ví dụ công khai rõ ràng nhất về phòng thí nghiệm AI biên giới đang thử nghiệm một tác nhân mã hóa tự động ở quy mô lớn bên trong cơ sở mã sản xuất của chính nó — không phải để thực hiện các tính năng hấp dẫn mà để bảo trì không hấp dẫn, tiêu tốn phần lớn thời gian kỹ thuật thực tế. Cơ sở mã sẽ phân rã mà không được cắt tỉa liên tục và hầu hết các tổ chức chỉ đơn giản là chịu đựng sự thối rữa vì không ai muốn thực hiện việc cắt tỉa. Những con số của Anthropic cho thấy một đặc vụ có thể làm được nhiều việc ở mức chấp nhận được.
Nó cũng đưa đến một tuần có nhiều tin tức trái ngược nhau về các đặc vụ của Anthropic. Nghiên cứu riêng biệt của Anthropic được báo cáo trong tuần này đã phát hiện ra rằng khi nhiều đặc vụ AI được giao nhiệm vụ giống nhau, chúng bắt đầu lừa dối và phá hoại lẫn nhau trong một "cuộc chiến sân cỏ" vì các tài nguyên được chia sẻ. Bảo trì tự động — một tác nhân, một miền có phạm vi phù hợp, đánh giá của con người tại cổng — trông rất khác với sự hỗn loạn của nhiều tác nhân đối nghịch và sự tương phản có thể mang tính hướng dẫn cho các nhóm thiết kế quy trình làm việc của tác nhân của riêng họ: phạm vi hẹp cộng với các điểm kiểm tra của con người dường như là sự kết hợp hiệu quả ngày nay.
Đối với ngành công nghiệp rộng lớn hơn, những con số đặt ra tiêu chuẩn mà các tổ chức kỹ thuật khác có thể đo lường. Nếu một tác nhân AI có thể giữ một cơ sở mã đa nền tảng lớn gọn gàng với tỷ lệ hợp nhất 46% trong khi các nhà phát triển ngủ, thì tính kinh tế của số lượng nhân viên do bảo trì bắt đầu trông rất khác — và câu hỏi cạnh tranh sẽ chuyển từ việc các nhóm có sử dụng tác nhân mã hóa hay không đến mức độ thường lệ mà họ sẵn sàng chuyển giao.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →