Anthropic đã xuất bản một tài khoản kỹ thuật chi tiết về cách họ tạo ra Claude.ai và ứng dụng máy tính để bàn Claude nhanh hơn khoảng ba lần trong thời gian chạy nước rút hai tuần, và điều đáng chú ý là hầu hết công việc đều do chính Claude thực hiện. Bài đăng được xuất bản trên blog kỹ thuật của Anthropic, mô tả một chiến dịch hiệu suất được chạy từ một kênh Slack duy nhất với mô hình AI trong mọi luồng, tìm ra các điểm nghẽn, xây dựng điểm chuẩn, cải tiến vận chuyển và theo dõi mọi hoạt động triển khai.

Những con số được đo ở phân vị thứ 75 là rất đáng kể. Thời gian để đánh máy một trang trên claude.ai mới tải đã giảm từ 3,1 giây xuống 0,55 giây. Thời gian bắt đầu phiên Claude Code mới giảm từ 0,8 giây xuống 0,3 giây và tải phiên đám mây Claude Cowork giảm từ 2,6 giây xuống 0,73 giây. Tổng hợp lại, Anthropic ước tính những cải tiến này giúp tiết kiệm hàng chục nghìn giờ chờ đợi của người dùng mỗi ngày. For more context on this story, see our ongoing AI news.

Đo trước rồi mới di chuyển

Chạy nước rút bắt đầu bằng việc đo lường thay vì viết mã. Sử dụng Claude để phân tích dữ liệu sử dụng thông qua máy chủ Datadog MCP, nhóm đã xác định được bốn hành trình của người dùng chiếm 95% hoạt động: khởi chạy ứng dụng, bắt đầu cuộc trò chuyện, tải cuộc trò chuyện hiện có và gửi tin nhắn. Trên web và máy tính để bàn, những hành trình đó được chia thành 13 phép đo riêng biệt và nhóm đã thêm công cụ đo lường cho đến khi mỗi phép đo có thể so sánh trực tiếp — bắt đầu từ tương tác của người dùng và kết thúc khi kết quả được hiển thị.

Với các đường cơ sở đã có sẵn, nhóm đã lập ra một danh sách khoảng 20 dự án được chọn lọc kỹ lưỡng, mỗi dự án nhắm đến một hành trình cụ thể và yêu cầu Claude ước tính tác động của từng dự án tính bằng mili giây để đặt mục tiêu chạy nước rút. Kế hoạch đã thành công sớm: Các báo cáo của nhân loại đã đánh trúng 12 trong số 13 mục tiêu vào ngày thứ ba. Điều đó để lại cơ hội cho Claude xác định các cơ hội tiếp theo và đề xuất quy trình làm việc mới, nhanh chóng đưa vào các dự án đầy đủ của riêng họ và đẩy kết quả vượt xa mục tiêu ban đầu.

Những gì thực sự đã được vận chuyển

Những thay đổi kỹ thuật giống như một danh sách kiểm tra hiệu suất web hiện đại. Để khởi chạy nhanh hơn, nhóm đã đưa một trình soạn thảo tĩnh vào HTML để người dùng có thể bắt đầu nhập trong quá trình khởi tạo React, đồng thời biên dịch trước bộ đệm mã V8 để quy trình chính của shell máy tính để bàn không còn biên dịch lại từ đầu khi khởi động. Để điều hướng nhanh hơn giữa các cuộc hội thoại, trình soạn thảo vẫn được gắn thay vì bị phá bỏ và xây dựng lại, các phiên được tìm nạp trước khi người dùng di chuột qua chúng và khả năng hiển thị lại thanh bên đã giảm 90%.

Theo bài đăng, quy mô của lịch sử hợp nhất là con số tiêu đề: hơn ba nghìn thay đổi đã diễn ra trong giai đoạn chạy nước rút mà không có một sự cố hoặc sự quay lui nào xảy ra với khách hàng.

Claude Tag: một đặc vụ có rào chắn

Chạy nước rút chạy trên cái mà Anthropic gọi là Claude Tag, hiện đang ở giai đoạn thử nghiệm và được mô tả là một mô hình nghiên cứu nội bộ gần giống với Opus 5.5. Sự phân công lao động là phần có hậu quả nhất của câu chuyện. Claude đã tìm ra các điểm nghẽn, xây dựng điểm chuẩn, triển khai các bản sửa lỗi và giám sát mọi hoạt động triển khai — hoạt động không đồng bộ trong nhiều giờ liền, thậm chí qua đêm. Con người đặt ra các mục tiêu, thực hiện sự cân bằng và chấp thuận mọi thay đổi trước khi nó hợp nhất.

Nhóm cũng muốn lặp lại nhanh hơn nhịp triển khai của mình, vì vậy, họ đã xây dựng các phép đo trong phòng thí nghiệm dưới dạng proxy cho các lần đọc trong thế giới thực. Trong số các câu hỏi mà các kỹ sư đã đặt ra: liệu số lượng lệnh JavaScript có thể thay thế thời gian của đồng hồ treo tường như một tín hiệu phản hồi nhanh hơn để xác thực các nguyên mẫu trước khi triển khai không?

Tại sao nó lại quan trọng đối với kỹ thuật được hỗ trợ bởi AI

Bài đăng của Anthropic ít gây chú ý hơn về các tối ưu hóa cụ thể — shell tĩnh, tìm nạp trước và giảm hiển thị là các kỹ thuật đã được thiết lập — hơn là những gì nó thể hiện về sự phát triển dựa trên AI ở quy mô sản xuất. Một phòng thí nghiệm ở biên giới vừa thực hiện một cuộc đại tu hiệu suất gồm ba nghìn thay đổi của một sản phẩm tiêu dùng hàng đầu với các tác nhân AI thực hiện phần lớn công việc nhận dạng, triển khai và xác minh, trong khi con người vẫn giữ quyền phê duyệt đối với mọi thay đổi.

Kết quả cũng nằm trong bối cảnh cạnh tranh trong đó khả năng đáp ứng là một đặc tính của sản phẩm. Claude cạnh tranh trực tiếp với ChatGPT của OpenAI và Gemini của Google để thu hút sự chú ý của người tiêu dùng và nhà phát triển, đồng thời nhận thấy tốc độ định hình việc sử dụng các sản phẩm trợ lý hàng ngày cũng như chất lượng mô hình. Việc cắt giảm thời gian tương tác từ 3,1 giây xuống 0,55 giây sẽ giải quyết những khiếu nại phổ biến nhất của người dùng về sản phẩm.

Đối với các nhóm kỹ thuật quan sát từ bên ngoài, bài học có thể chuyển giao từ tài khoản của Anthropic là cấu trúc vòng lặp: đo lường hành trình của người dùng một cách chính xác, để mô hình đề xuất và xác thực các thay đổi so với các phép đo đó, duy trì cổng phê duyệt của con người và chỉ mở rộng phạm vi nhanh nhất có thể mà hệ thống đo lường có thể xác minh. Định nghĩa riêng của Anthropic là một khi Claude có thể đo được thứ gì đó thì nó có thể làm cho nó nhanh hơn — vì vậy nhóm tiếp tục tìm thêm thứ để đo.

Liệu các hoạt động chạy nước rút do tác nhân điều khiển tương tự có trở thành thông lệ tiêu chuẩn trong toàn ngành công nghiệp phần mềm hay không vẫn còn phải xem, nhưng Anthropic đã cung cấp một trong những điểm dữ liệu công khai cụ thể nhất mà chúng có thể hoạt động trên quy mô lớn. Độc giả theo dõi cách AI đang định hình lại quá trình phát triển phần mềm có thể theo dõi phạm vi nghiên cứu AI của chúng tôi để biết những phát triển tiếp theo.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →