Anthropic đã công bố cái nhìn đầu tiên về lộ trình phát triển của riêng mình trong tuần này, tiết lộ rằng mô hình Claude của họ hiện "dẫn đầu" 26% công việc nghiên cứu và phát triển AI tại công ty - tăng từ mức dưới 1% vào tháng 2 năm 2026. Các số liệu xuất hiện trong một bài đăng trên blog của công ty có tiêu đề "Các phép đo để hiểu tốc độ phát triển AI trong các phòng thí nghiệm ở biên giới", do Anthropic xuất bản vào ngày 17 tháng 9 và được đưa tin bởi Reuters, The Washington Post và các cơ quan báo chí khác.
Bài đăng một phần là một bài tập minh bạch và một phần là một lập luận: Anthropic muốn các phòng thí nghiệm biên giới khác công bố các loại số tương tự, để công chúng và chính phủ có thể theo dõi xem AI được trao chìa khóa xây dựng AI nhanh như thế nào. For more context on this story, see our ongoing AI trends.
Ba con số để theo dõi sự phát triển AI
Công ty đã đề xuất ba phép đo mà họ cho là làm sáng tỏ tốc độ phát triển bên trong các phòng thí nghiệm biên giới: mức độ R&D AI được thực hiện bởi chính AI, mức độ giám sát hành động của các tác nhân AI và cách phân bổ điện toán giữa công việc năng lực và công việc an toàn.
Con số tiêu đề xuất phát từ cái mà Anthropic gọi là Chỉ số Tự động hóa R&D. Công ty đã lập danh mục mọi loại công việc R&D AI được thực hiện tại công ty, đánh giá mức độ tự động hóa của từng nhiệm vụ hiện tại và tổng hợp kết quả bằng thang đo do nhóm nghiên cứu Epoch AI phát triển. Thang đo chạy từ AL0 (không có sự tham gia của AI) đến AL5 (AI hoạt động hoàn toàn tự động, không có con người trong vòng lặp), với AL3 có nghĩa là AI "cộng tác" trên khối lượng lớn công việc dưới sự chỉ đạo chặt chẽ của con người và AL4 có nghĩa là AI "dẫn đầu", hoàn thành hầu hết nhiệm vụ từ đầu đến cuối từ lời nhắc cấp cao trong khi con người giám sát.
Tính đến tháng 8 năm 2026, Anthropic đưa tin, Claude lãnh đạo 26% công việc R&D AI của công ty. Tỷ lệ công việc bằng hoặc cao hơn cấp độ "Cộng tác AI" là trên 90%. Claude không hoạt động hoàn toàn tự chủ đối với bất kỳ tập hợp con đo lường nào của công việc R&D AI.
30.000 đại lý, một người giám sát
Phép đo thứ hai liên quan đến việc giám sát. Anthropic tiết lộ rằng tính đến tháng 8 năm 2026, có khoảng 30.000 đại lý thực hiện công việc nghiên cứu và kỹ thuật tại công ty bất cứ lúc nào trên nền tảng nội bộ được sử dụng nhiều nhất.
Theo bài đăng, mọi hành động mà các đặc vụ đó thực hiện đều đi qua một màn hình trực tuyến trước khi được thực thi, thường trong vòng vài giây. Anthropic cho biết họ đã phân tích hơn một tỷ quyết định từ các đại lý nghiên cứu và kỹ thuật của mình trong tháng 8 và phát hiện ra rằng tỷ lệ các hoạt động bị người giám sát chặn hoặc leo thang là 0,002%.
Về phân bổ điện toán, phép đo thứ ba, công ty cho biết trong tuần được kiểm tra, khoảng 6% lượng điện toán dành cho R&D AI được phân bổ cho mục đích an toàn.
Xây dựng người kế thừa của chính nó — Với sự giám sát của con người
Khung hình cũng quan trọng như các con số. Các mô hình của Anthropic đang ngày càng tham gia nhiều hơn vào việc xây dựng thế hệ tiếp theo của những mô hình tương tự đó - điều mà các nhà nghiên cứu gọi là sự tự cải thiện đệ quy và tiêu đề của The Washington Post mô tả thẳng thắn hơn là một chatbot "tiếp quản công việc xây dựng người kế nhiệm của chính nó".
Anthropic cẩn thận vạch ra ranh giới giữa “AI dẫn đầu” và “AI thay thế”. Tại AL4, con người vẫn giám sát và có thể can thiệp; công ty đã báo cáo rõ ràng rằng không có tập hợp con đo lường nào của công việc R&D của họ chạy ở AL5. Nhưng quỹ đạo rất dốc: tăng từ dưới 1% lên 26% trong khoảng bảy tháng cho thấy tỷ lệ công việc do AI dẫn đầu có thể vượt qua một nửa trước cuối thập kỷ nếu xu hướng hiện tại được giữ nguyên.
Phương pháp này có những giới hạn thực sự và Anthropic đã nói như vậy. Xếp hạng tự động hóa của nó được tạo ra bằng cách lấy mẫu hồ sơ công việc của chính công ty - bao gồm các tin nhắn Slack và tài liệu nội bộ - và có cả con người và mô hình thẩm phán đánh giá mức độ tự động hóa của từng nhiệm vụ. Trong một bài kiểm tra mù, nhân viên đánh giá các nhiệm vụ mà không biết các mô hình đã thu thập được bằng chứng gì. Công ty báo cáo rằng giám khảo mô hình của họ đã đồng ý với con người với tần suất tương đương với mức độ con người đồng ý với nhau: tỷ lệ đồng ý chính xác giữa mô hình với con người là 59%, trong khi tỷ lệ đồng ý giữa con người với con người chỉ là 35% và xếp hạng giữa mô hình và con người đạt cùng cấp độ với nhau trong 97% thời gian.
Công ty cũng thừa nhận rủi ro tự tham chiếu trong phương pháp riêng của mình: Anthropic đã sử dụng các mô hình của riêng mình để giúp đánh giá hệ thống của mình, điều này có thể có nghĩa là mô hình đánh giá mắc phải các loại lỗi giống như mô hình mà nó đang kiểm tra. Họ lập luận rằng sự xác minh của bên thứ ba mới là câu trả lời thực sự.
Ánh mắt bên ngoài đang tới
Để đạt được mục tiêu đó, Anthropic cho biết họ có kế hoạch đưa những người đánh giá bên thứ ba độc lập từ nhiều tổ chức vào bên trong công ty, cho phép họ truy cập vào các quy trình, hệ thống và dữ liệu nội bộ có thể so sánh với những gì mà nhóm đánh giá rủi ro nội bộ có. Tổ chức phi lợi nhuận nghiên cứu AI bên ngoài METR trước đây đã hợp tác với nền tảng giám sát ngoại tuyến của Anthropic.
Tiết lộ này được đưa ra trong bối cảnh cuộc tranh luận đang leo thang về nhịp độ. Giám đốc điều hành của Anthropic Dario Amodei đã kêu gọi phối hợp để làm chậm biên giới và công ty lưu ý rằng các con số của chính họ dự kiến sẽ thay đổi nếu sự phối hợp đó tồn tại. Tuần này, Anthropic và OpenAI cũng là chủ đề của một lá thư công khai từ các chuyên gia an toàn lập luận rằng các phòng thí nghiệm cần những người đánh giá an toàn thực sự độc lập.
Liệu các đối thủ có đi theo sự dẫn dắt của Anthropic hay không vẫn là một câu hỏi mở. Công ty lập luận rằng bất kỳ nhà phát triển biên giới nào cũng có thể công bố các biện pháp này thường xuyên bằng cách sử dụng phương pháp công khai. Cho đến khi họ làm được điều đó, những con số công khai duy nhất về tốc độ xây dựng AI của AI đều đến từ chính các phòng thí nghiệm.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →