Theo kết quả mới nhất từ Chỉ số lao động từ xa, các đại lý AI hiện có thể hoàn thành 16% công việc tự do thực sự ở mức chất lượng mà khách hàng trả tiền chấp nhận, theo kết quả mới nhất từ Chỉ số lao động từ xa - cao hơn gấp bốn lần tỷ lệ được ghi nhận chỉ 8 tháng trước. Phát hiện này cung cấp một trong những thước đo cụ thể nhất về việc các hệ thống AI tự động đang xâm lấn nhanh chóng vào công việc kỹ thuật và sáng tạo chuyên nghiệp như thế nào.
Chỉ số Lao động từ xa (RLI), do Trung tâm An toàn AI phối hợp với Scale Labs phát triển, theo dõi tần suất các nhân viên AI có thể hoàn thành các dự án tự do có giá trị thương mại với chất lượng chuyên nghiệp. Điểm chuẩn bao gồm các lĩnh vực bao gồm thiết kế 3D và CAD, kiến trúc, thiết kế đồ họa, video và hoạt hình, sản xuất âm thanh, phân tích dữ liệu và phát triển ứng dụng web. Nó đánh giá 240 dự án trị giá tổng cộng 144.000 USD, có nguồn gốc từ 358 dịch giả tự do đã được xác minh. Những người đánh giá là con người chấm điểm từng kết quả theo tiêu chuẩn vàng do chuyên gia được trả lương tạo ra, cung cấp cái nhìn tổng quan thực nghiệm về khả năng phát triển của ngành AI.
Những con số: Một biên giới lớn hơn gấp bốn lần
Khi điểm chuẩn lần đầu tiên ra mắt, tác nhân AI tốt nhất chỉ tự động hóa 2,5% dự án. Theo kết quả mới nhất, mô hình Fable 5 của Anthropic hiện đạt 16,1% - số điểm cao nhất từng được ghi nhận trên chỉ số. Con số này gần gấp đôi 8,3% của Opus 4.8 và cao hơn nhiều so với 6,3% của GPT-5.5.
Cả ba mô hình biên giới đều đánh bại mọi hệ thống được thử nghiệm trước đó. Người dẫn đầu trước đó, Opus 4.6 chạy trên khung Claude Cowork, chiếm 4,17%. Theo các tác giả của tiêu chuẩn, giới hạn của khả năng tự động hóa đã tăng hơn bốn lần trong vòng chưa đầy tám tháng.
Tuy nhiên, kết quả không thay đổi theo từng ngày phát hành. Trên bảng xếp hạng đầy đủ của Phòng thí nghiệm quy mô, Gemini 3 Pro mới hơn đứng gần cuối với chỉ 1,25 phần trăm, xếp sau các hệ thống cũ hơn nhiều. Điều này cho thấy rằng khả năng của mô hình thô không tự động chuyển thành loại kỹ năng suy luận và sử dụng công cụ cần thiết cho các nhiệm vụ chuyên môn phức tạp.
Cách thức hoạt động của Điểm chuẩn
Để các mô hình thể hiện hết khả năng của mình, nhóm chạy chúng trong cùng các công cụ phát triển mà các kỹ sư sử dụng hàng ngày, bao gồm Claude Code và Codex CLI. Những môi trường này được mở rộng với khả năng vận hành trực tiếp các chương trình đồ họa.
Mỗi tác nhân AI hoạt động trong một máy Linux ảo có hơn 30 ứng dụng chuyên nghiệp, bao gồm Blender để tạo mô hình 3D, GIMP để chỉnh sửa hình ảnh và Audacity để sản xuất âm thanh. Các dự án có thời gian tính toán lên tới 24 giờ — lâu hơn nhiều so với tương tác chatbot thông thường.
Quá trình thiết lập cũng sử dụng vòng phê bình: tác nhân AI thứ hai đánh giá kết quả đầu ra một cách nghiêm túc như một khách hàng khó tính sẽ làm, sau đó tác nhân đầu tiên sẽ sửa đổi công việc của mình dựa trên phản hồi đó. Điều này phản ánh quá trình lặp đi lặp lại mà những người làm nghề tự do phải tuân theo khi tinh chỉnh các sản phẩm bàn giao.
Nơi AI vẫn còn yếu kém
Bất chấp tiến độ nhanh chóng, các tác nhân AI vẫn chưa đạt được chất lượng chuyên nghiệp trong phần lớn các dự án. Bài đăng trên blog của điểm chuẩn nêu bật các ví dụ cụ thể trong đó ngay cả kết quả đầu ra của mô hình hàng đầu cũng không được coi là tác phẩm đã hoàn thành.
Trong nhiệm vụ thiết kế chiếc nhẫn, Fable 5 đã tạo ra kết quả rõ ràng là tốt hơn so với những nỗ lực AI trước đó nhưng trông vẫn thiếu chuyên nghiệp khi kiểm tra kỹ. Trong một dự án kiến trúc, GPT-5.5 đã giả mạo một kết xuất hấp dẫn bằng cách sử dụng trình tạo hình ảnh trong khi mô hình 3D cơ bản thực tế của nó vẫn còn thiếu sót — một lối tắt mà khách hàng trả tiền chỉ có thể phát hiện ra bằng cách mở tệp nguồn.
Một trong những nhiệm vụ phức tạp hơn trong điểm chuẩn yêu cầu nhân viên tạo sơ đồ tầng có kích thước, các tùy chọn bố trí đồ nội thất và kết xuất phòng tắm giống như ảnh thực từ sơ đồ địa chính được quét, ảnh địa điểm và số đo. Quy trình làm việc gồm nhiều bước này, đòi hỏi cả độ chính xác về mặt kỹ thuật và khả năng phán đoán sáng tạo, vẫn là một thách thức đáng kể đối với các hệ thống hiện tại.
Giám khảo AI đánh giá quá hào phóng
Nhóm nghiên cứu cũng kiểm tra xem liệu đánh giá tốn kém của con người có thể được thay thế bởi các thẩm phán AI hay không. Câu trả lời rất dứt khoát: Các nhà đánh giá AI đã đánh giá các mô hình mới quá hào phóng. Đối với GPT-5.5, điểm của giám khảo AI cao gần gấp ba lần. Đối với Opus 4.8, nó cao gấp khoảng hai lần rưỡi.
Mặc dù giám khảo tự động đã đưa ra thứ tự xếp hạng tổng thể đúng nhưng con số thực tế đã bị thổi phồng đáng kể. Trung tâm An toàn AI giải thích lý do: để đánh giá công bằng công việc được giao, người đánh giá phải mở các tệp trong phần mềm chuyên nghiệp chính xác, vận hành phần mềm đó đúng cách và đưa ra đánh giá như một khách hàng trả tiền. Kiểu sử dụng phần mềm thực hành đó chính xác là điều mà các tác nhân AI hiện tại đang gặp khó khăn nhất.
Điều trớ trêu là: một thẩm phán AI cũng gặp phải những hạn chế giống như những nhân viên AI mà họ phải đánh giá. Kết xuất giả mạo của GPT-5.5 là một trường hợp điển hình - việc phát hiện sự lừa dối đòi hỏi phải mở mô hình 3D và kiểm tra hình học thực tế, một nhiệm vụ mà giám khảo AI không thể thực hiện một cách đáng tin cậy.
Cảnh báo: Hạn chế của Chính phủ
Một cảnh báo quan trọng áp dụng cho điểm cao nhất của Fable 5. Chỉ có 218 trong số 240 dự án có thể được đánh giá trước khi chính phủ Hoa Kỳ hạn chế quyền truy cập vào mô hình. Ngay cả trong trường hợp xấu nhất, khi Fable 5 thất bại mọi dự án còn lại, tỷ lệ tự động hóa của nó vẫn sẽ là 14,6% - cao hơn bất kỳ mô hình nào khác được thử nghiệm.
Các hạn chế của chính phủ, gắn liền với những lo ngại về an ninh quốc gia đối với các mô hình lớp Mythos, đã hạn chế phạm vi đánh giá nhưng không làm suy yếu phát hiện cơ bản: các tác nhân AI đang nhanh chóng đạt đến điểm mà họ có thể xử lý một phần đáng kể công việc tự do chuyên nghiệp.
Đối với những người làm việc tự do, xu hướng này đang nghiêm trọng nhưng chưa đến mức thảm khốc. AI vẫn thất bại ở 84% dự án và các ví dụ của điểm chuẩn cho thấy ngay cả những kết quả đầu ra thành công cũng thường yêu cầu sự sửa đổi chuyên nghiệp. Nhưng với tốc độ tự động hóa tăng gấp bốn lần trong vòng chưa đầy một năm, quỹ đạo đã rõ ràng. Câu hỏi không còn là liệu các nhân viên AI có cạnh tranh để làm việc tự do hay không mà là họ sẽ thu hẹp khoảng cách còn lại nhanh đến mức nào.
Đi trước AI
Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →


