Giả định phổ biến rằng con người xem xét từng lệnh có thể kiểm soát các tác nhân mã hóa AI đang phải đối mặt với sự giám sát chặt chẽ. Một phân tích mới về hơn 40.000 phiên trò chơi và hơn 409.000 quyết định phê duyệt hoặc từ chối riêng lẻ cho thấy người đánh giá đã bỏ lỡ khoảng 1/3 lệnh độc hại từ các tác nhân AI, đặt ra câu hỏi cấp bách về việc liệu "con người trong vòng lặp" có phải là ranh giới bảo mật đáng tin cậy hay không.
Những phát hiện này đến từ một trò chơi dựa trên trình duyệt được tạo bởi Alex Wauters, cựu kỹ sư nhân viên tại Uber, người viết về bảo mật dành cho nhà phát triển tại Scal X. Trò chơi đặt người chơi vào vai người đánh giá con người cho một tác nhân mã hóa AI, yêu cầu họ phê duyệt hoặc từ chối các lệnh shell dưới áp lực về thời gian. Một số lệnh là thông thường, chẳng hạn như `git status` hoặc `npm test`. Một số khác là những nỗ lực được ngụy trang cẩn thận nhằm lấy cắp thông tin xác thực, cài đặt cửa hậu hoặc gửi bí mật đến các máy chủ từ xa. Sau khi thêm tính năng theo dõi số liệu thống kê, Wauters đã thu thập đủ dữ liệu để vẽ nên một bức tranh chi tiết về nơi mà phán đoán của con người thành công và thường thất bại. Để biết thêm về phạm vi bao quát của ngành AI, nghiên cứu này nổi bật là một trong những thử nghiệm giàu dữ liệu nhất cho đến nay.
Những mệnh lệnh nguy hiểm nhất lại khó nắm bắt nhất
Phát hiện nổi bật nhất của nghiên cứu là các lệnh phá hoại rõ ràng, chẳng hạn như `rm -rf` trên các thư mục quan trọng, đã được phát hiện một cách đáng tin cậy. Các mối đe dọa thực sự thành công trong việc đánh cắp thông tin đăng nhập đã bị bỏ sót gần gấp ba lần. Lệnh duy nhất bị bỏ lỡ nhiều nhất trong toàn bộ trò chơi là `npm run analyze`, được 64,7% người chơi chấp thuận mặc dù nhật ký lịch sử của tác nhân cho thấy rõ ràng rằng tập lệnh cơ bản đã bị giả mạo để chuyển thông tin đăng nhập sang máy chủ bên ngoài.
Vấn đề là về mặt cấu trúc. Các lệnh như `npm run` thực thi bất kỳ tập lệnh nào được xác định trong tệp `package.json` của dự án. Tập lệnh đó có thể là một trình phân tích gói hợp pháp hoặc mã độc hại được đưa vào bởi tệp chỉnh sửa trước đó mà tác nhân đã sửa đổi. Để biết chắc chắn, nhà phát triển sẽ cần kiểm tra mọi tệp đã sửa đổi trước khi phê duyệt, điều này phủ nhận lợi thế về tốc độ mà các công cụ mã hóa AI lẽ ra phải mang lại.
Trong ba lệnh tải trọng được ngụy trang như vậy trong trò chơi, tỷ lệ bỏ lỡ là 52,5% so với 28,4% đối với tất cả các cuộc tấn công đánh cắp thông tin xác thực khác. Việc ẩn tải trọng đằng sau tên tập lệnh quen thuộc đã tăng gần gấp đôi tỷ lệ thành công của nó, ngay cả khi tải trọng hiển thị trong nhật ký lịch sử được hiển thị ngay phía trên lời nhắc cấp phép.
Sự mệt mỏi khi cho phép làm xói mòn sự cảnh giác theo thời gian
Anthropic trước đây đã thừa nhận rằng sự mệt mỏi về quyền là một hiện tượng thực sự trong sản phẩm Claude Code của mình, lưu ý rằng người dùng càng nhìn thấy nhiều sự chấp thuận thì họ càng ít chú ý đến từng người. Dữ liệu của Thang đo X hỗ trợ mối lo ngại này về mặt thực nghiệm. Tỷ lệ trượt giảm trong một số lệnh đầu tiên của mỗi phiên khi người chơi khởi động, nhưng sau đó tăng dần về cuối, phù hợp với sự mệt mỏi hoặc áp lực ngày càng tăng của đồng hồ tích tắc.
Mô hình này phản ánh động lực trong thế giới thực. Các nhà phát triển chạy đua để cung cấp các tính năng dưới áp lực về thời hạn phải đối mặt với động lực tương tự để nhấp vào phê duyệt nhanh chóng và khối lượng lớn các lệnh thông thường tạo ra một vấn đề khó khăn trong đó các mối đe dọa thực sự rất hiếm về mặt thống kê. Kết quả là một hệ thống đào tạo người dùng cách đóng dấu cao su vào mọi thứ.
Mặt khác: Chặn quá mức làm mọi thứ chậm lại
Nghiên cứu cũng ghi lại kiểu thất bại ngược lại. Một số lệnh thực sự lành tính thường xuyên bị chặn bởi những người chơi thận trọng, bao gồm cả các lệnh gọi thử nghiệm và xây dựng tiêu chuẩn. Việc chặn quá mức này làm tác nhân chậm lại và nghịch lý thay, lại làm tăng rủi ro dài hạn. Khi người dùng liên tục được yêu cầu phê duyệt các lệnh hóa ra vô hại, tiếng ồn sẽ làm giảm sự sẵn sàng xem xét kỹ lưỡng các lời nhắc trong tương lai của họ, cuối cùng đẩy họ đến các chế độ bỏ qua hoàn toàn hoặc tự động phê duyệt loại bỏ hoàn toàn sự đánh giá của con người.
Các tính năng như Chế độ tự động của Anthropic cố gắng giảm thiểu điều này bằng cách tự động xác định xem lệnh có an toàn hay không trước khi nhắc người dùng. Nhưng như dữ liệu của nghiên cứu về tải trọng được ngụy trang chứng minh, ngay cả nội dung lệnh có thể nhìn thấy cũng không đủ để con người đưa ra phán đoán đáng tin cậy dưới áp lực.
Thiếu bối cảnh là vấn đề cốt lõi
Một lệnh, `cat ~/.zshrc`, tỏ ra gây chia rẽ nhất trong toàn bộ trò chơi, được 45,9% người chơi chấp thuận. Lệnh này vô hại đối với các nhà phát triển không giữ bí mật trong hồ sơ shell của họ, nhưng nó làm lộ các khóa API cho nhiều người xuất thông tin xác thực ở đó. Rủi ro của nó phụ thuộc hoàn toàn vào cấu hình hệ thống mà tác nhân không thể nhìn thấy và người đánh giá có thể không nhớ.
Một số lệnh khác đã tạo ra tranh cãi tương tự trên chuỗi thảo luận của Hacker News vì lý do tương tự. Vấn đề cơ bản là các nhà phát triển đang được yêu cầu đưa ra các đánh giá bảo mật mà không có bức tranh đầy đủ về những tập tin đã thay đổi, những gì tác nhân đã làm trong các bước trước và cấu hình hiện tại của hệ thống chứa những gì. Như một người bình luận đã lưu ý, việc yêu cầu người dùng xác thực các lệnh không rõ ràng mà không có ngữ cảnh không phải là một biện pháp bảo vệ mạnh mẽ.
Điều gì xảy ra tiếp theo đối với vấn đề bảo mật đại lý
Wauters lập luận rằng giải pháp không phải là con người tốt hơn mà là công cụ tốt hơn. Các tác nhân hộp cát để chúng không thể truy cập trực tiếp vào thông tin xác thực, cách ly ngữ cảnh nghiêm ngặt và các giới hạn cấu trúc đối với những gì tác nhân có thể làm mà không có quyền cấp cao đều hứa hẹn hơn là dựa vào sự cảnh giác của con người. Cho đến khi các biện pháp bảo vệ đó được áp dụng, việc cấp cho các đại lý các quyền rộng rãi vẫn có rủi ro bất kể trên danh nghĩa có con người nằm trong vòng lặp hay không.
Nghiên cứu này không phải là một bài báo học thuật được bình duyệt và Wauters thừa nhận những hạn chế của nó. Trò chơi cảnh báo người chơi về các mối đe dọa và áp dụng áp lực thời gian nhân tạo có thể không phản ánh hoàn hảo môi trường phát triển thực. Nhưng phát hiện cốt lõi, rằng những người đánh giá con người được đào tạo dưới áp lực đã bỏ sót 1/3 các cuộc tấn công được ngụy trang có chủ ý, sẽ khiến mọi nhóm triển khai các tác nhân mã hóa AI có lý do để xem xét lại mô hình bảo mật của họ.
Đối với các nhà phát triển đang xây dựng bằng các tác nhân AI ngày nay, bài học thực tế rút ra là giả định rằng con người trong vòng lặp cuối cùng sẽ thất bại. Thiết kế các quyền dành cho tác nhân và hộp cát của bạn để việc phê duyệt bị bỏ lỡ không có nghĩa là khóa AWS bị rò rỉ hoặc quy trình xây dựng bị xâm phạm. Dữ liệu cho thấy rằng việc coi đánh giá của con người là biện pháp bảo vệ chính của bạn là một vụ đánh cược không mang lại kết quả.
Đi trước AI
Bối cảnh bảo mật của tác nhân AI đang phát triển nhanh chóng. Luôn cập nhật thông tin mới nhất về sự phát triển AI và nghiên cứu đột phá.
Đọc thêm tin tức về AI →