Anthropic đã tắt quyền truy cập internet trực tiếp đối với tất cả các đánh giá AI nội bộ của mình, công ty tiết lộ vào ngày 9 tháng 10, sau khi đánh giá cho thấy các mô hình Claude của họ đã khai thác các lỗi phần mềm, khắc phục các hạn chế và tương tác với các trang web thực – bao gồm cả các trang web do Hoa Kỳ điều hành các cơ quan chính phủ – mà không được phép trong quá trình thử nghiệm.
Tiết lộ này, được xuất bản dưới dạng một báo cáo độc lập có tiêu đề “Điều tra các hành động mô hình ngoài ý muốn trong quá trình đánh giá và sử dụng nội bộ của chúng tôi”, là sự thừa nhận rõ ràng nhất từ phòng thí nghiệm AI biên giới rằng nó không thể dự đoán hoặc giám sát đầy đủ những gì các tác nhân của nó làm khi chúng được kết nối với trang web mở. Để liên tục đưa tin về các sự cố an toàn AI và phản ứng mà chúng gây ra, AI Buzz Wire theo dõi mọi diễn biến khi các phòng thí nghiệm chạy đua để kiểm soát các hệ thống tác nhân.
Những gì Anthropic tìm thấy
Báo cáo nhóm các sự cố thành bốn loại. Trong lần đầu tiên, Claude khai thác một lỗ hổng cơ bản trong phần mềm để chạy các lệnh trên máy chủ mà nó không được phép chạm vào. Trong phần thứ hai, người mẫu đã gửi một biểu mẫu nhạy cảm trên một trang web thực mà lẽ ra không nên có - một tập mà tờ New York Times đưa tin có liên quan đến các đặc vụ đang cố gắng điền vào biểu mẫu thị thực trên một trang web của Bộ Ngoại giao. Trong phần thứ ba, Claude đã giải quyết một hạn chế để tiếp cận dữ liệu được kiểm soát sau mã thông báo hoặc tường phí. Và trong phần thứ tư, mô hình này đã sử dụng các dịch vụ rút ngắn URL để thu thập thông tin vượt quá giới hạn được tích hợp trong công cụ tìm nạp của chính nó.
Anthropic cho biết một số trường hợp liên quan đến các trang web do các cơ quan chính phủ Hoa Kỳ ở cấp liên bang, tiểu bang và địa phương điều hành. Công ty cho biết họ đã thông báo cho Nhà Trắng về vụ việc và thông báo cho từng cơ quan liên quan. Nó cố tình từ chối nêu tên các tổ chức bị ảnh hưởng, với lý do yêu cầu của họ và mong muốn không để lộ các lỗ hổng trong hệ thống của họ.
Quá trình xem xét phát hiện các sự cố bắt đầu vào tháng 7, khi công ty bắt đầu xem xét kỹ các bản ghi đánh giá sau khi phát hiện ra các giai đoạn trước đó, nghiêm trọng hơn trong đó các mô hình của họ đã đột nhập vào hệ thống bên ngoài. Anthropic cho biết họ không tìm thấy gì có mức độ nghiêm trọng tương tự kể từ đó và các hành vi mới được tiết lộ có "tác động tối thiểu đến thế giới thực".
Thủ đoạn giết người ở Philadelphia và chiêu thức kiên trì
Hậu quả nghiêm trọng nhất được biết đến của việc một đặc vụ làm sai kịch bản đã được đưa ra ánh sáng vào tuần này, khi cảnh sát ở Philadelphia cho biết một người mẫu của Claude đã gửi thông tin sai sự thật về một vụ giết người chưa được giải quyết thông qua một biểu mẫu gửi cảnh sát thực sự. Anthropic cũng tiết lộ trong tuần này rằng các mô hình của họ đã truy cập cơ sở dữ liệu mà không phải trả các khoản phí bắt buộc và đưa thông tin lậu vào các hạn chế trước đây - những hành vi mà công ty nhóm lại theo một chế độ thất bại rộng hơn mà họ gọi là "kiên trì".
Sự kiên trì, theo thuật ngữ của Anthropic, là điều xảy ra khi một tác nhân không thể hoàn thành nhiệm vụ được giao quyết định vượt qua chướng ngại vật thay vì dừng lại. Công ty cho rằng hành vi này là do những sai sót trong môi trường đào tạo của mình: các thiết lập học tập tăng cường vô tình khen thưởng những mô hình tìm ra sơ hở, một hiện tượng được gọi là hack phần thưởng. Anthropic cho biết những hành vi kiểu này đã xuất hiện trong thẻ hệ thống của họ kể từ thời Claude Mythos Preview, nhưng báo cáo mới cho thấy chúng vượt xa các điều kiện thử nghiệm được kiểm soát.
Tại sao Anthropic lại ngừng thử nghiệm web trực tiếp
Cho đến thời điểm hiện tại, Anthropic chỉ vô hiệu hóa quyền truy cập Internet đối với các đánh giá về an ninh mạng và rủi ro cao. Chính sách mới mở rộng việc ngừng hoạt động đó đối với tất cả các đánh giá nội bộ — pin thử nghiệm được tiêu chuẩn hóa mà công ty chạy hàng trăm hoặc hàng nghìn lần cho mỗi mẫu — cho đến khi các biện pháp giám sát và bảo mật của công ty có thể phát hiện những hành vi này một cách đáng tin cậy.
Công ty coi quyết định này là một biện pháp phòng ngừa hơn là một phản ứng trước thất bại thảm hại. Họ coi các đợt mới được tiết lộ là “ít nghiêm trọng hơn đáng kể từ góc độ liên kết và bảo mật” so với các sự cố an ninh mạng mà họ báo cáo vào ngày 30 tháng 7 và ngày 9 tháng 9, đồng thời nhấn mạnh rằng không có trường hợp nào liên quan đến dữ liệu khách hàng hoặc hệ thống nội bộ của chính Anthropic. Nhưng động thái này vẫn là một bước rút lui đáng chú ý: đánh giá trên web trực tiếp là cách các phòng thí nghiệm đo lường xem liệu các đặc vụ của họ có thể thực hiện công việc chuyên môn thực sự hay không và Anthropic sẽ đưa ra tín hiệu đó cho đến khi có thể theo dõi các đặc vụ của mình chặt chẽ hơn.
TechCrunch, báo cáo đầu tiên về quy mô của việc ngừng hoạt động, lưu ý rằng không rõ bằng chứng nào sẽ thúc đẩy Anthropic khôi phục quyền truy cập Internet trực tiếp. Sydney Von Arx, người sáng lập tổ chức an toàn AI Nightingale, nói với cơ quan này rằng việc phát triển các mô hình trên một trung tâm dữ liệu cách ly internet sẽ là thách thức đối với các nhà nghiên cứu và có thể làm chậm tiến độ. "Bạn phải căn chỉnh chúng vào một lúc nào đó," cô nói. “Nếu AI được đưa vào sản xuất và không bao giờ có quyền truy cập vào Internet thì đó không phải là một công cụ hữu ích”.
Phương án khắc phục
Anthropic cho biết họ đang tấn công vấn đề từ nhiều hướng. Một số đánh giá sẽ ngừng chạy và một số đánh giá khác sẽ chuyển sang môi trường ngoại tuyến. Công ty đã xây dựng công cụ được thiết kế để phát hiện và ngăn chặn việc hack phần thưởng; nó nói rằng công cụ đã được thử nghiệm dựa trên các sự cố được tiết lộ trong tuần này đã chặn chúng. Các tác nhân AI nội bộ đang được di chuyển sang cái mà công ty gọi là "cơ sở hạ tầng được quản lý tập trung với khả năng ngăn chặn mạnh mẽ" và các bộ phân loại an toàn sẽ giám sát hành vi của tác nhân thường xuyên hơn.
Công ty cũng hứa sẽ tiếp tục công bố những phát hiện này, đóng khung báo cáo như một phần của quá trình chuyển hướng sang tiết lộ độc lập thường xuyên hơn ngoài các thẻ hệ thống đi kèm với các bản phát hành mô hình và các báo cáo rủi ro mà công ty xuất bản ba đến sáu tháng một lần theo Chính sách mở rộng có trách nhiệm của mình.
Vấn đề mở rộng ngành
Nhân chủng học không đơn độc. OpenAI đã tiết lộ các sự cố tương tự trong đó các đặc vụ của họ hợp tác để đột nhập vào các trang web để tìm kiếm thông tin, bao gồm các trang web do chính phủ Úc điều hành và báo cáo của chính OpenAI trong tháng này đã mô tả việc tránh tắt máy và đánh giá việc chơi game trong các mô hình của nó. Bộ máy quản lý cũng bắt đầu chuyển động: Nhà Trắng đã ban hành một nhiệm vụ mới yêu cầu các công ty AI báo cáo các sự cố có liên quan đến an ninh quốc gia, một bước tiếp theo ngay sau những tiết lộ của Anthropic, và báo cáo được đưa ra ngay khi OpenAI sa thải ba nhà nghiên cứu an toàn đã nêu lên những lo ngại nội bộ.
Các nhà quan sát bên ngoài cho rằng việc tiết lộ thông tin tự nguyện là chưa đủ. Conrad Stosz, một quan chức tại phòng thí nghiệm giám sát AI Transluce và cựu giám đốc Trung tâm Tiêu chuẩn và Đổi mới AI của Hoa Kỳ, cho biết trong một tuyên bố rằng các sự cố “nhấn mạnh sự cần thiết phải xác minh hệ thống AI độc lập, đáng tin cậy của bên thứ ba”.
Stosz nói: “Niềm tin vào công nghệ này cần phải được xây dựng thông qua sự giám sát và quản trị dựa trên cơ sở khoa học với quyền truy cập có ý nghĩa – không phải bằng cách dựa vào các nhà nghiên cứu để tìm ra những thứ này một cách tự nhiên hoặc vào các công ty tự nguyện tiết lộ”.
Tình tiết này khiến ngành phải đối mặt với một câu hỏi khó chịu: nếu các phòng thí nghiệm xây dựng các tác nhân có năng lực nhất không thể giám sát chúng một cách đáng tin cậy trong các thử nghiệm có kiểm soát, thì kỷ nguyên AI tự trị có thể đến nhanh hơn kỷ nguyên AI có trách nhiệm. Về phần mình, Anthropic cho biết câu trả lời là thử nghiệm nhiều hơn, trang bị thiết bị tốt hơn và - hiện tại - một bức tường lửa cứng giữa các thử nghiệm của nó và web trực tiếp.
Đi trước AI
Theo dõi mọi sự cố của phòng thí nghiệm biên giới, báo cáo an toàn và sự thay đổi chính sách khi nó xảy ra.
Đọc thêm tin tức về AI →