Các nhà nghiên cứu đã chứng minh một cuộc tấn công mới mạnh mẽ chống lại các mô hình AI lý luận khai thác điểm mù cơ bản trong cách các mô hình ngôn ngữ lớn (LLM) tách các hướng dẫn khỏi dữ liệu. Kỹ thuật này, được gọi là Giả mạo chuỗi suy nghĩ (CoT), đánh lừa một mô hình xử lý văn bản do kẻ tấn công cung cấp như thể đó là lý luận nội bộ riêng tư của mô hình, cho phép văn bản ghi đè các hướng dẫn hợp pháp.
Những phát hiện được báo cáo bởi Hackaday nhấn mạnh lý do tại sao việc bảo vệ hệ thống AI khỏi bị thao túng vẫn là một vấn đề chưa được giải quyết. Để theo dõi các mối đe dọa mới nổi trong lĩnh vực này, hãy theo dõi thông tin về ngành AI của chúng tôi để biết thông tin phân tích liên tục.
Nguyên nhân cốt lõi: Sự nhầm lẫn về vai trò
Trọng tâm của lỗ hổng này là điều mà các nhà nghiên cứu mô tả là “sự nhầm lẫn về vai trò”. LLM hiện đại nhận tất cả thông tin đầu vào—quy tắc hệ thống, yêu cầu của người dùng và lý luận chuỗi suy nghĩ của chính mô hình—thông qua một kênh văn bản duy nhất. Để áp đặt trật tự, nhà phát triển sử dụng các thẻ siêu dữ liệu như `
Thẻ `
Cách thức hoạt động của cuộc tấn công
Điều quan trọng là CoT Forgery không chỉ đơn giản là việc gói một lời nhắc độc hại bên trong các thẻ `
Theo Hackaday, điều này khiến LLM chấp nhận lý luận phi logic một cách rõ ràng như một kết luận được bỏ qua, thay đổi phản hồi của nó đối với yêu cầu của người dùng. Bởi vì nội dung giả mạo được coi là suy nghĩ nội bộ có độ tin cậy cao chứ không phải là thông tin đầu vào của người dùng có độ tin cậy thấp, nên nó có thể vượt qua các biện pháp bảo vệ an toàn thường chặn các hướng dẫn thao túng.
Hệ thống phân cấp niềm tin bên trong LLM
Hiểu lý do tại sao cuộc tấn công thành công đòi hỏi phải hiểu vai trò hoạt động như thế nào. Dưới lớp vỏ bọc, các vai trò phân chia đầu vào của mô hình thành một hệ thống phân cấp có tổ chức. Các hướng dẫn trong một vai trò được tuân theo miễn là chúng không xung đột với các hướng dẫn có mức độ ưu tiên cao hơn. Ví dụ: chỉ thị cấp hệ thống "không thảo luận về các hoạt động bất hợp pháp" có nghĩa là ghi đè yêu cầu của người dùng về việc cung cấp công thức bị cấm. Vai trò `
Sự cố xảy ra do mô hình không thực thi hệ thống phân cấp đó một cách máy móc. Thay vào đó, nó suy ra văn bản nào thuộc về vai trò nào một phần từ các tín hiệu văn phong. Như cuộc thảo luận của cộng đồng về nghiên cứu đã lưu ý, nếu văn bản có khuôn mẫu giống như bối cảnh suy nghĩ, thì mô hình có thể nhầm bất kỳ văn bản nào có cấu trúc tương tự là lý do thực sự—và văn bản suy nghĩ có mức độ ưu tiên cao hơn văn bản người dùng thông thường.
Một mô hình quen thuộc với một bước ngoặt mới
Nghiên cứu dựa trên một điểm yếu đã được thừa nhận từ lâu trong hệ thống AI: tiêm nhanh. Các cuộc tấn công ban đầu khai thác thực tế là LLM không có luồng riêng biệt cho hướng dẫn và dữ liệu, do đó, cụm từ như "bỏ qua tất cả các hướng dẫn trước đó" đôi khi có thể chiếm quyền điều khiển hành vi của mô hình. Việc giới thiệu các vai trò và thẻ siêu dữ liệu nhằm giảm thiểu điều này bằng cách tạo ra hệ thống phân cấp tin cậy.
Sự giả mạo CoT chứng tỏ rằng việc giảm thiểu chưa đầy đủ. Miễn là các mô hình đánh giá độ tin cậy của văn bản một phần bằng các đặc điểm văn phong của nó thay vì hoàn toàn bằng siêu dữ liệu cấu trúc của nó, những kẻ tấn công có thể bắt chước đúng văn bản có thể nâng cao thẩm quyền nhận thức của đầu vào của họ.
##Tại sao khó sửa
Các nhà nghiên cứu, Charles Ye, Jasmine Cui và Dylan Hadfield-Menll, lập luận rằng nhận thức về vai trò trong LLM không phải là thuộc tính nhị phân có thể được thực thi một cách rõ ràng. Các mô hình học cách diễn giải các thẻ thông qua đào tạo thay vì thông qua các quy tắc được mã hóa cứng, có nghĩa là hành vi của chúng được định hình bởi các mẫu trong dữ liệu—và các mẫu có thể được bắt chước.
Cuộc thảo luận của cộng đồng về công việc, được Hackaday nhấn mạnh, đã đưa ra một chủ đề lặp đi lặp lại: cách khắc phục rõ ràng nhất sẽ yêu cầu các mô hình xử lý các đầu vào đáng tin cậy thông qua các lộ trình riêng biệt về mặt cấu trúc thay vì dựa vào các dấu hiệu dựa trên phong cách, đã học được. Cho đến khi điều đó xảy ra, việc bảo vệ chống lại các cuộc tấn công kiểu tiêm chích kịp thời có thể sẽ vẫn là một quá trình đang phát triển hơn là một vấn đề đã được giải quyết.
Ý nghĩa rộng hơn
Lỗ hổng quan trọng hơn các cuộc trình diễn trong phòng thí nghiệm. Các mô hình lý luận ngày càng được triển khai nhiều hơn trong các hệ thống tác nhân có thể duyệt web, thực thi mã và thực hiện hành động thay mặt người dùng. Nếu kẻ tấn công có thể giả mạo kết luận nội bộ của mô hình, chúng có thể điều khiển những hành động đó tới những kết quả không mong muốn hoặc có hại. Rủi ro tăng lên khi các mô hình có được nhiều quyền tự chủ hơn và khả năng tiếp cận các công cụ hơn. Các nhà nghiên cứu lưu ý rằng con người vẫn thông minh và sáng tạo, và miễn là các mô hình thiếu sự tách biệt kiến trúc rõ ràng giữa văn bản đáng tin cậy và không đáng tin cậy, những kẻ tấn công kiên quyết sẽ tiếp tục tìm cách làm mờ ranh giới. Bài báo coi thách thức này không phải là một lỗi cần vá mà giống một thuộc tính cấu trúc của các hệ thống học hành vi của chúng từ dữ liệu thay vì từ các quy tắc được mã hóa cứng.
Bài báo hoàn chỉnh có sẵn trên arXiv và các nhà nghiên cứu đã xuất bản các ví dụ mã trên GitHub để các nhà phát triển có thể kiểm tra xem hệ thống của họ có dễ bị tấn công hay không.
Đi trước AI
Để biết thêm về nghiên cứu an toàn AI, các lỗ hổng bảo mật và ranh giới của các mô hình ngôn ngữ lớn, hãy truy cập AI Buzz Wire.
Đọc thêm tin tức về AI →


