Google DeepMind đã công bố vào ngày 27 tháng 8 cái mà họ gọi là đánh giá mù đôi đầu tiên trên thế giới về một mô hình AI cấp cao, độc quyền - một thiết lập mật mã được thiết kế để cho phép các chuyên gia bên ngoài kiểm tra các mô hình của Google mà không bên nào nhìn thấy bí mật của bên kia.

Phi công, được mô tả trong một bài đăng trên blog DeepMind của William Isaac, Sol Messing và Kristian Lum, chạy mô hình Gemini Flash Lite thông qua các tiêu chuẩn bí mật bên trong một môi trường an toàn bằng mật mã. Google DeepMind đang hợp tác với Viện An toàn AI Singapore, OpenMined, AVERI và MLCommons trong nỗ lực này và đã xuất bản một báo cáo kỹ thuật mô tả phương pháp luận.

Thông báo giải quyết một trong những điểm yếu dai dẳng nhất trong đánh giá AI: ô nhiễm điểm chuẩn. Đối với những độc giả theo dõi tin tức nghiên cứu AI, đây là một trong những nỗ lực cụ thể hơn nhằm giúp quá trình thử nghiệm mô hình của bên thứ ba trở nên rõ ràng và có thể xác minh được.

Vấn đề ô nhiễm, được giải thích

DeepMind mở đầu thông báo của mình bằng một ví dụ về lớp học. Nếu một học sinh vô tình nhìn thấy trước đề thi thì điểm tuyệt đối chẳng có nghĩa lý gì. Logic tương tự cũng áp dụng cho các mô hình biên giới: nếu một mô hình đã được đưa ra các câu hỏi trong điểm chuẩn — thông qua dữ liệu huấn luyện, bộ đánh giá bị rò rỉ hoặc tối ưu hóa trước đó — thì điểm số thu được có thể phóng đại quá mức khả năng thực tế.

Đây không phải là một mối quan tâm giả định. Sự ô nhiễm điểm chuẩn đã tồn tại trong lĩnh vực này trong nhiều năm, khi các nhà nghiên cứu liên tục chỉ ra rằng các bộ thử nghiệm phổ biến bị rò rỉ vào tập đoàn đào tạo quy mô web và các mô hình đó có thể được điều chỉnh một cách lặng lẽ để hoạt động tốt trên các đánh giá đã biết. Khi chính phủ và doanh nghiệp sử dụng điểm chuẩn để đưa ra các quyết định về mua sắm và chính sách, những con số bị thổi phồng sẽ gây ra những hậu quả thực sự.

DeepMind lập luận rằng khi các mô hình ngày càng có nhiều năng lực hơn, rủi ro cao nhất đối với các hạng mục đánh giá nhạy cảm – đứng đầu trong số đó là kiểm tra an ninh mạng và đánh giá của chính phủ – trong đó điểm số bị ô nhiễm không chỉ gây hiểu lầm mà còn có khả năng nguy hiểm.

Sự đánh đổi cũ: Lời nhắc của bạn hoặc Trọng lượng của chúng tôi

Trong lịch sử, những đánh giá bên ngoài có tính rủi ro cao buộc phải đưa ra một lựa chọn không thoải mái. Người đánh giá đã chuyển lời nhắc kiểm tra của mình cho nhà cung cấp mô hình — có nguy cơ nhà cung cấp sẽ xem trước các câu hỏi kiểm tra — hoặc nhà cung cấp đã chuyển trọng số mô hình cho người đánh giá — có nguy cơ mất tài sản trí tuệ có giá trị nhất của mình.

DeepMind viết, các giao thức không ghi nhật ký và các biện pháp bảo vệ hợp đồng nghiêm ngặt từ lâu đã giữ bí mật các lời nhắc kiểm tra bên ngoài, nhưng đó là những lời hứa được thực thi bởi chính sách chứ không phải bằng toán học. Đánh giá mù đôi thay thế niềm tin đó bằng bằng chứng mật mã.

Hộp mật mã hoạt động như thế nào

Phi công sử dụng Không gian bí mật, một phần trong danh mục Điện toán bí mật của Google Cloud, để tạo ra thứ mà DeepMind mô tả là một "hộp" mật mã. Bên trong nó, cả hai nửa của đánh giá — tiêu chuẩn bí mật và mô hình độc quyền — vẫn ở chế độ riêng tư đối với chủ sở hữu tương ứng và môi trường sẽ xác minh thực tế đó bằng mật mã.

Kết quả thực sự là mù đôi: người đánh giá bên ngoài không thể nhìn thấy trọng số mô hình Gemini và Google không thể nhìn thấy lời nhắc kiểm tra của người đánh giá. Không bên nào phải tin vào lời hứa của bên kia, vì về nguyên tắc, bản thân kiến ​​trúc khiến việc rò rỉ là không thể. Điều quan trọng là việc thiết lập này cũng ngăn chặn việc sử dụng dữ liệu đánh giá sau này để tối ưu hóa hiệu suất của mô hình trước khi thử nghiệm trong tương lai — đóng vòng lặp mà qua đó ô nhiễm thường quay trở lại.

Tại sao việc giám sát AI lại quan trọng

Ý nghĩa rộng hơn vượt xa một mô hình Song Tử. Các tổ chức độc lập - viện an toàn AI, phòng thí nghiệm học thuật, cơ quan quản lý - đã đấu tranh trong nhiều năm để đánh giá nghiêm ngặt các mô hình biên giới khép kín, chính xác là do các nhà cung cấp không thể chuyển giao trọng số và người đánh giá sẽ không chuyển giao điểm chuẩn. Mọi viện an toàn AI lớn đều phải đối mặt với các phiên bản của vấn đề này khi ký thỏa thuận đánh giá với các phòng thí nghiệm biên giới.

Nếu phi công tiếp tục, nó sẽ đưa ra một khuôn mẫu theo đó chủ quyền dữ liệu và quyền sở hữu trí tuệ tồn tại khi tiếp xúc với sự giám sát độc lập. DeepMind cho biết họ hy vọng chương trình thí điểm "thiết lập một biên giới mới cho việc giám sát mô hình, giúp ngành công nghiệp rộng lớn hơn xây dựng các hệ thống AI an toàn hơn, đáng tin cậy hơn và được tin cậy rộng rãi hơn".

Bản thân danh sách đối tác đã rất đáng chú ý. Viện An toàn AI Singapore là một trong những cơ quan đánh giá quốc gia tích cực nhất; OpenMined xây dựng công cụ tính toán đảm bảo quyền riêng tư; MLCommons chuẩn hóa điểm chuẩn của ngành. AVERI thành lập một tập đoàn bao gồm các cơ quan chính phủ, học viện và tiêu chuẩn ngành - các khu vực bầu cử cần áp dụng đánh giá mù đôi để nó trở thành một chuẩn mực chứ không phải là một minh chứng.

Một cuộc chạy đua vũ trang về tính liêm chính trong đánh giá

Thông báo này được đưa ra trong bối cảnh ngày càng có nhiều sự giám sát chặt chẽ về cách các công ty AI tự đánh giá mình. Các phòng thí nghiệm phải đối mặt với những cáo buộc ngày càng tăng về việc chọn những điểm chuẩn thuận lợi và bảng xếp hạng độc lập đã trở nên có ảnh hưởng chính xác vì chúng nằm ngoài tầm kiểm soát của nhà cung cấp. Đánh giá mù đôi mở rộng phong trào độc lập đó bên trong cơ sở hạ tầng của chính nhà cung cấp — một sự thay đổi đáng chú ý đối với các công ty trước đây luôn khăng khăng kiểm soát mọi chi tiết về cách thử nghiệm mô hình của họ.

Hiện tại, chương trình thí điểm bao gồm một mô hình và một bộ tiêu chuẩn bí mật. Nhưng nếu được xác minh bằng mật mã, việc đánh giá không nhiễm bẩn trở thành thông lệ về mặt kỹ thuật, nó có thể thay đổi những gì các doanh nghiệp và cơ quan quản lý mong đợi từ mọi phòng thí nghiệm tiên phong — và khiến "sự tin tưởng vào điểm số của chúng tôi" trở nên khó bán hơn trong một thị trường ngày càng được xây dựng dựa trên các tuyên bố có thể xác minh được.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →