Một cuộc tấn công chuỗi cung ứng vào một gói nguồn mở duy nhất đã dẫn đến một trong những sự cố bảo mật lộn xộn nhất trong ngành AI còn non trẻ, làm lộ dữ liệu do công ty khởi nghiệp gắn nhãn dữ liệu Mercor nắm giữ và buộc Meta phải tạm dừng vô thời hạn công việc của mình với công ty.

Vụ vi phạm được Mercor xác nhận vào ngày 31 tháng 3, bắt nguồn từ sự xâm phạm của LiteLLM, một công cụ nguồn mở được sử dụng rộng rãi và được tải xuống hàng triệu lần mỗi ngày. Trong khoảng 40 phút, một phiên bản LiteLLM bị nhiễm độc đã chứa phần mềm độc hại thu thập thông tin xác thực, đánh cắp thông tin xác thực đăng nhập và sau đó sử dụng chúng để tiếp cận sâu hơn vào các hệ thống được kết nối. Kể từ đó, sự việc đã chuyển sang các vụ kiện, đóng băng hợp đồng và tính toán rộng hơn về mức độ tin cậy mà ngành AI đặt vào phần mềm trung gian mà nó không kiểm soát. Để biết thêm tin tức AI nóng hổi về bảo mật và độ tin cậy, hãy theo dõi tin tức đang diễn ra của chúng tôi.

Cuộc tấn công diễn ra như thế nào

Cơ chế là sự thỏa hiệp trong chuỗi cung ứng phần mềm trong sách giáo khoa. Theo báo cáo của TechJuice và TechCrunch, những kẻ tấn công đã tìm cách đẩy mã độc vào LiteLLM, thư viện nguồn mở mà nhiều công ty AI sử dụng để định tuyến các yêu cầu giữa các mô hình ngôn ngữ khác nhau. Vì LiteLLM được coi là cơ sở hạ tầng đáng tin cậy và được đưa vào môi trường sản xuất một cách tự động nên bản dựng độc hại sẽ lây lan nhanh chóng.

Trong khoảng 40 phút, công cụ giả mạo này đã âm thầm thu thập thông tin xác thực từ bất kỳ ai đang chạy nó. Những thông tin xác thực đó sau đó được sử dụng để truy cập vào các hệ thống bổ sung, gây ra thiệt hại vượt quá chỗ đứng ban đầu. Mercor, công ty có hoạt động kinh doanh phụ thuộc vào việc quản lý khối lượng lớn dữ liệu khách hàng và nhà thầu nhạy cảm, nằm trong số những công ty bị lộ nhiều nhất.

Khiếu nại tống tiền 4 Terabyte

Sau khi tiết lộ, một nhóm hacker tuyên bố đang nắm giữ khoảng 4 terabyte dữ liệu bị đánh cắp từ hệ thống của Mercor. Dữ liệu được xác nhận quyền sở hữu bao gồm hồ sơ ứng viên, thông tin nhận dạng cá nhân, dữ liệu nhà tuyển dụng, mã nguồn và khóa API, một kho dữ liệu sâu rộng về chính xác loại tài liệu mà một công ty ghi nhãn dữ liệu tập trung. Mercor không xác nhận cũng không phủ nhận tính xác thực của dữ liệu được công bố mà chỉ nói rằng họ đang điều tra.

Sự mơ hồ bản thân nó đã là một vấn đề. Đối với các nhà thầu, người sử dụng lao động và đối tác có thông tin có thể được lưu hành, sự không chắc chắn về những gì thực sự đã được lấy khiến không thể đánh giá mức độ phơi nhiễm của họ.

Meta kéo lại

Hậu quả thương mại diễn ra nhanh chóng. Meta đã tạm dừng hợp đồng với Mercor vô thời hạn, một quyết định gây ấn tượng hơn bởi lịch sử giữa hai công ty. Theo TechJuice, Meta vẫn tiếp tục hợp tác với Mercor ngay cả sau khi chi 14,3 tỷ USD để mua lại AI của đối thủ Mercor, một dấu hiệu cho thấy mối quan hệ này có giá trị như thế nào. Việc vi phạm được định tuyến thông qua công cụ của bên thứ ba có thể cắt đứt mối ràng buộc như vậy cho thấy các mối quan hệ nhà cung cấp này đã trở nên mong manh đến mức nào.

OpenAI đã xác nhận rằng họ đang điều tra mức độ phơi nhiễm của chính mình trong vụ vi phạm nhưng tại thời điểm báo cáo, họ vẫn chưa tạm dừng các hợp đồng Mercor của mình. Nhiều nhà sản xuất mô hình lớn khác được cho là đang cân nhắc mối quan hệ của họ với công ty khởi nghiệp này, mặc dù chưa có cái tên nào khác được xác nhận công khai.

Câu hỏi về vụ kiện và trách nhiệm pháp lý

Hậu quả pháp lý đang tích tụ nhanh chóng như hậu quả thương mại. Năm nhà thầu của Mercor đã đệ đơn kiện về cáo buộc tiết lộ dữ liệu cá nhân. Một vụ kiện được TechCrunch xem xét có tên LiteLLM và công ty khởi nghiệp tuân thủ AI Delve là đồng bị cáo, với lý do LiteLLM đã sử dụng Delve để lấy chứng chỉ bảo mật của mình. Mối liên kết đó mở ra một câu hỏi hóc búa về việc liệu các nhà cung cấp dịch vụ tuân thủ có chịu trách nhiệm hay không khi các công cụ mà họ bảo đảm sau này được vũ khí hóa.

Những vụ kiện này có thể giúp xác định trách nhiệm pháp lý sẽ xảy ra ở đâu khi hành vi vi phạm được chuyển qua phần mềm nguồn mở, một câu hỏi mà ngành công nghiệp AI cho đến nay vẫn tránh trả lời.

Bề mặt tấn công chưa được xem xét kỹ lưỡng của ngành

Các nhà nghiên cứu bảo mật cho biết bài học sâu sắc hơn là về cấu trúc. Nhóm AI hiện phụ thuộc vào mạng lưới các công cụ trung gian, bộ định tuyến, bộ đánh giá, lớp tuân thủ và nền tảng ghi nhãn đáng tin cậy nằm giữa nhà cung cấp mô hình và khách hàng của họ. Mỗi mô hình đều là một điểm nghẽn tiềm năng và hầu hết nhận được ít sự giám sát kỹ lưỡng hơn so với bản thân các mô hình biên giới.

LiteLLM mang tính chất minh họa. Nó được tải xuống hàng triệu lần mỗi ngày, xử lý thông tin đăng nhập theo thiết kế và chạy bên trong môi trường sản xuất của một số công ty được tài trợ tốt nhất trên trái đất. Tuy nhiên, khoảng thời gian giả mạo kéo dài 40 phút là đủ để biến nó thành một chiếc chìa khóa xương. Trình tự này đã đặt toàn bộ chuỗi cung ứng AI vào sự giám sát chặt chẽ, đồng thời các nhà nghiên cứu cảnh báo rằng các công cụ trung gian đáng tin cậy đại diện cho một bề mặt tấn công mà ngành này đã xem xét kỹ lưỡng một cách có hệ thống.

Điều gì xảy ra tiếp theo

Các câu hỏi trước mắt là liệu Mercor có thể xác minh phạm vi rò rỉ hay không, liệu có nhiều nhà sản xuất mô hình khác sẽ theo Meta trong việc rút lui hay không và liệu các vụ kiện LiteLLM và Delve có thiết lập tiền lệ cho trách nhiệm pháp lý của bên thứ ba hay không. Về lâu dài, sự cố này có thể thúc đẩy các lời kêu gọi ngành công nghiệp AI áp dụng các loại hóa đơn phần mềm về vật liệu và các thông lệ ký kết phụ thuộc mà các lĩnh vực phần mềm trưởng thành hơn đã dựa vào.

Hiện tại, vi phạm này là lời cảnh báo rằng các lỗ hổng nguy hiểm nhất trong AI có thể không tồn tại bên trong các mô hình mà nằm trong hệ thống ống nước kém duyên dáng kết nối chúng.

Đi trước AI

Tính bảo mật của ngăn xếp AI đang trở nên quan trọng như chính các mô hình. Đánh dấu trang AI Buzz Wire để biết những phát triển AI mới nhấttin tức về ngành AI.

Đọc thêm tin tức về AI →