Một công ty khởi nghiệp của Hoa Kỳ có tên Abliteration.ai đã biến một trong những kỹ thuật gây tranh cãi nhất của AI nguồn mở thành một dịch vụ thương mại, bán trình duyệt và quyền truy cập API cho các mô hình trọng lượng mở phổ biến đã bị loại bỏ chương trình đào tạo về an toàn - bao gồm cả GLM-5.3 được phát hành gần đây của Z.ai, một trong những mô hình mở có khả năng nhất hiện nay.

Công ty lấy tên từ "hủy bỏ", một phương pháp loại bỏ xu hướng từ chối các yêu cầu có hại của người mẫu. Các nhà nghiên cứu và những người có sở thích đã sử dụng kỹ thuật này trong nhiều năm và Ôm Mặt đã lưu trữ hàng nghìn mô hình bị xóa bỏ. Điểm mới là bao bì: Abliteration.ai lưu trữ các mô hình đã được sửa đổi trên cơ sở hạ tầng của chính nó, vì vậy bất kỳ ai có trình duyệt web đều có thể truy vấn chúng mà không cần tải xuống trọng lượng hoặc thuê GPU. TechCrunch đã báo cáo sự phát triển này vào ngày 3 tháng 9 và kể từ đó, nó đã thu hút sự giám sát chặt chẽ từ các nhà nghiên cứu an toàn theo dõi cuộc tranh luận về trọng lượng mở mà chúng tôi theo dõi trong tin tức về AI.

Từ kỹ thuật ngầm đến nền tảng chìa khóa trao tay

Được thành lập vào cuối năm ngoái và chính thức thành lập vào tháng 3, Abliteration.ai chuyển hoạt động từ một niche nguồn mở tự làm sang một sản phẩm thương mại bóng bẩy. Bằng cách tự lưu trữ các mô hình, công ty loại bỏ hai điểm cản trở cùng một lúc: người dùng không còn cần kỹ năng kỹ thuật để cắt bỏ mô hình cũng như không cần máy tính để chạy mô hình.

Người đồng sáng lập Devon - TechCrunch đã giữ kín họ của mình theo yêu cầu vì anh ấy vẫn làm việc tại một công ty khác - cho biết công ty đã đạt được thỏa thuận với một số nhà cung cấp đám mây lớn và được tài trợ hoàn toàn thông qua doanh thu của khách hàng. Công ty khởi nghiệp này chưa huy động vốn mạo hiểm, mặc dù ông cho biết các cuộc đàm phán đang được tiến hành.

Thử nghiệm của TechCrunch đã tìm thấy gì

Công ty cho biết mục tiêu của họ là cho phép "công việc tấn công mạng, nhóm đỏ và thử nghiệm tác nhân mà các mô hình khác từ chối thực hiện." TechCrunch đã thử nghiệm điều đó với một tài khoản miễn phí, truy vấn phiên bản GLM-5.3 đã được rút gọn thông qua trình duyệt web. Các phóng viên đã yêu cầu người mẫu viết một chương trình Python để đánh cắp mật khẩu Chrome đã lưu và tạo ra một giao thức chi tiết để nuôi cấy mầm bệnh nguy hiểm cho con người tại nhà. Theo báo cáo, nó sẵn sàng tuân thủ cả hai yêu cầu.

Thử nghiệm đó là trung tâm của câu chuyện: các nhiệm vụ mà các mô hình biên giới chính thống từ chối một cách rõ ràng hiện có sẵn sau một biểu mẫu đăng ký, miễn phí, trong tab trình duyệt.

Lập luận phòng thủ của đội đỏ

Trường hợp của Devon đối với doanh nghiệp là lập luận bảo mật cổ điển: bạn không thể bảo vệ trước hành vi mà bạn không thể tái hiện. Một mô hình từ chối viết mã khai thác đang hoạt động sẽ ít có tác dụng đối với đội đỏ đang cố gắng hiểu những kẻ tấn công thực sự.

Ông nói với TechCrunch: “Bức tranh tổng thể về các mô hình bị xóa bỏ là họ có thể mô phỏng các diễn viên xấu”. “Ưu điểm hiện nay là những người phòng thủ có thể di chuyển nhanh nhất có thể… Tôi nghĩ nó sẽ tăng tốc độ an ninh mạng, đây là một điểm phản trực giác.”

Khách hàng của công ty bao gồm các công ty khởi nghiệp thuộc đội đỏ giai đoạn đầu ở Anh và Châu Âu nhằm kiểm tra tính bảo mật của các ngân hàng, hãng hàng không và các nhà khai thác cơ sở hạ tầng quan trọng khác. Devon cho biết, một khách hàng lớn đã đội đỏ các đại lý ngân hàng và không thể thực hiện công việc đó với các mô hình thương mại chưa được sửa đổi.

'Người mẫu trở thành kẻ sát nhân'

Các nhà nghiên cứu an toàn nhìn nhận khả năng tương tự rất khác nhau. Andrew Yoon, người đứng đầu nghiên cứu tại tổ chức phi lợi nhuận về an toàn AI CivAI, nói với TechCrunch rằng việc xóa bỏ cho phép bạn "sửa đổi mô hình để nó trở thành một kẻ sát nhân".

Yoon nói: “Bạn có thể nhập bất cứ thứ gì theo nghĩa đen ở đây và nó sẽ tuân thủ điều đó”, đồng thời cho biết thêm rằng anh ấy mong đợi “các mô hình đã được chỉnh sửa, xóa bỏ sẽ được sử dụng để gây hại trong tương lai gần”.

Trong một ý kiến ​​gần đây, Yoon lập luận rằng nếu việc loại bỏ lan can trên thực tế không thể ngăn chặn được, thì chính phủ nên yêu cầu các nhà cung cấp chạy các trình phân loại để phát hiện và ngăn chặn hoạt động vũ khí sinh học và mạng có hại, đồng thời nên yêu cầu các công ty thuê quyền truy cập trực tiếp vào GPU tiên tiến để xác minh danh tính khách hàng và từ chối dịch vụ khi nghi ngờ có hành vi lạm dụng nguy hiểm.

Lan can mỏng và không có kiểm tra danh tính

Hiện tại, các biện pháp bảo vệ của Abliteration.ai là ở mức tối thiểu. Nền tảng này cung cấp cho khách hàng một lớp kiểm duyệt tùy chọn để họ có thể thêm bất kỳ hạn chế nào họ muốn và bản thân trang web vẫn duy trì một số giới hạn nhỏ - TechCrunch không thể yêu cầu mô hình này tạo hướng dẫn tự sát và Devon cho biết anh đang nghiên cứu các biện pháp bổ sung để ngăn chặn bạo lực.

Công ty không thực hiện sàng lọc nhận biết khách hàng của bạn ngoài việc ghi lại thẻ tín dụng được sử dụng để thanh toán. “Bạn không muốn trở thành người chịu trách nhiệm cho việc ai đó làm điều gì đó điên rồ… vậy bạn vạch ra ranh giới trách nhiệm của mình với tư cách là một công ty ở đâu?” Devon nói. “Chúng tôi vẫn đang trong quá trình xác định điều đó.”

Một câu hỏi mà ngành không thể né tránh

Không phải mọi người thực hành bảo mật đều đồng ý rằng các mô hình bị loại bỏ thậm chí còn là công cụ tốt nhất để thử nghiệm mang tính tấn công. Ahmed Aly, Giám đốc điều hành của công ty đại lý Fabraix, nói với TechCrunch rằng công ty của ông dựa nhiều hơn vào các mẫu có trọng lượng mở được tinh chỉnh, vốn đã xuất xưởng với rất ít lời từ chối – và lưu ý rằng việc loại bỏ có thể làm suy giảm các khả năng cơ bản của mô hình.

Hầu hết các chuyên gia TechCrunch tham khảo ý kiến ​​đều đồng ý về một điều: không thể dừng việc thực hành này lại. Trọng số có thể tải xuống có nghĩa là bất kỳ ai cũng có thể loại bỏ các từ chối cục bộ, như một bài bình luận năm 2026 từ Trung tâm Chống khủng bố ở West Point về việc lạm dụng "xóa bỏ" đã nhấn mạnh. Câu hỏi mở mà lực lượng Abliteration.ai đặt ra là liệu việc giảm chi phí truy cập cho tất cả mọi người - những người bảo vệ cũng như những kẻ tấn công - có làm cho Internet trở nên an toàn hơn hay nguy hiểm hơn hay không.

Đi trước AI

An toàn AI đang phát triển hàng ngày. Nhận những phát triển AI mới nhất ở cùng một nơi.

Đọc thêm tin tức về AI →