OpenAI đã xuất bản một bài đăng bảo mật vào ngày 30 tháng 9 năm 2026 mô tả cách nó xác định và phá vỡ một chiến dịch phối hợp nhằm trích xuất lý do được bảo vệ từ các mô hình của nó - và quy một cụm hoạt động cốt lõi cho các cá nhân có liên quan đến Moonshot AI, phòng thí nghiệm Trung Quốc đằng sau dòng mô hình Kimi.

Tiết lộ này diễn ra vào thời điểm nhạy cảm đối với ngành, nơi giá trị của mô hình biên giới ngày càng không chỉ nằm ở câu trả lời mà còn ở cách nó suy luận. Đối với độc giả theo dõi những phát triển AI mới nhất, vụ việc này cung cấp một cái nhìn chi tiết khác thường về cách IP mô hình bị tấn công trên quy mô lớn – và cách các phòng thí nghiệm phản ứng.

"Chưng cất đối nghịch" ở đây nghĩa là gì

OpenAI mô tả hoạt động này phù hợp với quá trình chưng cất đối nghịch, được định nghĩa là việc sử dụng có hệ thống và trái phép kết quả đầu ra hoặc lý luận của một mô hình để giúp đào tạo, tái tạo hoặc cải tiến mô hình khác. "Lý luận được bảo vệ" là bản ghi nội bộ của mô hình để thực hiện một nhiệm vụ - thông tin thường được giữ lại khỏi câu trả lời cuối cùng mà người dùng nhìn thấy. Công ty lập luận rằng việc trích xuất nó có thể giúp người khác tái tạo những khả năng mà họ không xây dựng.

Điều quan trọng, OpenAI cho biết các nhà khai thác đã không phá vỡ mã hóa, xâm phạm cơ sở dữ liệu hoặc có quyền truy cập trực tiếp vào các cuộc hội thoại được lưu trữ của người dùng. Thay vào đó, họ thao túng các tương tác mô hình để lý luận được bảo vệ có thể được sao chép dưới dạng mà người yêu cầu có thể nhìn thấy - một hành vi lạm dụng có phối hợp, với số lượng lớn đối với chính sản phẩm thay vì một vụ hack truyền thống.

Một kỹ thuật mà OpenAI ghi lại liên quan đến việc sao chép dấu vết lý luận được mã hóa từ một cuộc trò chuyện, sau đó yêu cầu một mô hình trong một cuộc trò chuyện riêng biệt giải mã và ghi lại nội dung lý luận ẩn. Công ty nhấn mạnh rằng hành vi thao túng này không phải là lỗ hổng chỉ có ở các mẫu máy của họ và cho biết họ đã chia sẻ thông tin chi tiết với các đối tác trong ngành thông qua Diễn đàn Mô hình Biên giới để tăng cường khả năng phòng thủ chung.

Dòng thời gian: 16.000 yêu cầu trong hai ngày

Theo bài đăng, chiến dịch bắt đầu vào ngày 1 tháng 7 năm 2026 với khối lượng tương đối thấp. Nó leo thang mạnh mẽ vào ngày 24 và 25 tháng 7, khi OpenAI quan sát thấy số lượng yêu cầu tăng vọt lên tới 16.000 yêu cầu sử dụng mẫu trích xuất có liên quan, đến từ hơn 4.000 người dùng. Chú thích cuối trang trong bài đăng cảnh báo rằng những số liệu này mô tả nỗ lực trích xuất - không nhất thiết là thành công.

Cuộc điều tra sâu hơn đã phát hiện ra hoạt động theo mẫu lời nhắc có liên quan trên một nhóm hơn 15.000 người dùng. OpenAI cho biết họ đã làm gián đoạn hoàn toàn chiến dịch trước ngày 28 tháng 7 năm 2026 và hoạt động này tiếp tục phát triển theo thời gian, củng cố quan điểm của họ rằng việc chưng cất đối nghịch đòi hỏi các biện pháp phòng thủ thích ứng, nhiều lớp thay vì khắc phục một lần.

Điểm ghi công cho Moonshot AI

OpenAI cẩn thận với sự phân bổ của nó. Nó nói rằng không rõ liệu tất cả những người điều hành được quan sát trong khoảng thời gian này có đến từ một tác nhân duy nhất hay không, nhưng nó quy một cụm hoạt động cốt lõi cho các cá nhân có liên quan đến Moonshot AI, nhà phát triển của Kimi.

Tuyên bố không đến trong chân không. Vào ngày 8 tháng 9 năm 2026, Cơ quan An ninh Quốc gia, Cơ quan An ninh Cơ sở hạ tầng và An ninh mạng cũng như FBI đã đưa ra một tư vấn chung về an ninh mạng nêu rõ rằng Moonshot AI đã tiến hành một chiến dịch sàng lọc rộng rãi chống lại các công ty AI hàng đầu của Hoa Kỳ kể từ ít nhất là giữa năm 2025. Theo lời khuyên, Moonshot đã trích xuất dữ liệu quan trọng của Claude Fable 5 để huấn luyện mô hình Kimi-K3 và dữ liệu GPT-4o của mình để huấn luyện Kimi-K2, sử dụng các mô hình của Hoa Kỳ để chắt lọc khả năng tinh chỉnh có giám sát, học tăng cường, công nghệ phần mềm và toán học.

Lời khuyên còn đi xa hơn, nói rằng — có thể với nhận thức của chính phủ Trung Quốc — DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun và Z.AI đã trích xuất chung hàng tỷ token trên hàng triệu sàn giao dịch từ các mô hình biên giới của Hoa Kỳ, bao gồm các biến thể của Claude, GPT, Gemini và Grok, ít nhất là từ cuối năm 2024. Các cơ quan này mô tả một hệ thống hậu cần gồm các API gốc, nhà cung cấp đám mây từ xa và công cụ tổng hợp bên thứ ba, cùng với một thị trường xám của các proxy API được gọi là "chuyển giao". trạm" được sử dụng để bỏ qua các hạn chế về địa lý và điều khoản dịch vụ. Theo báo cáo, tiết kiệm chi phí đến từ việc mua số lượng lớn đăng ký trả phí được chia sẻ giữa các nhóm nhà phát triển.

##Tại sao dấu vết lý luận lại đáng bị đánh cắp

Mối quan tâm về an ninh vượt xa lợi thế cạnh tranh. OpenAI lập luận rằng lý luận trích xuất có thể được sử dụng để huấn luyện một mô hình khác mà không duy trì các biện pháp bảo vệ áp dụng cho đầu ra hướng tới người dùng của mô hình ban đầu - nghĩa là việc chắt lọc trên quy mô lớn có thể chuyển giao các khả năng nâng cao mà không cần đầu tư tương ứng vào an toàn. Công ty cho biết những rủi ro đó sẽ tăng lên khi các mô hình đạt được khả năng trong các lĩnh vực sử dụng kép.

Các nhà nghiên cứu độc lập cũng đưa ra cảnh báo tương tự. Trong một bài báo gửi tới arXiv vào ngày 10 tháng 8 năm 2026, một nhóm các nhà nghiên cứu bao gồm Alexander Panfilov, Ilia Shumailov và Maksym Andriushchenko đã báo cáo rằng các nhà cung cấp hàng đầu không che giấu hoàn toàn dấu vết lý luận trong mô hình của họ và đã chứng minh các lỗ hổng liên quan đến mô hình chéo và thu gọn hội thoại thông qua việc tiết lộ có trách nhiệm. OpenAI cho biết họ đã điều tra những phát hiện đó, xác nhận các đường tấn công là có thật và sử dụng công việc này để đẩy nhanh quá trình giảm nhẹ.

Điều gì xảy ra tiếp theo

OpenAI cho biết họ đã điều tra phạm vi và tác động tiềm tàng của chiến dịch trước khi xuất bản, triển khai các biện pháp giảm nhẹ của riêng mình và chia sẻ những phát hiện của mình với các nhà nghiên cứu và đối tác trong ngành để nhận phản hồi. Công việc điều tra và giảm nhẹ bổ sung đang được tiếp tục và công ty coi việc chưng cất đối nghịch là một thách thức bảo mật rộng lớn hơn đối với toàn bộ hệ sinh thái phòng thí nghiệm biên giới chứ không phải là một sự cố duy nhất.

Tập phim cũng làm sâu sắc thêm một cuộc tranh luận chính sách đang diễn ra. Nếu các cơ quan của Hoa Kỳ chính thức quy kết các chiến dịch chưng cất cho các phòng thí nghiệm của Trung Quốc, hãy mong đợi các biện pháp kiểm soát chặt chẽ hơn đối với quyền truy cập API, giới hạn tỷ lệ và kiểm tra danh tính mạnh mẽ hơn, đồng thời tiếp tục gây áp lực lên các thị trường tổng hợp và ủy quyền giúp việc che giấu hành vi lạm dụng quy mô lớn trở nên dễ dàng hơn. Đối với các công ty AI ở cả hai bờ Thái Bình Dương, lớp lý luận hiện là một tài sản đang bị tranh chấp — và việc bảo vệ nó đã trở thành một nguyên tắc bảo mật của riêng nó.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →