Một đánh giá sơ bộ chung của các viện an toàn AI của chính phủ Hoa Kỳ và Vương quốc Anh đã kết luận rằng mô hình Kimi K3 trọng lượng mở của Moonshot AI vượt xa các mô hình tiên phong của Hoa Kỳ về các nhiệm vụ tấn công mạng. Phát hiện này, được công bố vào ngày 25 tháng 7 năm 2026, bổ sung một điểm dữ liệu cụ thể cho cuộc tranh luận ngày càng gay gắt về cách xử lý các hệ thống AI do Trung Quốc phát triển khi chúng được áp dụng ở Hoa Kỳ.

Đánh giá này được đưa ra bởi viện an toàn AI của Hoa Kỳ có trụ sở tại NIST, được gọi là CAISI, cùng với AISI của Vương quốc Anh. Nó đại diện cho một trong những đánh giá chính thức đầu tiên của phương Tây về Kimi K3, tập trung đặc biệt vào lĩnh vực mạng. Đối với những độc giả đang theo dõi bối cảnh chuyển động nhanh của tin nóng về AI, kết quả đối với bất kỳ điểm chuẩn riêng lẻ nào cũng ít đáng chú ý hơn so với những gì nó báo hiệu về vai trò mở rộng mà các phòng thí nghiệm của chính phủ hiện đang nắm giữ trong việc kiểm tra các mô hình nước ngoài trước khi chúng được triển khai rộng rãi.

Đánh giá đo lường điều gì

Kimi K3, do Moonshot AI có trụ sở tại Bắc Kinh phát hành, là mẫu máy có trọng lượng mở lớn nhanh chóng thu hút sự chú ý toàn cầu nhờ hiệu năng mạnh mẽ cho mục đích chung sau khi ra mắt. Tính phân phối mở của nó có nghĩa là các nhà nghiên cứu và nhà phát triển có thể tải xuống và kiểm tra trọng số trực tiếp, điều này khiến nó trở thành một ứng cử viên đương nhiên cho thử nghiệm an toàn bên ngoài.

Báo cáo sơ bộ mới tập trung vào một câu hỏi hẹp hơn và nhạy cảm hơn: mô hình này có khả năng như thế nào trong các hoạt động tấn công mạng, loại nhiệm vụ quan trọng nhất đối với các cơ quan an ninh quốc gia? Thay vì đánh giá Kimi K3 dựa trên kiến ​​thức hoặc lý luận rộng, các viện nghiên cứu đã thăm dò xem liệu nó có thể giúp thực hiện các cuộc tấn công mạng, khai thác lỗ hổng phần mềm hay hỗ trợ các hoạt động máy tính độc hại hay không.

Các con số: khoảng 32% so với 76%

Kết quả tiêu đề là một khoảng cách rõ ràng. Trong bài đánh giá năng lực mạng, Kimi K3 đạt khoảng 32%, trong khi các mẫu xe tiên phong hàng đầu của Mỹ đạt khoảng 76%, theo báo cáo đánh giá. Nói một cách dễ hiểu, các viện nghiên cứu của Mỹ nhận thấy rằng mô hình của Trung Quốc chỉ có thể hoàn thành khoảng 1/3 số nhiệm vụ tấn công mạng mà các mô hình hàng đầu của phương Tây xử lý.

Nhiều cửa hàng đưa tin về bản phát hành đã đóng khung khoảng cách một cách nhất quán. South China Morning Post đưa tin rằng Kimi K3 "kém xa các đối thủ Hoa Kỳ về khả năng tấn công mạng", trong khi Kỹ thuật thú vị nhấn mạnh mức chênh lệch 76% so với 32% trên điểm chuẩn mạng. Đánh giá được mô tả là sơ bộ, có nghĩa là các viện đang báo hiệu rằng có thể sẽ tiến hành thử nghiệm thêm trước khi đưa ra bất kỳ kết luận cuối cùng nào.

Tại sao khoảng cách có thể tồn tại

Một mô hình hoạt động mạnh mẽ trên các tiêu chuẩn chung nhưng yếu về tấn công mạng đưa ra một câu đố thú vị và các nhà phân tích đã bắt đầu cân nhắc. Viết tại The Decode, các nhà bình luận lưu ý rằng việc chưng cất có thể giải thích một phần của sự khác biệt.

Chắt lọc là một kỹ thuật đào tạo trong đó mô hình học bằng cách bắt chước kết quả đầu ra của mô hình "giáo viên" có năng lực hơn thay vì xây dựng mọi khả năng từ đầu. Các nhà phân tích lập luận rằng nếu Kimi K3 được phát triển một phần thông qua quá trình chưng cất, nó có thể thừa hưởng mức trần về khả năng do bất kỳ mô hình nào đóng vai trò là người dẫn đầu đặt ra, có khả năng hạn chế hiệu suất đối với các nhiệm vụ khó khăn nhất như các hoạt động tấn công mạng phức tạp.

Giả thuyết đó vẫn chỉ là giả thuyết. Báo cáo sơ bộ không giải quyết tại sao khoảng cách tồn tại, chỉ nói rằng nó tồn tại. Các yếu tố có thể khác bao gồm các hạn chế về khả năng có chủ ý, sự khác biệt trong dữ liệu huấn luyện hoặc sự đánh đổi được thực hiện để giữ cho mô hình đủ hiệu quả để chạy trên phần cứng phổ biến rộng rãi.

Bối cảnh chính trị bị buộc tội

Đánh giá này diễn ra ngay giữa nỗ lực rộng lớn hơn của Hoa Kỳ nhằm xem xét kỹ lưỡng các hệ thống AI của Trung Quốc. Đầu tháng 7, chính quyền Trump đã khôi phục các nỗ lực nhằm hạn chế việc sử dụng các mô hình AI do Trung Quốc phát triển ở Hoa Kỳ, với lý do lo ngại về an ninh mạng, trong đó Kimi K3 liên tục bị nêu tên trong cuộc thảo luận đó. Các nhà lập pháp Hoa Kỳ đã gây áp lực riêng cho các công ty Mỹ về ý nghĩa bảo mật dữ liệu của việc tích hợp các mô hình nước ngoài vào sản phẩm của họ.

Trong bối cảnh đó, chính phủ nhận thấy rằng mô hình trọng lượng mở nổi bật nhất của Trung Quốc hoạt động kém hơn trong việc cắt giảm hành vi phạm tội theo hai hướng. Đối với những người tranh luận về các hạn chế, nó cung cấp bằng chứng chính thức rằng mô hình đang được xử lý đủ nghiêm túc để được thử nghiệm. Đối với những người cảnh giác với khả năng tiếp cận quá mức, điểm mạng tương đối thấp cũng làm phức tạp thêm câu chuyện rằng mọi mô hình của Trung Quốc đều đại diện cho mối đe dọa mạng ngay lập tức.

Ý nghĩa của việc áp dụng trọng lượng mở

Kết quả này cũng dẫn đến một cuộc tranh luận riêng về AI có trọng lượng mở rộng hơn. Những người ủng hộ mô hình trọng lượng mở lập luận rằng trọng lượng có thể tải xuống miễn phí cho phép thử nghiệm an toàn độc lập giống hệt như loại CAISI và AISI của Vương quốc Anh đã tiến hành, khiến việc phân phối mở trở thành một mạng lưới tích cực cho bảo mật. Các nhà phê bình phản bác rằng sự cởi mở tương tự đã làm giảm rào cản đối với các tác nhân độc hại sửa đổi hoặc lạm dụng các hệ thống có khả năng.

Trong trường hợp của Kimi K3, tính sẵn có của trọng lượng mở chính xác là điều khiến cho đánh giá độc lập này của chính phủ trở nên khả thi. Việc các nhà hoạch định chính sách có thể yên tâm hay báo động về điểm số tương đối khiêm tốn trên mạng có thể sẽ phụ thuộc ít hơn vào bản thân con số mà phụ thuộc nhiều hơn vào cách các cơ quan của Hoa Kỳ và Vương quốc Anh chọn cách sắp xếp nó trong những tuần tới.

Hiện tại, đánh giá sơ bộ đóng vai trò là điểm tham chiếu: thước đo chính thức đầu tiên của phương Tây về khả năng tấn công mạng của Kimi K3 và là thước đo xếp nó thua xa các mô hình hàng đầu của Mỹ mà nó thường được so sánh.

Đi trước AI

Điểm số về năng lực mạng chỉ là một mặt trận trong một cuộc thi lớn hơn nhiều về an toàn, quy định và cạnh tranh toàn cầu về AI. Bối cảnh chính sách đang thay đổi hàng tuần và việc thiếu một đánh giá duy nhất có thể đồng nghĩa với việc thiếu bối cảnh đằng sau dòng tiêu đề tiếp theo. Đọc thêm tin tức AI trên AI Buzz Wire để cập nhật mọi thông tin phát hành mô hình, phán quyết của chính phủ và đánh giá an toàn quan trọng.

Luôn dẫn đầu cuộc đua AI — truy cập AI Buzz Wire