Anthropic hôm thứ Năm đã công bố báo cáo tình báo về mối đe dọa tháng 9 năm 2026, "Phát hiện và chống lại việc lạm dụng AI", mô tả cách nhóm Tình báo Đe dọa của họ xác định và ngăn chặn các tác nhân đe dọa lạm dụng Claude trong khoảng thời gian từ tháng 12 năm 2025 đến tháng 8 năm 2026. Các vụ việc trải dài trên bảy lĩnh vực gây hại khác nhau: hoạt động mạng, hoạt động gây ảnh hưởng, giám sát, lừa đảo và gian lận, lạm dụng sinh học, phát triển vũ khí thông thường và chưng cất mô hình bất hợp pháp. Theo công ty, mọi chiến dịch mà họ mô tả đều bị gián đoạn và thông tin tình báo đã được chia sẻ với chính quyền và các đối tác trong ngành khi thích hợp.

Báo cáo đến vào thời điểm ngành công nghiệp AI và Anthropic nói riêng đang bị giám sát chặt chẽ, vì tin nóng về AI tuần này bị chi phối bởi các tiết lộ về an toàn, tài khoản tố cáo và áp lực ngày càng tăng từ các nhà lập pháp. Nó cũng xuất hiện cùng với báo cáo từ The New York Times và Politico nêu bật những nỗ lực vũ khí hóa các mô hình biên giới - bao gồm cả những nỗ lực bị chặn liên quan đến phát triển vũ khí sinh học.

Cách Anthropic theo dõi các tác nhân đe dọa được kích hoạt bởi AI

Anthropic theo dõi các tác nhân trong báo cáo của mình theo các chỉ định nội bộ được gọi là Nhóm Đe dọa Sáng tạo hoặc GTG. Mỗi nghiên cứu điển hình đo lường những gì công ty gọi là nâng cao — khả năng tăng cường mà AI mang lại cho hoạt động trên ba chiều: tốc độ, quy mô và độ sâu. Các trường hợp lạm dụng liên quan đến các mẫu Claude Haiku, Sonnet và Opus. Không có trường hợp nào liên quan đến các mẫu thuộc lớp Fable hoặc Mythos của công ty, ngoại trừ một trường hợp chưng cất trái phép.

Anthropic coi việc sẵn sàng xuất bản như một nghĩa vụ hơn là một hoạt động tiếp thị, nêu rõ trong báo cáo rằng "chúng tôi tin rằng chúng tôi có trách nhiệm tiết lộ việc lạm dụng các dịch vụ của mình một cách có mục đích."

Một hoạt động liên kết với Blizzard lúc nửa đêm nhằm xây dựng lại phần mềm độc hại của chính nó

Vụ án mạng rộng rãi nhất của báo cáo, được theo dõi với tên GTG-20006, mô tả một diễn viên mà Anthropic cho rằng phù hợp với báo cáo công khai liên kết nó với Midnight Blizzard, nhóm hack liên kết với nhà nước Nga trước đây gọi là Nobelium hoặc APT29. Một trong những người điều hành nó, một cá nhân có biệt danh "JackPoterz", là một người nói tiếng Nga.

Theo báo cáo, nhóm này nhắm mục tiêu vào hơn 20 tổ chức, tập trung vào các cơ quan chính phủ, quân đội và ngoại giao Ukraine. Nó đã xâm phạm ít nhất ba nhà cung cấp WiFi của khách sạn để chiếm đoạt bản ghi DNS, chiếm đoạt tài khoản WhatsApp của ít nhất hai cựu quan chức cấp cao Ukraine và đánh cắp hơn 300.000 hồ sơ nhận dạng quốc gia cùng với dữ liệu đăng ký thương mại của hơn nửa triệu công ty từ cơ quan công nghệ của chính phủ Bắc Phi.

Chi tiết nổi bật nhất là khả năng thích ứng tự động: Anthropic báo cáo rằng các đặc vụ AI của tác nhân đã sửa đổi và xây dựng lại phần mềm độc hại của nhóm bất cứ khi nào các sản phẩm bảo mật phát hiện ra nó - một vòng lặp mà trước đây đòi hỏi các nhà phát triển lành nghề theo yêu cầu.

Thu thập thông tin xác thực ở quy mô lớn và săn lùng tự động trong 0 ngày

Trường hợp thứ hai, GTG-50014, bao gồm những người điều hành bị nghi ngờ có liên kết với tập thể ShinyHunters. Quy trình thu thập thông tin xác thực của họ đã tải xuống hàng loạt 1,8 triệu APK Android và quét chúng để tìm các bí mật được mã hóa cứng. Trong một lần xâm phạm của một nhà cung cấp công nghệ, hơn một terabyte dữ liệu đã bị lấy cắp, bao gồm hàng triệu hồ sơ thẻ thanh toán. Một đơn vị liên kết khác đã trích xuất dữ liệu từ khoảng 200 khách hàng hạ nguồn của một nhà cung cấp dịch vụ phần mềm bị vi phạm và bán hơn 2.100 bộ mã thông báo Azure AD trải rộng trên 40 đối tượng thuê công ty trong khoảng 34 giờ – với các tác nhân AI thực hiện gần như toàn bộ công việc, theo báo cáo.

GTG-10007 vẫn còn nghiêm trọng hơn đối với những người bảo vệ. Anthropic quy cụm này cho các nhà điều hành nói tiếng Trung Quốc có thể có trụ sở tại Trường Sa, Hồ Nam – hai người trong số họ được xác định là sinh viên đại học – đã nhắm mục tiêu vào khoảng 50 tổ chức và điều hành một chương trình nghiên cứu lỗ hổng tự trị. Một quy trình làm việc lặp đi lặp lại trên các thiết bị mạng đã mang lại hơn chục phát hiện có thể xảy ra về ngày số 0 chỉ trong một tháng.

Tống tiền, kẻ tấn công đơn độc và cuộc đột kích thất bại vào phòng thí nghiệm AI

Các tính năng lạm dụng có động cơ tài chính nổi bật. GTG-50020, một diễn viên nói tiếng Nga, đã lấy trộm khoảng 26 gigabyte từ một nạn nhân và tìm cách tống tiền từ 1,5 triệu đến 2,5 triệu USD. Nhóm tương tự sau đó đã tấn công khoảng 30 công ty AI trong khoảng bốn ngày với mục tiêu đã nêu là truy cập vào mô hình Claude trước khi phát hành. Anthropic cho biết mọi nỗ lực đều thất bại và hệ thống của họ không bao giờ bị xâm phạm.

Ở đầu bên kia của quang phổ, GTG-50029 là một kẻ tấn công nói tiếng Pháp, kẻ đã khai thác một điều kiện chạy đua cài đặt lại WordPress không có giấy tờ trước đó đối với ít nhất bốn trang web, giành được quyền truy cập nội bộ vào ít nhất 14 trong số 42 mục tiêu được theo dõi và lấy cắp khoảng 140.000 hồ sơ — bao gồm cả ý kiến ​​chính trị của người dùng từ một nền tảng chiến dịch. Sau đó, nam diễn viên đã xây dựng một nền tảng doxxing, fafsearch, chứa hàng chục triệu hàng.

Hoạt động gây ảnh hưởng từ Cộng hòa Trung Phi đến Malaysia

Chín trường hợp hoạt động gây ảnh hưởng trong báo cáo bắt nguồn từ Nga, Iran, Thổ Nhĩ Kỳ, vùng Vịnh, Nam Á, Châu Phi và Châu Âu, với phạm vi tiếp cận được đo lường theo Thang đo đột phá của Viện Brookings. Trong một trường hợp, GTG-04001, một diễn viên nói tiếng Nga có trụ sở tại Bangui đã sản xuất nội dung hàng ngày cho Radio Lengo Songo, một đài Anthropic có liên kết với Chính trị học – Quân đoàn Châu Phi và chi nhánh ảnh hưởng của Wagner mà họ đánh giá đã nằm dưới sự kiểm soát của Cơ quan Tình báo Nước ngoài Nga vào cuối năm 2023. Hoạt động này đã tạo ra các tài liệu và hợp đồng lao động giả mạo của chính phủ Cộng hòa Trung Phi yêu cầu lòng trung thành với tổng thống nước này và với Nga, và được đánh giá là Loại Bốn trên thang điểm.

Một mạng khác, GTG-54002, được truy tìm đến Công ty LKM, một công ty quảng cáo kỹ thuật số có trụ sở tại Pháp, vận hành khoảng 70 trang web tin tức bịa đặt, 70 tài khoản X trùng khớp và hơn 250 tài khoản bình luận không xác thực. Mạng này đã xuất bản ít nhất 8.913 bài viết bằng khoảng 20 ngôn ngữ, trong đó có 318 bài tập trung vào Cộng hòa Dân chủ Congo.

Các cuộc bầu cử cũng là một mục tiêu. GTG-84005, một nền tảng thao túng bầu cử thương mại nhắm vào Malaysia mà Anthropic liên kết với BBS Bilisim Teknolojileri có trụ sở tại Istanbul, đã quản lý khoảng 1.000 tài khoản X giả trên tất cả 222 khu vực bầu cử quốc hội Malaysia và làm giả hồ sơ chống lại một chính trị gia đối lập. Một cụm riêng biệt, GTG-24015, đã sử dụng bốn tài khoản làm bàn biên tập được hỗ trợ bởi AI để cung cấp cho truyền thông nhà nước Nga.

Tại sao việc tiết lộ lại quan trọng

Anthropic cho biết họ đã làm gián đoạn hoạt động trong từng trường hợp, sử dụng kết quả phát hiện để tăng cường các biện pháp bảo vệ và chia sẻ thông tin tình báo với chính quyền cũng như các đối tác trong ngành khi thích hợp. Việc xuất bản các nghiên cứu trường hợp chi tiết - hoàn chỉnh với các phân tích lỗi do chính họ phát hiện - vẫn còn hiếm ở các phòng thí nghiệm biên giới và công ty lập luận rằng tính minh bạch sẽ nâng cao cơ sở cho toàn bộ ngành.

Báo cáo cũng nhấn mạnh một sự thay đổi mà các nhóm an ninh không thể bỏ qua nữa: các hoạt động nguy hiểm nhất do AI hỗ trợ được mô tả ở đây không phải là các cuộc biểu tình giả định mà là các chiến dịch trực tiếp chống lại chính phủ, công ty và bầu cử. Khi các mô hình ngày càng có nhiều năng lực hơn, dữ liệu của Anthropic cho thấy mức độ nâng cao mà chúng mang lại cho những đối thủ đã xác định đang tăng lên — và câu trả lời tốt nhất hiện có của những người bảo vệ là khả năng hiển thị, tiết lộ và lặp lại nhanh hơn các biện pháp bảo vệ.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →