Anthropic đã công bố vào hôm thứ Ba về một đợt mở rộng lớn các nỗ lực truy cập mô hình tập trung vào bảo mật, tái cơ cấu sáng kiến truy cập đã được hiệu đính của mình thành Chương trình xác minh mạng (CVP) chính thức với ba cấp độ riêng biệt dành cho các chuyên gia an ninh mạng. Động thái này được đưa ra khi công ty tiết lộ rằng sáng kiến Project Glasswing của họ đã phát hiện ra ít nhất 129.000 lỗ hổng phần mềm đã được xác minh kể từ tháng 4.
Chương trình được tái cấu trúc cho phép các nhóm bảo mật đã được kiểm duyệt chạy các mô hình có khả năng nhất của Anthropic — bao gồm Claude Opus 5.5, Claude Sonnet 5.5 và Claude Mythos 5.1 — với các biện pháp bảo vệ giảm bớt và chặn trình phân loại, những quyền mà người dùng thông thường thường không có. Theo Anthropic, mục tiêu là đưa khả năng AI tiên tiến vào tay những người bảo vệ trước khi những kẻ độc hại vũ khí hóa các công cụ tương tự. For more context on this story, see our ongoing artificial intelligence updates.
Ba tầng truy cập, ba kịch bản đe dọa
Chương trình mới được tổ chức theo ba cấp độ truy cập, mỗi cấp độ được điều chỉnh cho phù hợp với một loại công việc bảo mật khác nhau:
- Quyền truy cập phòng thủ bao gồm các hoạt động phòng thủ như ứng phó sự cố, kỹ thuật đảo ngược phần mềm độc hại cũng như phân tích và xác thực lỗ hổng.
- Quyền truy cập của nhóm đỏ bổ sung thử nghiệm thâm nhập được ủy quyền và nhóm đỏ vào các trường hợp sử dụng phòng thủ, cho phép các cuộc tấn công mô phỏng chống lại các hệ thống mà các tổ chức có quyền thử nghiệm.
- Quyền truy cập chuyên biệt có ít biện pháp bảo vệ nhất và chỉ dành riêng cho một số tổ chức đã được xác minh được ủy quyền tự kiểm tra các hệ thống an toàn AI.
Các tổ chức và nhóm bảo mật cá nhân đăng ký cấp độ phù hợp với công việc của họ và Anthropic sẽ xem xét từng ứng dụng trước khi cấp quyền truy cập. Công ty cho biết cả ba cấp độ đều bao gồm quyền truy cập vào các mẫu hàng đầu hiện tại cũng như các mẫu mới được phát hành trong tương lai.
Các biện pháp bảo vệ vẫn còn hiệu quả - Có chọn lọc
Anthropic kết hợp thông báo với dữ liệu đánh giá nhằm cho thấy rằng hệ thống cấp bậc tách biệt công việc phòng thủ lành tính khỏi khả năng thực sự nguy hiểm. Trong đánh giá CyScenarioBench trên Claude Opus 5.5, công ty đã báo cáo rằng các biện pháp bảo vệ đã chặn 46 trong số 50 nhiệm vụ ở cấp Truy cập Phòng thủ. Ở cấp Truy cập Nhóm Đỏ trên cùng một mô hình, không có nhiệm vụ nào bị chặn và mô hình đã hoàn thành 34 trên 50 - tỷ lệ hoàn thành tương tự được ghi nhận khi không áp dụng biện pháp bảo vệ nào.
Ngược lại, nếu không có quyền truy cập CVP, mọi tác vụ sẽ bị chặn ngay lần nhắc đầu tiên, theo Anthropic.
“Những đánh giá này giúp chúng tôi tin tưởng rằng chúng tôi có thể cung cấp các khả năng mạng tiên tiến một cách an toàn cho nhiều người bảo vệ hơn, mở rộng các nỗ lực phòng thủ mà chúng tôi đã bắt đầu với Dự án Glasswing”, công ty cho biết trong thông báo của mình, được The Hacker News, Reuters và SecurityWeek đưa tin rộng rãi.
Thiết kế này phản ánh sự đặt cược rằng hầu hết công việc bảo mật phòng thủ — vá lỗi, phân tích nhật ký, phân loại phần mềm độc hại — có thể tiến hành dưới các biện pháp bảo vệ nghiêm ngặt, trong khi thử nghiệm tấn công hợp pháp cần một hành lang rộng hơn. Nó cũng phản ánh cách ngành công nghiệp bảo mật từ lâu đã xử lý các công cụ có công dụng kép: kiểm tra người thực hiện, không chỉ công cụ.
Dấu chân mở rộng của Glasswing
Việc mở rộng chương trình được kết hợp chặt chẽ với Project Glasswing, sáng kiến của Anthropic nhằm áp dụng các mô hình của mình vào việc củng cố phần mềm quan trọng. Công ty cho biết Glasswing đã phát hiện ra ít nhất 129.000 lỗ hổng phần mềm đã được xác minh từ tháng 4 đến tháng 7 năm 2026 và thêm 5.500 lỗ hổng được xác minh từ tháng 4 đến tháng 10 thông qua các nỗ lực quét mã nguồn mở.
Trong số các lỗ hổng đã được xác minh, cho đến nay, hơn 33.000 lỗ hổng đã được đánh giá là nghiêm trọng hoặc có mức độ nghiêm trọng cao – một con số mà Anthropic mô tả có thể là một con số thiếu đáng kể vì nó chỉ dựa trên dữ liệu khảo sát từ một nhóm nhỏ các đối tác của Glasswing. Công ty ước tính tác động thực sự có thể cao hơn ít nhất 5 lần.
Một cái nhìn được đo lường về việc khám phá lỗ hổng dựa trên AI
Phân tích độc lập cho thấy hàng loạt lỗ hổng do AI tìm thấy không trực tiếp chuyển thành làn sóng vi phạm bị khai thác tương ứng. Trong một phân tích được công bố vào cuối tháng trước, nhà nghiên cứu Patrick Garrity của VulnCheck đã phát hiện ra rằng chỉ có 2 trong số 300 lỗ hổng được Anthropic hoặc Project Glasswing phát hiện – khoảng 0,67% – đã bị khai thác ngoài tự nhiên.
Hai lỗ hổng bị khai thác là CVE-2026-26980, lỗ hổng chèn SQL trong Ghost CMS và CVE-2026-61500, lỗ hổng giả mạo phiên trong Rejetto HTTP File Server. Dữ liệu hỗ trợ một sắc thái mà các nhà nghiên cứu bảo mật đã nhấn mạnh: AI đang hạ thấp rào cản đối với việc phát hiện lỗ hổng, nhưng hầu hết các lỗ hổng mà nó phát hiện chưa bao giờ nằm trong tầm ngắm của kẻ tấn công.
Thông báo này cũng được đưa ra trong bối cảnh cuộc tranh luận rộng rãi hơn về công việc bảo mật do AI tạo ra. Nghiên cứu từ 1Password và Veracode đã chỉ ra rằng các bản vá lỗ hổng do AI viết có thể tự tạo ra các lỗ hổng mới, nhấn mạnh rằng tự động hóa hỗ trợ nhưng không thay thế xác minh của con người.
Ý nghĩa của nó đối với ngành An ninh
Đối với các nhóm bảo mật, CVP giảm năng lượng kích hoạt khi sử dụng các mô hình biên giới cho công việc phòng thủ thực sự. Người ứng phó sự cố có được đường dẫn được phê duyệt để hỗ trợ phân tích phần mềm độc hại; người thử nghiệm thâm nhập có được môi trường được quản lý cho các cuộc tấn công được AI hỗ trợ; và một nhóm nhỏ các tổ chức tự kiểm tra hệ thống an toàn AI nhận được quyền truy cập ít bị hạn chế nhất.
Đối với Anthropic, chương trình vừa là chiến lược an toàn vừa là chiến lược thương mại. Nó cụ thể hóa quan điểm của công ty rằng các khả năng mạng mạnh mẽ nên được phát hành một cách có chủ ý, cho những người bảo vệ đã được kiểm duyệt, thay vì bị ngăn chặn hoàn toàn - một sự tương phản với các đối thủ đã phải đối mặt với sự giám sát kỹ lưỡng đối với các mô hình có khả năng kiểm soát mạng yếu hơn. Nó cũng làm sâu sắc thêm mối quan hệ của Anthropic với các doanh nghiệp có nhiều khả năng trả tiền nhất để truy cập mô hình biên giới: chính phủ, nhà điều hành cơ sở hạ tầng quan trọng và các nhà cung cấp bảo mật lớn.
Công ty đã không công bố những thay đổi về giá gắn liền với chương trình và các đơn đăng ký được xử lý thông qua các kênh truy cập đã được kiểm duyệt hiện có của Anthropic. Với quy mô của những gì Glasswing đã phát hiện - và sự thừa nhận của chính công ty rằng những con số có thể đánh giá thấp thực tế - ngành bảo mật sẽ theo dõi xem có bao nhiêu trong số 129.000 phát hiện đó được sửa trước khi những kẻ tấn công tìm thấy chúng trước tiên.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →