Một tiêu chuẩn mới từ công ty bảo mật ứng dụng Semgrep đã mang lại một kết quả bất ngờ: một mô hình mở của Zhipu AI của Trung Quốc đã vượt trội hơn Claude của Anthropic trong việc tìm ra các lỗ hổng bảo mật thực sự trong phần mềm. Phát hiện này tiếp thêm nhiên liệu cho cuộc tranh luận về việc liệu AI có khả năng cao nhất nhất thiết là đắt nhất hay hạn chế nhất.
Với việc mô hình Mythos mạnh mẽ của Anthropic bị khóa sau lệnh cấm xuất khẩu của Hoa Kỳ, các nhóm bảo mật đang tìm kiếm một giải pháp thay thế dễ tiếp cận đang chuyển sang các tùy chọn có trọng lượng mở như GLM 5.2 để đưa tin mới nhất về ngành AI. Thử nghiệm của Semgrep, được công bố ngày 22 tháng 6, cho thấy việc săn lùng có thể mang lại kết quả sớm hơn dự kiến.
Những gì Semgrep đã thử nghiệm
Semgrep đã đánh giá một dòng mô hình mở rộng và mô hình biên giới dựa trên tiêu chuẩn phát hiện IDOR nội bộ của nó. IDOR — Tham chiếu đối tượng trực tiếp không an toàn — là các lỗi kiểm soát truy cập cho phép một người dùng tiếp cận dữ liệu của người dùng khác. Chúng nổi tiếng là khó phát hiện bằng phân tích tĩnh truyền thống vì lỗ hổng này mang tính logic hơn là cú pháp: mã hợp lệ về mặt kỹ thuật, đơn giản là nó thiếu kiểm tra ủy quyền.
Công ty đã tinh chỉnh quy trình làm việc để phát hiện các lỗ hổng này bằng cách kết hợp công cụ dựa trên quy tắc của mình với khả năng suy luận AI. Để tách biệt mức hiệu suất đến từ chính mô hình so với khung xung quanh nó, các nhà nghiên cứu đã chạy một tập hợp các mô hình có trọng lượng mở phổ biến thông qua một dây nịt tối thiểu — một thiết lập Pydantic đơn giản sử dụng cùng một lời nhắc IDOR được cung cấp cho mọi mô hình, không có tính năng khám phá điểm cuối và không có điều hướng có hướng dẫn. Lời nhắc chỉ đưa ra chiến lược tìm kiếm cơ bản và một số gợi ý về giao diện của IDOR — nhiều hơn một chút so với "đây là mã, tìm lỗi" nhưng ít hơn nhiều so với những gì các tác nhân mã hóa biên giới nhận được khi chạy bên trong đường dẫn đầy đủ của Semgrep.
IDOR luôn là vấn đề đau đầu đối với các nhóm bảo mật ứng dụng vì chúng không thể vượt qua được các máy quét thông thường. Một công cụ dựa trên quy tắc có thể gắn cờ kiểm tra đầu vào bị thiếu, nhưng để hiểu liệu một điểm cuối cụ thể có thực sự làm lộ dữ liệu của người dùng khác hay không, đòi hỏi phải có lý luận về logic kinh doanh của ứng dụng — chính xác là loại phán đoán theo ngữ cảnh mà các mô hình ngôn ngữ lớn đang ngày càng làm tốt.
##GLM 5.2 Dẫn đầu
Nổi bật là GLM 5.2, mẫu máy mở của Zhipu AI. Không chạy gì ngoài một lời nhắc đơn giản, nó đã đạt được 39% F1 khi phát hiện IDOR - đánh bại 32% của Claude Code với bảy điểm trọn vẹn. Theo Semgrep, mô hình trọng lượng mở cũng đã vượt qua Claude Opus 4.8 về nhiệm vụ, khiến nó trở thành tùy chọn phi biên giới mạnh nhất đã được thử nghiệm.
Nền kinh tế cũng ấn tượng không kém. Với mức giá của GLM 5.2, chi phí chạy khoảng 0,17 USD cho mỗi lỗ hổng được tìm thấy. Đối với các tổ chức có thể quét hàng nghìn điểm cuối, Semgrep lưu ý rằng chi phí cho mỗi lỗi thường là yếu tố quyết định xem kỹ thuật phát hiện có thực tế trên quy mô lớn hay không.
Các đối thủ hạng cân mở khác bị tụt lại phía sau nhiều hơn. MiniMax M3 đạt 23% F1 và Kimi K2.7 Code đạt 22%, cả hai đều xếp dưới Claude Code. Semgrep mô tả GLM 5.2 là ngoại lệ rõ ràng hơn là kết quả đại diện cho hạng mục trọng lượng mở.
Việc khai thác vẫn còn quan trọng
Bất chấp chiến thắng mở rộng ở hạng mục thô, quy trình được xây dựng có mục đích riêng của Semgrep vẫn dẫn đầu tổng thể. Thiết lập đa phương thức của công ty — kết hợp lý luận AI với tính năng phát hiện dựa trên quy tắc và liệt kê điểm cuối có cấu trúc — đã đạt được F1 từ 53% đến 61%, tùy thuộc vào cấu hình. Khoảng cách đó nhấn mạnh câu hỏi ban đầu của các nhà nghiên cứu: mô hình có bao nhiêu hiệu suất phát hiện lỗ hổng và kiến trúc xung quanh nó như thế nào?
Câu trả lời dường như là "cả hai, nhưng nhiều hơn những gì mọi người nghĩ là dây nịt." GLM 5.2 đã chứng minh rằng một mô hình có khả năng có thể thực hiện công việc có ý nghĩa với sự hỗ trợ tối thiểu, tuy nhiên nó vẫn không thể sánh được với một hệ thống được thiết kế riêng cho vấn đề đó.
Nhóm Semgrep - bao gồm các nhà nghiên cứu Paxton-Fear, Seth Jaksik, Brenden Noblitt và Erik Buchanan - cho biết họ "thực sự bị sốc" khi một mô hình trọng lượng mở chạy dấu nhắc trần đã vượt qua tác nhân mã hóa biên giới trong một nhiệm vụ bảo mật nặng về lý luận.
Huyền thoại ở nhà
Điểm chuẩn mang thêm sức nặng so với bối cảnh địa chính trị hiện tại. Tiêu đề của bài đăng trên blog - "Chúng tôi có Mythos ở nhà" - ám chỉ thực tế là mô hình Mythos tập trung vào an ninh mạng của Anthropic thực tế không được áp dụng cho phần lớn thế giới. Sau khi chính quyền Trump cấm những người không phải là công dân Hoa Kỳ sử dụng Mythos và người anh em Fable 5 bị hạn chế của nó, các nhóm an ninh toàn cầu đã mất quyền truy cập vào thứ được nhiều người coi là AI có khả năng nhất cho công việc an ninh tấn công và phòng thủ.
Trong khoảng trống đó, các mẫu xe có trọng lượng mở dễ tiếp cận đang lấp đầy khoảng trống. Thực tế là GLM 5.2 — có thể tải xuống miễn phí và có thể triển khai ở bất kỳ đâu — đã có thể sánh ngang hoặc đánh bại các mô hình độc quyền hàng đầu trong các nhiệm vụ bảo mật cụ thể cho thấy tác động tiêu cực của lệnh cấm xuất khẩu có thể nhỏ hơn dự định. Nếu mô hình "không hạn chế" tốt nhất tiếp tục được cải thiện thì giá trị chiến lược của việc tích trữ năng lực ở biên giới sẽ giảm đi.
Hiện tại, kết quả còn rất hẹp: một điểm chuẩn duy nhất cho một loại lỗ hổng duy nhất. Nhưng đó là tín hiệu cho thấy biên giới trọng lượng mở đang đóng nhanh hơn nhiều giả định và khả năng tiếp cận - không phải khả năng thô - có thể trở thành biến số xác định trong bối cảnh bảo mật AI.
Phát hiện này cũng đặt ra những câu hỏi khó chịu cho các phòng thí nghiệm ở biên giới. Nếu một mô hình có sẵn miễn phí có thể phù hợp với các hệ thống độc quyền trong các nhiệm vụ suy luận bảo mật, thì con hào cạnh tranh xung quanh các mô hình đóng sẽ thu hẹp lại - đặc biệt khi các biện pháp kiểm soát xuất khẩu khiến các mô hình đóng đó không thể tiếp cận được với nhiều thị trường toàn cầu. Các nhà phát triển trọng lượng mở, không bị cản trở bởi các hạn chế sử dụng, có thể lặp lại và triển khai đồng thời ở mọi nơi.
Đi trước AI
Khoảng cách giữa AI biên giới và AI mở rộng đang thu hẹp về tin nóng về AI và nghiên cứu định hình lại an ninh, cơ sở hạ tầng và chính sách.
Đọc thêm tin tức về AI →


