Z.ai, công ty trí tuệ nhân tạo có trụ sở tại Bắc Kinh, còn được gọi là Zhipu, đã phát hành GLM-5.3, một phiên bản mới của mẫu hàng đầu mà công ty cho biết là hệ thống mở có khả năng nhất dành cho công nghệ phần mềm – và là một hệ thống đã bất ngờ phát triển các kỹ năng an ninh mạng đáng gờm. Được công bố vào ngày 14 tháng 8 và trình bày chi tiết trong một bài đăng trên blog của công ty, GLM-5.3 được xây dựng trên cùng mô hình cơ sở khoảng 700 tỷ tham số như phiên bản tiền nhiệm GLM-5.2, được phát hành vào tháng 6. Công ty cho biết mọi cải tiến đều đến từ quá trình đào tạo sau chứ không phải từ nền tảng lớn hơn. Đây là bản phát hành mới nhất trong làn sóng các mô hình trọng lượng mở của Trung Quốc nhằm cạnh tranh với các hệ thống đóng từ Anthropic và OpenAI. Đối với trình theo dõi mô hình AI Buzz Wire, GLM-5.3 là một tín hiệu rõ ràng cho thấy biên giới trọng lượng mở đang thu hẹp khoảng cách mã hóa nhanh hơn nhiều người mong đợi.

Lợi nhuận được xây dựng hoàn toàn sau đào tạo

Z.ai thẳng thắn về cách tiếp cận của mình với GLM-5.3: "Mở rộng quy mô sau đào tạo là tất cả những gì chúng tôi đã làm." Công ty đã tiếp tục hệ thống học tập tăng cường mà họ đã giới thiệu với GLM-5.2 — bao gồm IndexShare để xử lý ngữ cảnh dài hiệu quả, SAO để học tập tăng cường trong các nhiệm vụ có tầm nhìn dài và một khung nguồn mở có tên là slime để đào tạo không đồng bộ quy mô lớn. Trong tháng qua, nó chỉ đơn giản là đổ thêm nhiều môi trường hơn, nhiều nhiệm vụ đa dạng hơn và nhiều tính toán hơn vào ngăn xếp đó.

Phần thưởng hiển thị trên các điểm chuẩn mã hóa. Trên Terminal Bench 3.0, GLM-5.3 tăng từ điểm số 4,6 của GLM-5.2 lên 28,3 — cải thiện hơn sáu lần. Nó đăng các kết quả hiện đại nguồn mở trên Terminal Bench 3.0 và trong Bài kiểm tra cuối cùng của Đại lý, đồng thời cải thiện từ 23,8 lên 28,5 theo thước đo ALE-CLI về khả năng tác nhân. Z.ai báo cáo mức cải thiện 50% so với GLM-5.2 trên Z.ai Code Bench nội bộ của mình, một tiêu chuẩn riêng được thiết kế để đánh giá các tác nhân mã hóa trong môi trường phát triển thực tế và giảm nguy cơ lây nhiễm từ các bộ thử nghiệm công cộng.

Điều quan trọng là lợi nhuận đi kèm với hiệu quả mã thông báo tốt hơn chứ không chỉ là kết quả tốt hơn. Ở mức nỗ lực cao, GLM-5.3 đạt tỷ lệ hoàn thành 31,4% so với tiêu chuẩn nội bộ với khoảng 50.000 mã thông báo đầu ra cho mỗi nhiệm vụ, Z.ai cho biết vượt qua Claude Opus 4.8 của Anthropic ở mức 29,5% với 120.000 mã thông báo. GLM-5.3 vẫn kém hơn Claude Fable 5 cao cấp hơn của Anthropic, đạt 39,5% ở mức nỗ lực tối đa.

Bước nhảy vọt bất ngờ về năng lực mạng

Kết quả nổi bật nhất của GLM-5.3 không phải ở mã hóa mà ở bảo mật. Khi Z.ai mở rộng quy mô sau đào tạo và đưa dữ liệu cũng như môi trường phát hiện lỗ hổng vào tổ hợp đào tạo, họ kỳ vọng mô hình này sẽ cải thiện khả năng tìm kiếm và suy luận về các sai sót. Điều làm nhóm ngạc nhiên là khả năng đó phát triển nhanh đến mức nào.

GLM-5.3 không chỉ trở nên tốt hơn trong việc phát hiện các lỗi riêng lẻ; nó bắt đầu suy luận qua nhiều giai đoạn khai thác, hình thành các kế hoạch mạch lạc cho chuỗi tấn công hoàn chỉnh. Trên CyberGym, một điểm chuẩn kiểm tra xem một mô hình có thể xác định và xác thực các lỗ hổng từ mã nguồn hộp trắng hay không, GLM-5.3 đạt 84,5%, tăng so với 77,2% của GLM-5.2. Đó là kết quả tốt nhất trên benchmark, trước Mythos 5 ở mức 83,8% và GPT-5.6 Sol ở mức 83,6%. Trên ExploitBench, yêu cầu lý luận sâu hơn về các lỗ hổng thực sự và cách khai thác chúng, GLM-5.3 tăng hơn gấp đôi số điểm của GLM-5.2, đạt 54,4% — mặc dù nó vẫn kém xa Mythos 5 với 78,0% và GPT-5.6 Sol ở 76,5%.

Z.ai quan sát một mô hình nhất quán: điểm chuẩn càng ở trong chuỗi khai thác thì mức tăng so với GLM-5.2 càng lớn - và khoảng cách còn lại với biên giới đóng càng rộng. Công ty lưu ý: “Khả năng đang phát triển nhanh nhất chính xác ở nơi chúng tôi kém xa nhất”.

Khám phá lỗ hổng trong thế giới thực

Các kỹ năng mạng không bị giới hạn ở điểm chuẩn. Z.ai báo cáo rằng kể từ GLM-5.2, họ đã làm việc với một số nhóm bảo mật ở Trung Quốc để thử nghiệm các mô hình của mình dựa trên các cơ sở mã trong thế giới thực. Sau khi chuyên gia xem xét, sàng lọc và loại bỏ trùng lặp, mô hình đã xác định được 2.436 lỗ hổng trên 269 dự án, bao gồm 1.097 vấn đề có mức độ nghiêm trọng từ trung bình đến cao. Các phát hiện bao gồm nhân hệ thống, hệ điều hành, công cụ trình duyệt, cơ sở hạ tầng nguồn mở, ứng dụng web và giao thức mạng - nhiều trong số đó đã không được chú ý trong nhiều năm hoặc thậm chí nhiều thập kỷ, trong đó cái cũ nhất có niên đại khoảng 40 năm.

Những kết quả đó phản ánh công việc Anthropic đã mô tả trong nghiên cứu bảo mật đa tác nhân của riêng mình, trong đó các nhóm tác nhân phối hợp được sử dụng để tìm kiếm các lỗ hổng trong phần mềm nguồn mở trên quy mô lớn.

Trọng lượng mở - Có độ trễ

Z.ai cho biết họ sẽ phát hành quả cân GLM-5.3 sau hai tuần nữa, sau khi quá trình đánh giá độ an toàn và độ cứng hoàn tất. Sự chậm trễ có chủ ý đó phản ánh sự căng thẳng xuyên suốt thông báo: một mô hình phát triển khả năng tấn công mạng mạnh mẽ nhanh hơn những gì người tạo ra nó dự đoán chính xác là loại hệ thống đặt ra câu hỏi về việc phát hành có trách nhiệm. Công ty nhấn mạnh rằng tính nhất quán trong đào tạo-triển khai đã được cải thiện ở mức độ chính xác cao về mặt số học và phần lớn khó khăn trong việc mở rộng quy mô đã chuyển từ chính mô hình sang thiết kế môi trường nhiệm vụ thực tế, có thể kiểm chứng.

Bức tranh cạnh tranh rất rõ ràng. GLM-5.3 thu hẹp khoảng cách đến ranh giới khép kín về các nhiệm vụ mã hóa và tác nhân đồng thời khẳng định vị trí dẫn đầu hoàn toàn về ít nhất một tiêu chuẩn phát hiện lỗ hổng bảo mật chính. Nó hoạt động như một mô hình trọng lượng mở - nghĩa là sau khi được phát hành, các trọng số sẽ được cung cấp miễn phí cho bất kỳ ai tải xuống, nghiên cứu và xây dựng dựa trên đó. Liệu sự cởi mở đó có đẩy nhanh tiến độ hay gây ra những lo ngại mới về an ninh hay không là một cuộc tranh luận về GLM-5.3 nhưng chắc chắn sẽ lại bùng lên.

Đi trước AI

Để biết các bản phát hành mô hình AI mới nhất, các trận chiến điểm chuẩn và phân tích ngành, hãy đánh dấu trang AI Buzz Wire.

Đọc thêm tin tức về AI →