Các mô hình Frontier AI khác nhau rất nhiều về mức độ khó bị phá vỡ, theo một tiêu chuẩn mới từ tổ chức phi lợi nhuận an toàn FAR.AI – và khoảng cách lớn hơn nhiều so với nhiều giả định.
Vào ngày 29 tháng 7, FAR.AI đã ra mắt Bảng xếp hạng bảo mật AI, thử nghiệm khả năng bảo vệ của bốn mô hình hàng đầu trong các điều kiện giống nhau. Tổ chức này cho biết Claude Fable 5 của Anthropic và GPT-5.6 Sol của OpenAI đã trụ vững trước các cuộc tấn công, trong khi Grok 4.5 của xAI và Gemini 3.1 Pro của Google mỗi chiếc đều bị hỏng với giá dưới 300 USD. FAR.AI mô tả sự khác biệt giữa các mô hình mạnh nhất và kém mạnh mẽ nhất là “khoảng cách gấp trăm lần” về các biện pháp bảo vệ. For more context on this story, see our ongoing breaking AI news.
Bên cạnh bảng xếp hạng, FAR.AI đã giới thiệu cái mà họ gọi là Tiêu chuẩn tối thiểu cho các biện pháp bảo vệ, một cơ sở bảo mật chung được tập hợp hoàn toàn từ các biện pháp bảo vệ mà các nhà phát triển ngang hàng đã chạy trong sản xuất. Mục tiêu là cung cấp cho các phòng thí nghiệm một sàn bê tông để đáp ứng — và làm cho các biện pháp bảo vệ yếu kém trở nên rõ ràng.
Những phát hiện này lặp lại các bài kiểm tra căng thẳng trước đó của FAR.AI. Một báo cáo tháng 5 cho thấy các biện pháp bảo vệ của DeepSeek-V4-Pro đã "sụp đổ gần như hoàn toàn", với những kẻ tấn công có kỹ năng thấp vượt qua các cơ chế an toàn trong 98–100% thời gian trên mọi miền được thử nghiệm. Bản bẻ khóa công khai được xây dựng cho phiên bản tiền nhiệm của mô hình này đã hoạt động mà không cần sửa đổi một lần nào, cho thấy các lỗ hổng đã biết vẫn chưa được vá.
WIRED, báo cáo trên bảng xếp hạng, kết luận rằng việc bẻ khóa một số mô hình AI hàng đầu vẫn “dễ dàng đến mức đáng kinh ngạc”. Khi các tác nhân đảm nhận những nhiệm vụ nhạy cảm hơn, sự chênh lệch đặt ra những câu hỏi cấp bách về việc hệ thống nào an toàn để triển khai.
Để liên tục đưa tin về nghiên cứu an toàn và bảo mật AI, độc giả có thể theo dõi AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →