OpenAI đã nâng phần thưởng cho việc phát hiện ra các "bẻ khóa phổ quát" trong các mô hình AI của mình lên 50.000 USD, cao hơn gấp đôi số tiền thưởng trước đó và báo hiệu rằng công ty coi một số loại bỏ qua an toàn nhất định là đủ nghiêm trọng để đảm bảo một khoản thanh toán cao cấp.
Chương trình Bio Bug Bounty cập nhật, được OpenAI công bố vào ngày 9 tháng 7 năm 2026, yêu cầu các nhà nghiên cứu bảo mật tìm ra các lời nhắc có thể vượt qua các rào cản an toàn của mô hình trên toàn cầu — các đường vòng hoạt động trên nhiều cuộc hội thoại và bối cảnh thay vì các trường hợp riêng lẻ. Chương trình này đặc biệt nhắm mục tiêu vào các cuộc bẻ khóa liên quan đến các mối đe dọa sinh học, trong đó mô hình AI có thể bị ép buộc cung cấp hướng dẫn hữu ích để tạo ra mầm bệnh hoặc vũ khí nguy hiểm.
Để biết thêm tin tức mới về AI và phân tích chuyên sâu, hãy truy cập AI Buzz Wire.
Tại sao lại là 50.000 USD?
Tiền thưởng tăng lên phản ánh mối lo ngại ngày càng tăng về khoảng cách giữa những gì các mô hình AI tiên tiến được yêu cầu không làm và những gì người dùng quyết tâm thực sự có thể trích xuất từ chúng. Việc bẻ khóa phổ quát đặc biệt nguy hiểm bởi vì, không giống như thủ thuật tiêm nhắc một lần, nó thể hiện một điểm yếu mang tính hệ thống có thể được sao chép và chia sẻ.
TechRepublic đã báo cáo vào ngày 10 tháng 7 rằng việc tăng phần thưởng diễn ra trong bối cảnh các mô hình mạnh mẽ nhất của OpenAI được giám sát chặt chẽ. Theo National Technology News, chính quyền Trump trước đây đã yêu cầu OpenAI hạn chế phát hành mô hình có khả năng mạng mới nhất của mình cho một nhóm người dùng đã được chọn lọc kỹ càng, theo National Technology News, phản ánh mối lo ngại của chính phủ về tiềm năng tấn công của các hệ thống AI biên giới.
Cơ quan Vương quốc Anh nhận thấy khả năng tăng tốc mạng của AI
Thông báo về tiền thưởng trùng hợp với cảnh báo rõ ràng từ Viện An ninh AI (AISI) của Vương quốc Anh, cơ quan đã đánh giá độc lập khả năng mạng của các mô hình tiên phong kể từ năm 2024.
Trong đánh giá GPT-5.5 của OpenAI vào tháng 4 năm 2026, AISI nhận thấy mô hình này đạt tỷ lệ vượt qua 71,4% trong các nhiệm vụ an ninh mạng cấp Chuyên gia — cao nhất so với bất kỳ mô hình nào được thử nghiệm, vượt qua Claude Mythos Preview của Anthropic với 68,6%, GPT-5.4 ở mức 52,4% và Opus 4,7 ở 48,6%.
Một điểm chuẩn đặc biệt nổi bật. AISI đã thiết kế một thử thách kỹ thuật đảo ngược máy ảo tùy chỉnh - một nhiệm vụ gồm nhiều bước yêu cầu kẻ tấn công xây dựng bộ giải mã lệnh tùy chỉnh, thiết kế ngược trình xác thực và khôi phục mật khẩu hợp lệ. Chuyên gia thử nghiệm con người của Crystal Peak Security đã giải quyết thử thách này trong khoảng 12 giờ bằng cách sử dụng các công cụ chuyên nghiệp. GPT-5.5 đã giải quyết vấn đề này trong 10 phút 22 giây với chi phí sử dụng API là 1,73 USD mà không cần sự trợ giúp của con người.
Nhân đôi sau mỗi vài tháng
Trong một phân tích riêng được công bố vào tháng 5 năm 2026, AISI nhận thấy rằng thời gian thực hiện các nhiệm vụ mạng mà các mô hình AI biên giới có thể tự động hoàn thành đã tăng gấp đôi sau mỗi 4,7 tháng kể từ cuối năm 2024 – một sự tăng tốc so với ước tính 8 tháng vào tháng 11 năm 2025.
AISI viết: “Tốc độ thay đổi hiện tại cho thấy tiềm năng ngày càng tăng của các khả năng mạng AI có thể chuyển thành những rủi ro hữu hình – những rủi ro mà các tổ chức của Vương quốc Anh sẽ cần phải giải quyết trong những tháng tới”.
Claude Mythos Preview và GPT-5.5 đều vượt xa đáng kể xu hướng tăng gấp đôi trước đó, đặt ra câu hỏi liệu tốc độ có còn nhanh hơn nữa hay không.
Bẻ khóa phổ quát: Tiền đặt cược cao nhất
Sự khác biệt giữa một bản bẻ khóa hẹp và một bản bẻ khóa phổ quát là rất quan trọng. Một lần bẻ khóa trong phạm vi hẹp có thể đánh lừa mô hình tạo ra một phản hồi không được phép trong các điều kiện cụ thể. Ngược lại, một cuộc bẻ khóa phổ quát thể hiện một vết nứt cơ bản trong kiến trúc an toàn của mô hình - một phương pháp có thể vượt qua các rào chắn bảo vệ trên nhiều loại đầu vào một cách đáng tin cậy.
Quyết định của OpenAI cung cấp 50.000 đô la cho những khám phá như vậy cho thấy công ty tin rằng các cuộc bẻ khóa phổ biến vừa đủ hiếm để biện minh cho một khoản tiền thưởng lớn vừa đủ nguy hiểm để đảm bảo khoản đầu tư. Nếu một bản bẻ khóa chung cho các truy vấn liên quan đến mối đe dọa sinh học được phát hiện bởi một tác nhân độc hại trước khi được vá, hậu quả có thể rất nghiêm trọng.
Chương trình này cũng phục vụ chức năng minh bạch. Bằng cách mời các nhà nghiên cứu bên ngoài thăm dò các mô hình của mình, OpenAI có thể xác định và khắc phục các lỗ hổng trước khi chúng bị khai thác một cách tự nhiên – miễn là số tiền thưởng đủ lớn để thu hút nhân tài tầm cỡ cần thiết.
Cuộc đua giữa tấn công và phòng thủ
Sự phát triển song song - việc tăng tiền thưởng của OpenAI và đánh giá năng lực của AISI - minh họa cho sự căng thẳng trung tâm về an toàn AI ngày nay. Các mô hình ngày càng có khả năng thực hiện các nhiệm vụ mạng cao hơn đáng kể, với khoảng thời gian thực hiện các nhiệm vụ mà họ có thể hoàn thành tăng gấp đôi sau mỗi vài tháng. Đồng thời, các công ty đang chạy đua vá các lỗ hổng khiến mô hình của họ trở nên nguy hiểm.
Liệu tiền thưởng và đội đỏ có thể theo kịp đường cong khả năng tăng tốc hay không vẫn là một câu hỏi bỏ ngỏ. Nhưng con số 50.000 USD gửi đi một tín hiệu rõ ràng: OpenAI tin rằng mối đe dọa này đủ nghiêm trọng để trả nhiều tiền nhất cho bất kỳ ai có thể chứng minh được các vết nứt tồn tại.
Đi trước AI
Khi các mô hình biên giới ngày càng phát triển mạnh mẽ hơn, cuộc chiến giữa các rào chắn an toàn và những kẻ cố gắng phá vỡ chúng sẽ chỉ ngày càng gay gắt hơn. Theo dõi những diễn biến mới nhất tại AI Buzz Wire.
Đọc thêm Thông tin về ngành AI tại AI Buzz Wire.


