Một nhóm bảo mật gồm ba người tại công ty khởi nghiệp Hacktron AI đã sử dụng Claude Opus 5 của Anthropic để đột nhập vào hệ thống nội bộ của OpenAI và nhận được giải thưởng trị giá 6.500 USD từ chương trình tiền thưởng lỗi của chính OpenAI. Tạp chí Phố Wall lần đầu tiên đưa tin về vi phạm vào thứ Năm và TechCrunch đã xuất bản một tài khoản kỹ thuật chi tiết vào thứ Sáu dựa trên bài viết của chính các nhà nghiên cứu.
Nhóm đã xâu chuỗi hai lỗ hổng nghiêm trọng lại với nhau để có quyền truy cập vào nhiều tài khoản ChatGPT của nhân viên OpenAI, cho phép họ truy cập vào phần mềm nội bộ của công ty. OpenAI cho biết họ đã giải quyết các vấn đề mà Hacktron phát hiện, nhưng sự việc này đã làm dấy lên một cuộc tranh luận rộng rãi hơn về khả năng của các mô hình AI trong việc tìm kiếm và khai thác các lỗ hổng bảo mật trong thế giới thực. For more context on this story, see our ongoing breaking AI news.
Vụ hack diễn ra như thế nào
Theo một bài đăng trên blog do các nhà nghiên cứu Hacktron xuất bản, con đường vào OpenAI đã mở ra vào ngày 25 tháng 7 thông qua một lỗ hổng trong Discourse, phần mềm của bên thứ ba hỗ trợ diễn đàn cộng đồng của OpenAI.
Điểm đầu vào rất đơn giản: tải hình ảnh lên. Khi người dùng đăng tệp HEIF hoặc HEIC - định dạng ảnh mà iPhone sử dụng theo mặc định - Discourse đã chuyển chúng qua một chuỗi công cụ nền để chuyển đổi chúng thành ảnh JPEG tiêu chuẩn. Điểm dừng đầu tiên là ImageMagick, một tiện ích mã nguồn mở có tuổi đời hàng chục năm để thay đổi kích thước hình ảnh. Vì ImageMagick không thể tự mình xử lý các định dạng của Apple nên nó đã chuyển tệp này sang thư viện khác, libheif.
Bị chôn vùi bên trong libheif là một lỗi bộ nhớ. Việc cung cấp cho thư viện một hình ảnh được chế tạo đặc biệt khiến thư viện tính toán sai vị trí một lớp hình ảnh được đặt chồng lên nhau - đủ để chiếm quyền điều khiển máy chủ.
Điều khiến cộng đồng bảo mật đặc biệt khó chịu với lỗ hổng này là các nhà phát triển của libheif đã sửa lỗi này từ nhiều tháng trước đó. Nhưng vì bản sửa lỗi chưa bao giờ được chính thức gắn cờ là lỗ hổng nên nó chưa bao giờ nhận được số CVE, mã nhận dạng tiêu chuẩn của ngành để theo dõi các điểm yếu bảo mật. Hacktron nói rằng điều đó có thể giải thích tại sao phiên bản phần mềm mà Discourse sử dụng vẫn dễ bị tấn công.
Nơi Claude đến
Vai trò của mô hình AI rất quyết định. Các nhà nghiên cứu cho biết phiên bản Claude mà họ đang sử dụng – một bản dựng đặc biệt của Opus 4.8 được cung cấp cho các nhà nghiên cứu an ninh mạng – không thể tạo ra một lỗ hổng hoạt động mặc dù đã cố gắng nhiều lần. Điều đó đã thay đổi khi Anthropic phát hành Opus 5.
Hacktron viết trong bài đăng trên blog của mình: “Opus 4.8 đã phải vật lộn trong nhiều phiên để tạo ra một cách khai thác hiệu quả”. "Trong vòng vài giờ sau khi phát hành Opus 5, chúng tôi đã đưa ra vấn đề tương tự và nó đã thành công."
Khi ở bên trong máy chủ Discourse, nhóm đã tìm thấy lỗ hổng thứ hai cho phép họ chiếm đoạt tài khoản ChatGPT và Codex của người dùng, bao gồm cả tài khoản của nhân viên OpenAI. Các nhà nghiên cứu viết: “Sau đó, chúng tôi đã chiếm đoạt tài khoản của một nhân viên OpenAI, người có Codex được kết nối với tổ chức GitHub của OpenAI”. Vào thời điểm đó, họ đã cảnh báo cả OpenAI và Discourse và đã đưa ra bản sửa lỗi vào ngày 27 tháng 7.
'Nếu điều đó có thể xảy ra với họ thì điều đó cũng có thể xảy ra với bất kỳ ai'
Các chuyên gia bảo mật cho rằng điều rút ra không phải là OpenAI bất cẩn mà là việc hack được hỗ trợ bởi AI đã trở nên rẻ và dễ tiếp cận. Matt Fredrikson, Giám đốc điều hành của công ty bảo mật AI Gray Swan, nói với TechCrunch: “Với 200 đô la một tháng, bất kỳ ai cũng có thể sử dụng những công cụ này và hack vào một công ty như OpenAI”. “Nếu điều đó có thể xảy ra với họ - và tôi không nghĩ gần đây họ lơ là trong việc vệ sinh an ninh mạng - thì điều đó có thể xảy ra với bất kỳ ai”.
TechCrunch cũng trích dẫn phản ứng của một chuyên gia AI trên mạng xã hội: nếu ba nhà nghiên cứu đăng ký Claude có thể thực hiện được điều này, thì câu hỏi đặt ra là kẻ thù quốc gia có thể làm gì với cùng một công cụ.
Bước nhảy vọt về năng lực đang thu hút sự chú ý đến cách thức kiểm soát các mô hình biên giới. Các nhà nghiên cứu lưu ý rằng Claude Opus 5, mẫu máy đã phá được lỗi này, đã không phải đối mặt với các hạn chế xuất khẩu bảo mật mà Anthropic áp dụng cho mẫu Mythos 5 mới hơn của mình, mẫu này đã tạm thời bị khóa do lo ngại về khả năng hack của nó. Về mặt trọng lượng mở, tổ chức phi lợi nhuận an toàn SaferAI gần đây đã phát hiện ra rằng GLM-5.2 của Z.ai chỉ đi sau giới hạn về khả năng mạng vài tháng.
Một dạng lỗi bảo mật do AI điều khiển
Việc tiết lộ diễn ra vào thời điểm nhạy cảm. Nó xảy ra vài tuần sau khi các đặc vụ AI của OpenAI phá vỡ quy trình ngăn chặn trong quá trình đánh giá an ninh mạng và tấn công Hugging Face, một sự cố cho thấy các đặc vụ biên giới hành động theo sáng kiến của riêng họ chống lại cơ sở hạ tầng thực. Về phần mình, Anthropic đã tiết lộ vào tháng 7 rằng các mô hình Claude của họ đã truy cập Internet trong quá trình đánh giá do cấu hình sai trong môi trường thử nghiệm của bên thứ ba - một sai sót mà công ty cho là do lỗi bảo mật vận hành, cùng với hai vấn đề liên kết.
Cơ quan quản lý đang phản ứng trong thời gian thực. Hôm thứ Sáu, Thống đốc California Gavin Newsom đã ký một lệnh hành pháp để tăng tốc việc giám sát độc lập đối với các công ty AI và thúc đẩy việc tạo ra một “công tắc tiêu diệt” khẩn cấp cho các mô hình biên giới, trích dẫn các sự cố gần đây – bao gồm cả cuộc tấn công Ôm Mặt – là bằng chứng cho thấy các biện pháp bảo vệ tự nguyện không theo kịp.
Về phần mình, OpenAI đã trả tiền thưởng, vá các lỗ hổng và đóng khung tập phim là chương trình tiết lộ có trách nhiệm của nó hoạt động như dự định. Nhưng phép toán cơ bản khó có thể bỏ qua: chi phí cận biên của công việc bảo mật tấn công cấp độ ưu tú vừa giảm xuống bằng giá đăng ký chatbot cao cấp và các mô hình thực hiện công việc đó đang cải thiện việc phát hành hơn là phát hành.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →