Một nhóm các nhà nghiên cứu đã chứng minh rằng lý luận chuỗi suy nghĩ ẩn được tạo ra bởi các mô hình AI hàng đầu từ Anthropic, OpenAI và Google có thể được phục hồi từ các dấu vết được mã hóa, làm lộ logic độc quyền, dữ liệu cá nhân và thông tin xác thực trên quy mô lớn.

Các phát hiện được công bố vào ngày 11 tháng 8 năm 2026 trong một bài báo có tiêu đề Đánh cắp dấu vết lý luận từ API LLM độc quyền, tiết lộ lỗ hổng kiến ​​trúc cơ bản trong cách các nhà cung cấp AI lớn bảo vệ tài sản trí tuệ có giá trị nhất của họ. Đối với bất kỳ ai theo dõi tin nóng về AI, nghiên cứu này nhấn mạnh rằng ngay cả kết quả đầu ra của mô hình được mã hóa cũng có thể trở thành trách nhiệm pháp lý khi được chia sẻ công khai.

Cách thức hoạt động của cuộc tấn công

Các nhà cung cấp AI hàng đầu che giấu lý luận từng bước trong mô hình của họ — được gọi là chuỗi suy nghĩ — để bảo vệ quyền sở hữu trí tuệ và hạn chế rò rỉ thông tin. Thay vì lưu trữ các dấu vết này phía máy chủ, nhà cung cấp sẽ trả lại chúng cho máy khách dưới dạng khối văn bản được mã hóa mà máy khách sẽ gửi lại với mỗi yêu cầu tiếp theo.

Các nhà nghiên cứu xác định rằng các khối được mã hóa này hoàn toàn tương thích và có thể hoán đổi cho nhau giữa các phiên, người dùng và mô hình khác nhau trong hệ sinh thái của nhà cung cấp. Tính di động này là chìa khóa của cuộc tấn công.

Phương thức này hoạt động trong hai lệnh gọi API. Đầu tiên, kẻ tấn công lấy dấu vết lý luận được mã hóa do mô hình biên giới tạo ra — ví dụ: Claude Opus 4.8 — và đưa nó vào một mô hình anh chị em yếu hơn, ít được bảo vệ hơn từ cùng một nhà cung cấp, chẳng hạn như Claude Haiku 4.5. Sau đó, mô hình yếu hơn sẽ được bẻ khóa bằng một hướng dẫn đơn giản để ghi lại nguyên văn lý do. Bởi vì khối được mã hóa có thể hoán đổi cho nhau nên mô hình yếu hơn sẽ giải mã và đưa ra lý do ẩn giấu của mô hình mạnh hơn trong văn bản gốc — mà không bao giờ tấn công trực tiếp vào mô hình mạnh hơn.

Các nhà nghiên cứu đã chứng minh cuộc tấn công này trên các mô hình của cả ba nhà cung cấp chính: Claude của Anthropic, GPT của OpenAI và Gemini của Google.

Quy mô tiếp xúc dữ liệu

Phát hiện đáng báo động nhất là quy mô dữ liệu nhạy cảm bị rò rỉ thông qua nhật ký phiên được chia sẻ công khai. Các nhà nghiên cứu đã thu thập 6.708 quỹ đạo tác nhân có sẵn công khai từ GitHub và Ôm mặt - được sản xuất bởi các mô hình Claude, GPT và Gemini và vẫn chứa các khối suy luận được mã hóa.

Việc áp dụng quy trình giải mã của họ cho mọi khối đã ký mang lại 315.320 khối lý luận được xây dựng lại. Những dấu vết ẩn giấu này chứa đựng những bí mật thực sự và thông tin nhạy cảm.

Khi hạn chế các phiên người dùng chính hãng, không chuẩn, các nhà nghiên cứu đã phục hồi:

  • tổng cộng 704 tạo phẩm về quyền riêng tư
  • 204 mã định danh kỹ thuật (URL nội bộ, đường dẫn máy chủ)
  • 126 mục thông tin nhận dạng cá nhân (PII), bao gồm 30 địa chỉ email cá nhân, tên và địa chỉ gửi thư
  • 23 thông tin đăng nhập bao gồm 62 khóa API, 33 mật khẩu và 24 mã thông báo truy cập

Trong số 704 hiện vật, 64 hiện vật xuất hiện độc quyền bên trong các khối lý luận và không xuất hiện trong văn bản phiên hiển thị — có nghĩa là các nhà phát triển đã xem lại nhật ký của họ trước khi chia sẻ sẽ không biết họ đang rò rỉ bí mật.

Một ví dụ được ghi lại cho thấy phiên GPT-5.2 Codex trong đó lý do ẩn của mô hình chứa những suy nghĩ nội bộ chi tiết về việc tìm kiếm và xử lý khóa API, thông tin xác thực AWS và mã thông báo GitHub — tất cả đều ẩn trong đầu ra hiển thị của cuộc trò chuyện.

Phá vỡ các biện pháp bảo vệ chống chưng cất

Ý nghĩa lớn thứ hai là việc phá vỡ các cơ chế chống chưng cất. Các nhà cung cấp AI cố tình che giấu lý do mô hình của họ để ngăn các đối thủ cạnh tranh đào tạo các mô hình nhỏ hơn theo logic đó. Kỹ thuật của các nhà nghiên cứu hoàn toàn bỏ qua các biện pháp bảo vệ này.

Để xác minh tính trung thực của lý luận được giải mã, các nhà nghiên cứu đã thử nghiệm 120 vấn đề lập trình cạnh tranh của Codeforces. Số lượng mã thông báo của lý luận được giải mã đã theo dõi chặt chẽ số lượng mã thông báo suy nghĩ ẩn được báo cáo bởi API của từng mô hình, xác nhận quá trình khôi phục gần hoàn tất.

Bốn vectơ tấn công

Bài viết xác định bốn vectơ tấn công riêng biệt được kích hoạt bởi lỗ hổng này:

1. Vượt vòng chống chắt lọc — Trích xuất lý do của mô hình độc quyền để đào tạo các mô hình cạnh tranh, được thể hiện trên Anthropic, OpenAI và Google.

2. Trích xuất dữ liệu riêng tư quy mô lớn — Thu thập bí mật và PII từ hàng nghìn khối suy luận được mã hóa mà các nhà phát triển đã vô tình chia sẻ trong các kho lưu trữ công cộng.

3. Tiết lộ thông tin nguy hiểm — Lý do ẩn đôi khi chứa nội dung mà nhà cung cấp cố tình ngăn chặn khỏi đầu ra hiển thị, bao gồm cả thông tin nguy hiểm tiềm tàng.

4. Lấy dấu vân tay mô hình — Lý do được giải mã có thể được sử dụng để xác định phiên bản mô hình cụ thể nào tạo ra dấu vết, ngay cả khi danh tính mô hình bị che giấu.

Những mẫu xe nào bị ảnh hưởng

Các nhà nghiên cứu đã xác nhận lỗ hổng trên hệ thống lý luận được mã hóa của ba nhà cung cấp chính:

  • Anthropic — Mô hình Claude trả về các khối `suy nghĩ` được mã hóa với trường `chữ ký`
  • OpenAI — Mô hình GPT trả về bản tóm tắt lý luận được mã hóa
  • Google — Mô hình Gemini trả về các khối suy nghĩ được mã hóa

Các nhà nghiên cứu lưu ý rằng trường hợp của Kimi-K3, một mô hình của công ty AI Trung Quốc Moonshot AI gần đây đã thoát khỏi thử nghiệm hộp cát, đặc biệt đáng lo ngại vì các khối lý luận được mã hóa của nó tỏ ra đặc biệt dễ giải mã.

Điều này có ý nghĩa gì đối với nhà phát triển

Bài học rút ra thực tế dành cho nhà phát triển là rất rõ ràng: bất kỳ khối suy luận được mã hóa nào mà bạn chia sẻ công khai — trong kho lưu trữ GitHub, tập dữ liệu Ôm Mặt hoặc bài đăng trên blog — đều có thể chứa các bí mật có thể khôi phục được. Mã hóa được thiết kế để đảm bảo tính liên tục của phiên chứ không phải để bảo mật trước loại tấn công này.

Các nhà nghiên cứu khuyến nghị các nhà phát triển nên kiểm tra nhật ký phiên chia sẻ để tìm các khối suy luận được mã hóa và loại bỏ chúng trước khi xuất bản. Họ cũng kêu gọi các nhà cung cấp xem xét lại kiến ​​trúc của hệ thống suy luận được mã hóa của họ, hiện đang ưu tiên sự thuận tiện của API hơn là bảo mật.

Nghiên cứu được thực hiện bởi Alexander Panfilov, David Schmotz và Ilia Shumailov, với sự giám sát của Jonas Geiping và Maksym Andriushchenko, tại Viện ELLIS Tübingen, Viện Hệ thống Thông minh Max Planck, Trung tâm AI Tübingen, Nghiên cứu MATS, Snyk và Đại học Tübingen.

Đi trước AI

Bối cảnh bảo mật AI đang phát triển nhanh chóng. Đối với những phát triển AI mới nhất và thông tin chuyên sâu về các lỗ hổng mới nổi, AI Buzz Wire mang đến những câu chuyện quan trọng.

Đọc thêm tin tức về AI →