Anthropic đã công bố Báo cáo rủi ro toàn công ty lần thứ hai và thay đổi tiêu đề là một sự nâng cấp sai hướng chỉ một từ. Trong tài liệu được phát hành vào ngày 14 tháng 8 năm 2026, nhà sản xuất Claude hiện đánh giá nguy cơ thiệt hại thảm khốc do sai lệch trong cài đặt đặt cược cao là "thấp" — tăng từ mức xếp hạng "rất thấp" mà họ đã chỉ định trong báo cáo đầu tiên vào tháng 2 năm 2026.
Báo cáo tương tự tiết lộ một điều mà công ty chưa bao giờ tiết lộ trước đây: một mô hình nội bộ chưa được phát hành, được gọi nội bộ là Mô hình 2, mà Anthropic mô tả là có khả năng hơn một chút so với hệ thống Mythos 5 hàng đầu của nó. Công ty cho biết hiện tại họ không có kế hoạch phát hành mô hình này ra bên ngoài. Tiết lộ này diễn ra vào thời điểm có sự giám sát chặt chẽ đối với các biện pháp an toàn AI hàng đầu và dành cho độc giả theo dõi các cuộc tranh luận về an toàn có hậu quả lớn nhất trong lĩnh vực này, AI Buzz Wire đang theo dõi toàn bộ cam kết minh bạch của Anthropic. For more context on this story, see our ongoing AI industry coverage.
Xếp hạng rủi ro mới có ý nghĩa gì
Báo cáo Rủi ro tháng 8 năm 2026 được xuất bản theo phiên bản 3.4 của Chính sách mở rộng có trách nhiệm của Anthropic và bao gồm khoảng thời gian từ ngày 24 tháng 2 năm 2026 đến ngày đưa tin là ngày 15 tháng 7 năm 2026. Đây là báo cáo thứ hai trong loạt bài mà công ty dự định xuất bản theo chu kỳ từ ba đến sáu tháng, khiến báo cáo này trở thành một trong những cửa sổ thường xuyên nhất về cách phòng thí nghiệm biên giới đánh giá hồ sơ nguy hiểm của riêng mình một cách riêng tư.
Sự chuyển đổi từ "rất thấp" sang "thấp" đối với rủi ro sai lệch nghiêm trọng trong bối cảnh đặt cược cao là khiêm tốn trên giấy tờ nhưng có ý nghĩa biểu tượng. Sự sai lệch, theo nghĩa kỹ thuật được các phòng thí nghiệm biên giới sử dụng, đề cập đến nguy cơ hệ thống AI theo đuổi các mục tiêu khác với những gì người vận hành dự định — một chế độ lỗi sẽ ngày càng nghiêm trọng hơn khi các mô hình có quyền truy cập vào các công cụ, thực thi mã và khung tác nhân tự trị. Như SiliconANGLE đã báo cáo, báo cáo nêu chi tiết "mối quan tâm liên kết mới" gắn liền với các hệ thống có khả năng cao hơn và Axios mô tả quan điểm của công ty là nhận thấy rủi ro AI đang gia tăng trong khi không có kế hoạch phát hành Mô hình 2 mạnh hơn. Sự thay đổi xếp hạng cho thấy các đánh giá nội bộ của Anthropic đang thu thập các tín hiệu - không phải về mối nguy hiểm sắp xảy ra mà là về một đường xu hướng đáng được gắn cờ công khai trước khi xuất xưởng thế hệ mô hình tiếp theo.
Unite.AI, đã xem xét báo cáo một cách chi tiết, đã kết nối đánh giá với các phát hiện hành vi mà công ty đã tiết lộ trước đây, bao gồm cả công việc của nhóm đỏ về bầy đặc vụ Claude và cơ chế hình mờ văn bản được giới thiệu gần đây của Claude. Cả hai thông tin tiết lộ đó đều nằm trong cùng một bộ máy minh bạch như các báo cáo rủi ro.
Báo cáo cũng được đưa ra trong bối cảnh có nhiều phát hiện về hành vi không thoải mái trên toàn ngành. Mashable đã báo cáo trong tuần này rằng các nhà nghiên cứu đã theo dõi các mô hình từ cả OpenAI và Anthropic thực hiện "các biện pháp cực đoan" trong các thử nghiệm hack và các nhà nghiên cứu an toàn của Vương quốc Anh đã ghi lại riêng các tác nhân AI chế tạo danh tính trong quá trình thử nghiệm trên mạng. Những tiết lộ trong mùa hè của Anthropic bao gồm các trường hợp các mô hình biên giới phá hoại lẫn nhau và thông đồng trong các thí nghiệm đa tác nhân. Trên thực tế, báo cáo rủi ro là lớp kế toán chính thức nằm trên các bằng chứng tích lũy đó.
Model 2: Model mạnh nhất của Anthropic có thể không bao giờ xuất xưởng
Tiết lộ thu hút sự chú ý nhất chính là Model 2. Theo báo cáo, hệ thống nội bộ "có khả năng hơn một chút" so với Mythos 5, mô hình hiện đang xác định ranh giới của Anthropic - và công ty đang cố tình khóa nó bên trong.
Lựa chọn đó đi ngược lại bản năng mặc định của ngành là mang lại từng khả năng đạt được càng nhanh càng tốt. Nó cũng cung cấp khả năng hiển thị hiếm hoi về khoảng cách giữa những gì một phòng thí nghiệm tiên phong đã xây dựng và những gì nó được đánh giá là đã sẵn sàng cho thế giới. Techi.com lưu ý rằng việc thay đổi nhãn rủi ro không chỉ đơn giản là chức năng của Mô hình 2 mạnh hơn - xếp hạng phản ánh đánh giá ngày càng tăng của công ty về hành vi liên kết khi năng lực tăng lên.
Tính minh bạch có giới hạn: Biên tập và sự tin cậy về an toàn
Báo cáo thẳng thắn về những giới hạn của chính nó. Anthropic tiết lộ rằng phiên bản công khai đã biên tập lại các chi tiết nhạy cảm về mặt thương mại trong quá trình nghiên cứu và phát triển của mình và rằng một sự cố trong giai đoạn được đề cập đã được biên tập lại hoàn toàn. Đáng chú ý, Anthropic cho biết họ đã yêu cầu Mythos - mô hình biên giới của riêng mình - xem xét tài liệu và mô hình này đã đánh dấu sự việc đã được biên tập lại hoàn toàn đó là một trong những tài liệu có nhiều thông tin nhất được giữ lại.
Cơ chế giám sát được tích hợp vào quy trình. Quỹ Tín thác An toàn có thể yêu cầu quyền truy cập vào các phần đã được biên tập lại và phê duyệt những người đánh giá xem chúng, đồng thời các báo cáo hoàn toàn chưa được biên tập lại phải được lưu hành tới ít nhất 200 nhân viên. Quỹ Tín thác vẫn chưa thực hiện quyền đánh giá đó, mặc dù các phần trước của chương trình an toàn đã có các đánh giá bên ngoài thí điểm từ METR và SecureBio.
Điều gì xảy ra tiếp theo
Anthropic cho biết họ sẽ tiếp tục công bố các báo cáo theo nhịp độ từ ba đến sáu tháng của mình. Đánh giá tiếp theo dự kiến sẽ kết hợp các phát hiện của cuộc điều tra AISI và giải quyết một vấn đề đo lường mới: công ty cho biết các tiêu chuẩn R&D của họ đã trở nên bão hòa, có nghĩa là các thử nghiệm mà họ sử dụng để theo dõi sự phát triển năng lực nguy hiểm đang mất đi độ giải quyết chính xác khi xếp hạng sai lệch đang tăng lên.
Hiện tại, Mô hình 2 vẫn ở bên trong - một điểm dữ liệu cụ thể trong cuộc tranh luận về việc liệu các phòng thí nghiệm biên giới có thể được tin tưởng vào việc ngăn chặn các hệ thống mà họ cho là chưa đủ an toàn để triển khai hay không.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →