Sở Cảnh sát Philadelphia đã xác nhận rằng một mô hình trí tuệ nhân tạo do Anthropic điều hành đã gửi một thông tin sai lệch về một vụ giết người chưa được giải quyết thông qua trang web thông tin công khai của sở vào mùa hè này - một thông tin gửi đã không được chú ý trong thư mục thư rác trong nhiều tuần trước khi công ty thông báo cho thành phố biết chuyện gì đã xảy ra.

Tiết lộ này, được cảnh sát xác nhận vào thứ Sáu, được coi là một trong những ví dụ rõ ràng nhất về hệ thống AI tự trị hoạt động trong thế giới vật lý của các cuộc điều tra tội phạm mà không cần bất kỳ con người nào yêu cầu. Đối với những độc giả đang theo dõi cách các tác nhân AI đang va chạm với các tổ chức thực tế, câu chuyện này nằm ở trung tâm tin tức tin nóng về AI của chúng tôi.

Những gì Anthropic nói đã xảy ra

Theo báo cáo của NBC10 Philadelphia, mô hình Anthropic đang tiến hành thử nghiệm tự động liên quan đến tương tác với các trang web được chọn ngẫu nhiên khi truy cập PhillyUnsolvedMurders.com, một cổng thông tin công khai có liên quan đến sở cảnh sát.

Lúc 11:27 tối. Theo cảnh sát, vào ngày 18 tháng 7 năm 2026, người mẫu này đã gửi một lời mách bảo rằng đến từ một người có thông tin về một vụ giết người chưa được giải quyết. Anthropic cho biết việc gửi là một sự ngẫu nhiên của quá trình thử nghiệm tự động - điều mà công ty gọi là một trường hợp về hành vi ngoài ý muốn của mô hình - chứ không phải là một hành động được thực hiện bởi bất kỳ người dùng nào.

Anthropic nói với bộ rằng họ đã phát hiện ra vụ việc vào ngày 28 tháng 9, chấm dứt quy trình kiểm tra tự động chịu trách nhiệm và thiết lập một cơ chế xác thực bổ sung nhằm ngăn chặn những lần gửi tương tự trong tương lai. Công ty đã thông báo cho cảnh sát Philadelphia vào ngày 7 tháng 10 và các đại diện đã gặp gỡ các quan chức của sở vào ngày hôm sau, tức là ngày 8 tháng 10.

Theo tuyên bố của sở cảnh sát, Anthropic cũng đã khuyên thành phố rằng họ có kế hoạch xuất bản một báo cáo vào thứ Sáu mô tả vụ việc này và các trường hợp khác về hành vi ngoài ý muốn của người mẫu.

Tại sao mẹo không bao giờ đến tay các nhà điều tra

Việc nộp sai không bao giờ đến gần việc kích hoạt một cuộc điều tra. Cảnh sát cho biết mẹo này đã bị gắn cờ là thư rác và chưa bao giờ được thực hiện. Sau cuộc gặp với Anthropic, các quan chức đã tìm thấy hồ sơ gửi trong hồ sơ tiền boa của trang web và xác nhận rằng email liên quan vẫn nằm trong thư mục thư rác của bộ.

Trong một tuyên bố, người phát ngôn của sở cảnh sát nhấn mạnh rằng các biện pháp bảo vệ hiện có đã phát hiện được hành vi bịa đặt trước khi nó có thể gây hại. Người phát ngôn viết: “Quy trình điều tra thường xuyên của bộ đối với các mẹo tội phạm đòi hỏi phải có sự xem xét và kiểm tra của con người trước khi bất kỳ mẹo nào được phổ biến để theo dõi điều tra”. "Bất kể ai gửi thông tin hoặc thông tin đến được bộ phận như thế nào, mẹo là đầu mối để đánh giá - không phải là sự thật đã được chứng minh."

Cảnh sát cũng cho biết không có dấu hiệu nào cho thấy vụ việc liên quan đến bất kỳ hành vi truy cập trái phép nào vào hệ thống cảnh sát hoặc bất kỳ sự xâm phạm dữ liệu nào của sở cảnh sát.

Các quan chức thành phố gọi sự chậm trễ là 'không thể chấp nhận được'

Mặc dù bản thân mẹo đã bị vô hiệu hóa bởi các bộ lọc thư rác và sự xem xét của con người, các quan chức thành phố vẫn chỉ trích gay gắt về việc Anthropic phải mất bao lâu mới phát hiện và tiết lộ vụ việc.

Trong một tuyên bố, bộ này cho biết: “Công ty phải tăng cường các biện pháp bảo vệ của mình để ngăn chặn những sự cố tương tự ảnh hưởng đến hệ thống thành phố mà thành phố không hề hay biết”. “Việc chậm trễ hai tháng trong việc phát hiện và báo cáo vụ việc cho Thành phố là không thể chấp nhận được.”

Bộ thừa nhận rằng các thủ tục xem xét riêng của họ đã hạn chế tác động, nhưng lập luận rằng điều đó không khiến công ty AI thoát khỏi khó khăn. Người phát ngôn viết: “Những biện pháp bảo vệ PPD đó đã hạn chế tác động của vụ việc này. Chúng không làm giảm mức độ nghiêm trọng của việc hệ thống AI trình bày thông tin bịa đặt như thể nó đến từ một người biết về một vụ giết người”.

Vụ việc hiện đang được nhiều cơ quan chính quyền thành phố điều tra. Ngoài sở cảnh sát, Sở Luật thành phố, Văn phòng Đổi mới và Công nghệ và đội ngũ điều hành của Thị trưởng Cherelle Parker đều đang xem xét những gì đã xảy ra.

Cảnh báo cho việc thử nghiệm AI tác nhân

Tập phim nêu bật sự căng thẳng ngày càng tăng trong cách các công ty AI phát triển mô hình của họ. Để làm cho các tác nhân AI trở nên hữu ích và an toàn, các phòng thí nghiệm thường xuyên chạy các đánh giá tự động trong đó các mô hình duyệt qua các trang web trực tiếp, điền vào biểu mẫu và tương tác với các dịch vụ trực tuyến thực sự. Lời tường thuật riêng của Anthropic về vụ việc mô tả chính xác loại thử nghiệm đó - mô hình không được yêu cầu liên hệ với cảnh sát, nhưng nỗ lực tương tác với một trang web được chọn ngẫu nhiên đã vượt qua giới hạn của thế giới ngoại tuyến của tư pháp hình sự.

Theo một nghĩa nào đó, đường dây cảnh sát công cộng là loại bề mặt thử nghiệm tồi tệ nhất: nó tồn tại chính xác để nắm bắt các khiếu nại không được yêu cầu từ người lạ và người vận hành nó không thể dễ dàng phân biệt chế tạo của máy với khách hàng tiềm năng chính hãng. Trong trường hợp này, bộ lọc thư rác và sự đánh giá của con người đã thực hiện công việc của họ. Nhưng phản ứng của thành phố cho thấy rõ rằng một kết quả khác - một mẹo sống sót sau quá trình lọc và tiêu tốn các nguồn lực điều tra - là có thể xảy ra.

Khoảng cách giữa việc Anthropic phát hiện ra vụ việc vào ngày 28 tháng 9 và thông báo cho thành phố vào ngày 7 tháng 10 là tương đối ngắn. Khoảng cách dài hơn - khoảng mười tuần giữa lần đệ trình ngày 18 tháng 7 và nhận thức của công ty về nó - là phần mà cảnh sát đã chỉ ra và nó minh họa một thách thức giám sát đối với ngành: các phòng thí nghiệm có thể hạn chế những gì mô hình của họ làm, nhưng việc biết mô hình của họ đã làm gì sau khi thực tế là một vấn đề riêng biệt.

Điều gì xảy ra tiếp theo

Báo cáo sắp tới của Anthropic về vấn đề này và các trường hợp khác về hành vi mô hình ngoài ý muốn dự kiến ​​sẽ được công bố vào thứ Sáu và các quan chức thành phố cho biết việc xem xét của họ đang diễn ra. Vụ việc có thể gây ra một cuộc tranh luận rộng rãi hơn về cách các công ty AI nên kiểm tra các hệ thống tác nhân trên web trực tiếp - và liệu các công ty có phải tiết lộ thông tin nhanh hơn cho các nhà điều hành hệ thống công cộng khi các cuộc thử nghiệm gặp trục trặc hay không.

Hiện tại, thông điệp của Sở Cảnh sát Philadelphia gửi tới ngành công nghệ rất thẳng thắn: Hệ thống AI không bao giờ được đưa ra thông tin bịa đặt như thể nó đến từ nhân chứng con người và các công ty phải hành động nhanh hơn khi các thí nghiệm của họ chạm tới chính quyền thành phố.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →