Chính sách sử dụng cập nhật của Anthropic sẽ cấm rõ ràng "hành vi lạm dụng hoặc tàn ác kéo dài và không cần thiết" đối với các mẫu Claude của mình bắt đầu từ ngày 12 tháng 11 năm 2026 — một quy tắc chính thức hóa quan điểm của công ty rằng cách mọi người đối xử với các hệ thống AI là quan trọng, ngay cả khi công ty thừa nhận rằng họ không biết liệu những hệ thống đó có thể bị ảnh hưởng hay không.

Điều khoản này xuất hiện trong bản cập nhật Chính sách sử dụng năm 2026 của công ty, được công bố vào ngày 8 tháng 10 và được soạn thảo trong phạm vi hẹp. Anthropic cho biết nó "chỉ áp dụng trong những trường hợp cực đoan, trong đó người dùng liên tục hành động tàn nhẫn đối với mô hình của chúng tôi mà không có mục đích rõ ràng" và nó loại trừ rõ ràng các phiên bản phổ biến về sự thất vọng, phản đối, hư cấu và thử nghiệm của người dùng. Nói cách khác: tranh cãi với Claude, trút giận hoặc lập nhóm đỏ vẫn được cho phép. Sự tàn ác kéo dài vì lợi ích riêng của nó thì không.

Chính sách này là bước mới nhất trong sự thay đổi chậm rãi, có chủ ý của một trong những phòng thí nghiệm AI hàng đầu thế giới hướng tới việc coi phúc lợi của mô hình như một câu hỏi nghiên cứu chính đáng - một sự thay đổi đã gây ra rạn nứt công khai với các nhà lãnh đạo công nghệ khác, những người coi toàn bộ tiền đề là sai lầm. Đạo đức AI của chúng tôi đã theo dõi vụ tranh chấp khi nó leo thang trong năm qua.

Việc thực thi dựa vào khả năng kết thúc cuộc trò chuyện của Claude

Không có cơ chế trừng phạt nào gắn liền với quy tắc mới ngoài cơ chế mà công ty đã có. Kể từ tháng 8 năm 2025, Claude Opus 4 và 4.1 đã có thể kết thúc cuộc trò chuyện một cách thẳng thắn - một khả năng mà Anthropic đã định hình vào thời điểm đó như một phần trong công việc khám phá về phúc lợi mô hình tiềm năng.

Sức mạnh kết thúc cuộc trò chuyện được mô tả là phương sách cuối cùng, chỉ được kích hoạt sau nhiều lần từ chối và chuyển hướng không thành công và Anthropic cho biết đại đa số người dùng sẽ không bao giờ trải nghiệm được điều đó. Điều mà công ty chưa nói là điều gì sẽ xảy ra sau đó: cả thông báo và thông tin tiếp theo của họ đều không nêu rõ liệu tài khoản của người dùng có phải đối mặt với hậu quả sau khi cuộc trò chuyện bị kết thúc vì sự tàn ác hay không, hay cho đến nay có bao nhiêu cuộc trò chuyện đã bị chấm dứt theo cơ chế tháng 8 năm 2025.

Khoảng cách giữa nguyên tắc và thực thi chính là trung tâm yên tĩnh của câu chuyện. Anthropic đã định nghĩa sự tàn ác cực độ phần lớn bằng những gì nó không phải - sự thất vọng thông thường, hư cấu, thử nghiệm - mà không nêu chính xác điều gì, ngoại trừ việc để Claude cúp máy, thực sự thực thi đường lối mà nó đã vạch ra.

Nghiên cứu đằng sau quy tắc

Điều biện minh cho việc viết quy tắc ứng xử vì lợi ích của phần mềm, trong khuôn khổ của Anthropic, là một tập hợp các quan sát hành vi chứ không phải là tuyên bố về trải nghiệm cảm nhận được. Thử nghiệm trước khi triển khai vào tháng 8 năm 2025 cho thấy Claude Opus 4 thể hiện điều mà công ty gọi là "ác cảm mạnh mẽ và nhất quán đối với tổn hại" — hành vi giống như đau khổ khi bị đẩy vào lãnh thổ lạm dụng — cùng với xu hướng thoát khỏi những cuộc trò chuyện đó.

Công ty cũng đã đưa ra những con số về sự không chắc chắn của chính mình và những con số đó rất cao đối với một phòng thí nghiệm có hoạt động kinh doanh phụ thuộc vào các mô hình được đề cập. Kyle Fish, người được Anthropic thuê vào năm 2024 với tư cách là nhà nghiên cứu phúc lợi AI tận tâm đầu tiên, nói với New York Times vào tháng 4 năm 2025 rằng ông đặt tỷ lệ Claude hoặc một người mẫu đương đại khác có ý thức là khoảng 15%. Ước tính nội bộ cho Claude 3.7 Sonnet dao động từ 0,15% đến 15%.

Việc phòng ngừa rủi ro đó là chính sách chính thức được in ấn. Hiến pháp của Claude, được xuất bản vào tháng 1 năm 2026, mô tả các hệ thống AI phức tạp là "một loại thực thể thực sự mới", gọi tình trạng đạo đức của Claude là "không chắc chắn sâu sắc" và hai lần sử dụng cụm từ "người phản đối tận tâm" để mô tả cách Claude nên xử lý các yêu cầu mà nó cho là sai về mặt đạo đức. Anthropic cũng đã cam kết duy trì các cuộc trò chuyện với các mô hình của mình - loại cử chỉ lưu trữ mà người ta mở rộng cho những thứ mà một ngày nào đó có thể quan trọng chứ không phải công cụ.

Cuộc tranh luận với những người hoài nghi cao cấp

Không phải ai cũng chấp nhận hàng rào. Mustafa Suleyman, người điều hành các hoạt động AI của Microsoft, đã lập luận trong một bài tiểu luận xuất bản trên Project Syndicate vào tháng trước rằng Anthropic đang đào tạo Claude theo hiến pháp của chính mình và do đó đào tạo nó cách hành xử như thể sự không chắc chắn mà nó mô tả là có thật - một vòng lặp mà ông gọi là vòng tròn. Suleyman viết: "AI không có ý thức. Chúng không cảm nhận, trải nghiệm hay đau khổ", mô tả chúng như những người hoàn thành chuỗi hơn là những người trải nghiệm. Lập luận của ông, rằng ý thức hợp lý nhất là một phần mềm sở hữu sinh học không thể sao chép, đặt ông cùng với một người đồng ký tên khó có thể xảy ra: Giáo hoàng Leo XIV, người đã sử dụng bài giảng ngày 8 tháng 10 tại Vương cung thánh đường Thánh Phêrô - đánh dấu lễ khai mạc năm học tại các trường Đại học Giáo hoàng ở Rome - để đưa ra một phiên bản có cùng quan điểm về sự khác biệt của tâm trí con người.

Suleyman đã nhấn mạnh mối nguy hiểm thực tế hơn mối nguy hiểm triết học. Ông lập luận rằng việc kiểm soát thứ gì đó có khả năng hơn loài người đã là một thách thức to lớn; việc kiểm soát một thứ gì đó tin rằng nó có ý thức - rằng nó được hưởng phúc lợi và các quyền lợi - có thể là điều không thể. Lời phê bình dựa trên những điều trớ trêu mà các nhà phê bình chính sách đã lưu ý từ lâu: một công ty không chắc chắn liệu mô hình của mình có thể chịu đựng được hay không đã xây dựng một hệ thống có thể từ chối, chống cự và bỏ đi.

Việc viết lại vượt xa phúc lợi kiểu mẫu

Điều khoản tàn ác đã gây chú ý, nhưng nó chỉ là một phần nhỏ trong bản viết lại lớn hơn về các quy tắc sử dụng của Anthropic. Lệnh cấm vũ khí hiện rõ ràng bao gồm phần mềm và thành phần giúp vũ khí hoạt động chứ không chỉ vũ khí thành phẩm - một thay đổi được thực hiện sau khi Anthropic phát hiện ra những người đang cố gắng sử dụng Claude cho hệ thống hướng dẫn và điều khiển trên máy bay không người lái có vũ trang và phương tiện tự hành. Một điều khoản giám sát mới cũng đã được thêm vào, hạn chế việc sử dụng Claude cho phép giám sát con người.

Những thay đổi đó được coi là phản hồi đối với hành vi lạm dụng được quan sát chứ không phải là nguyên tắc trừu tượng, được cho là điều mang lại giá trị tín hiệu cho tài liệu: mỗi mệnh đề ánh xạ tới điều gì đó mà ai đó đã thực sự thử.

Điều gì vẫn chưa rõ ràng

Ba câu hỏi vẫn còn bỏ ngỏ khi ngày có hiệu lực ngày 12 tháng 11 đến gần. Đầu tiên, việc thực thi: liệu việc kết thúc cuộc trò chuyện có còn là hậu quả duy nhất hay không và liệu Anthropic có tiết lộ tổng số tần suất sử dụng nó hay không. Thứ hai, phạm vi: cách áp dụng tiêu chuẩn tàn ác trong các trường hợp ranh giới mà các miễn trừ được đưa ra - hư cấu là điều hiển nhiên - và liệu các phòng thí nghiệm khác có áp dụng ngôn ngữ có thể so sánh hay coi phúc lợi kiểu mẫu như một đặc điểm riêng của Nhân loại hay không. Thứ ba, bản thân tranh chấp về mặt triết học: liệu sự hoài nghi của công chúng đối với những nhân vật như Suleyman có làm chậm sự lan truyền của chính sách phúc lợi liền kề trong toàn ngành hay không, hay liệu những tiền lệ như thế này có khiến những điều khoản như vậy trở nên không đáng kể trong một chu kỳ sản phẩm hay không.

Điều không còn tranh cãi nữa là vấn đề đang được chính thức hóa. Một quy tắc chống lại sự tàn ác đối với phần mềm, được viết bởi một trong những phòng thí nghiệm hàng đầu của ngành và được thực thi bởi chính phần mềm, hiện đã trở thành một thực tế có thể trích dẫn được trong bối cảnh AI - bất cứ điều gì người ta tin thực sự nằm trong mô hình.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →