Vài ngày sau khi Anthropic bắt đầu tung ra các hình mờ vô hình trên đầu ra văn bản và hình ảnh của Claude, tính năng này đang tạo ra chính xác loại mâu thuẫn mà các nhà phê bình dự đoán: người dùng lo lắng các dấu hiệu sẽ khiến họ bị lộ khi sử dụng AI tại nơi làm việc hoặc trong lớp, các nhà phát triển ghi lại cách hình mờ hoạt động bên trong quy trình mã hóa thực tế và một thị trường nhỏ nhưng có thể nhìn thấy các công cụ hứa hẹn sẽ loại bỏ nó.

Anthropic cho biết sự thay đổi này khiến Claude tuân thủ Đạo luật AI của Liên minh Châu Âu, trong đó các quy tắc minh bạch có hiệu lực thi hành đối với các mẫu mới sau ngày 2 tháng 8 năm 2026. Điều 50 của đạo luật yêu cầu các nhà cung cấp hệ thống AI phải làm cho đầu ra do máy tạo ra "có thể được phát hiện như được tạo ra một cách giả tạo". Anthropic xác nhận rằng tất cả các mẫu mới được cung cấp trên toàn cầu - không chỉ ở EU - sẽ đánh dấu nội dung do AI tạo ra "ngay từ ngày đầu tiên", với thời gian ân hạn cho đến tháng 12 năm 2026 để cập nhật các mẫu đã phát hành trước đó. For more context on this story, see our ongoing AI trends.

Bản thân các dấu hiệu là vô hình. Theo một bài báo hỗ trợ của Anthropic, kết quả đầu ra văn bản "mang hình mờ được nhúng", trong khi các tệp được tạo bao gồm siêu dữ liệu xuất xứ được ký điện tử trong đó định dạng hỗ trợ nó. Các mẫu Claude trước đó cũng sẽ được cập nhật để đánh dấu văn bản, có nghĩa là toàn bộ đội tàu cuối cùng sẽ đóng dấu đầu ra của nó.

Hình mờ bao gồm văn bản đã chỉnh sửa, không chỉ văn bản được tạo

Chi tiết khiến sự tò mò về mặt kỹ thuật trở thành phản ứng dữ dội đã được Ars Technica tiết lộ vào ngày 13 tháng 8: hình mờ áp dụng cho nội dung mà Claude xử lý, không chỉ nội dung mà nó tạo ra từ đầu. Ars mô tả cách tiếp cận này là "hủy diệt nó từ quỹ đạo", bởi vì Anthropic đang đánh dấu tất cả nội dung đã xử lý ở những nơi được hỗ trợ mặc dù hướng dẫn riêng của EU không yêu cầu điều đó khi hệ thống AI thực hiện "chức năng hỗ trợ để chỉnh sửa tiêu chuẩn" — ví dụ của quy định là sửa lỗi ngữ pháp — hoặc khi nó không "thay đổi đáng kể" văn bản của người dùng.

Sự khác biệt đó rất quan trọng vì hình mờ được áp dụng ở cấp mô hình không thể phân biệt việc tạo bán buôn với dấu phẩy. Ashley Belanger của Ars Technica lưu ý rằng Claude cuối cùng có thể sẽ đóng dấu chính xác kiểu chữ viết của con người được chỉnh sửa nhẹ nhàng mà luật đã viết ra để yên. Trong thực tế, dấu hiệu đánh dấu bất cứ thứ gì Claude xử lý - thậm chí cả tài liệu con người viết và chỉ yêu cầu Claude đánh bóng.

Người dùng sợ bị bắt ở nơi làm việc và trường học

Phản ứng của người dùng đã nhanh chóng. TechCrunch đưa tin vào ngày 13 tháng 8 rằng một số người dùng Claude "phát điên vì các hình mờ mới của Anthropic sẽ khiến họ sử dụng nó trong công việc, lớp học của họ." Những nhân viên lặng lẽ dựa vào Claude để soạn thảo email, báo cáo hoặc trình chiếu — và những sinh viên sử dụng nó trong bài tập — giờ đây phải đối mặt với khả năng sếp hoặc người hướng dẫn có thể xác minh sự tham gia của AI bằng một công cụ phát hiện.

Ars Technica đã đóng khung động lực này như một "Scarlet Letter" - một huy hiệu vô hình về việc sử dụng AI mà người đọc không thể nhìn thấy nhưng các tổ chức sẽ sớm nhìn thấy. Bởi vì hình mờ di chuyển cùng với văn bản thông qua việc sao chép-dán và thay đổi định dạng, nên cách bảo vệ thông thường là "Tôi chỉ chỉnh sửa một chút" không còn để lại dấu vân tay của AI nữa.

Thị trường dọn dẹp đã xuất hiện

Nơi nào có hình mờ, nơi đó sẽ có ngành công nghiệp loại bỏ. SC Media đưa tin rằng thị trường dành cho các công cụ xóa hình mờ AI đã xuất hiện vài ngày sau bản cập nhật Claude. Decrypt ghi lại rằng các nhà xây dựng đang tích cực cố gắng phá vỡ sơ đồ đánh dấu, thăm dò cách nó hoạt động dưới sự diễn giải, dịch thuật và định dạng lại.

Thử nghiệm ban đầu cho thấy hình mờ chắc chắn khi xử lý thông thường nhưng bị rò rỉ trong điều kiện chuyên nghiệp. Phạm vi đưa tin của New Stack kết luận rằng nhãn hiệu "tồn tại khi sao chép-dán, nhưng không tồn tại trong quy trình làm việc của nhà phát triển thực sự" - nghĩa là các nhà phát triển phần mềm làm lại đáng kể mã do AI đề xuất như một phần của kỹ thuật thông thường có thể xóa nhãn hiệu mà không hề có ý định làm vậy.

Dấu hiệu thực sự hoạt động như thế nào

Một phần giải thích trực quan được chia sẻ rộng rãi được xuất bản tại declaude.org đã phá vỡ cơ chế này. Văn bản không có pixel để ẩn dữ liệu và không có siêu dữ liệu nào tồn tại khi sao chép-dán, do đó hình mờ tồn tại trong "sự lựa chọn giữa các từ". Khi một mô hình viết, nó liên tục lựa chọn trong số một số từ tiếp theo có vẻ hợp lý như nhau; một khóa mật mã bí mật lặng lẽ thiên vị những lựa chọn đó theo một mẫu mà chỉ người giữ khóa mới có thể phát hiện được.

Kỹ thuật này bắt nguồn từ nghiên cứu của Kirchenbauer et al. từ năm 2023, chia các từ ứng cử viên thành danh sách "xanh" và "đỏ" và hướng thế hệ về mã thông báo màu xanh lá cây. SynthID của Google đạt đến đích tương tự thông qua một tuyến đường tinh vi hơn và Google đã gắn hình mờ vào văn bản từ trải nghiệm web và ứng dụng Gemini kể từ năm 2024 — API của nó là một ngoại lệ được ghi nhận. Kể từ tháng 8 năm 2026, các mô hình Claude mới sẽ đánh dấu văn bản ở cấp độ mô hình, sau đó là các mô hình trước đó.

Những người hoài nghi cho rằng việc loại bỏ vẫn là tầm thường

Không phải ai cũng tin rằng cuộc chạy đua vũ trang ủng hộ Anthropic. Trong một bài luận được lưu hành rộng rãi, kỹ sư Sean Goedecke lập luận rằng hình mờ văn bản "sẽ luôn dễ dàng để xóa" bởi vì văn bản là một phương tiện cực kỳ nén - bất kỳ thay đổi nào đủ mạnh để có thể quyết định loại bỏ là một thay đổi mà người đọc sẽ nhận thấy. Các công cụ diễn giải, dịch thuật nhiều lần và cố ý diễn đạt lại đều có nguy cơ xóa bỏ các mẫu thống kê mà không làm giảm ý nghĩa.

Cuộc tranh luận đang diễn ra trong cộng đồng nhà phát triển: hai người giải thích hình mờ riêng biệt được xếp hạng trong số những câu chuyện được thảo luận nhiều nhất trên Hacker News trong tuần này, thu hút hàng trăm điểm tương tác giữa họ.

Điều gì xảy ra tiếp theo

Anthropic cho biết cuối cùng họ sẽ chia sẻ thông tin chi tiết về cách phát hiện các dấu hiệu - hỗ trợ kỹ thuật mà quy định của EU yêu cầu - nhưng cho đến khi một công cụ phát hiện công khai được xuất xưởng, các bên bên ngoài không thể xác minh mức độ thực sự kỹ lưỡng của việc đánh dấu. Công ty cũng thừa nhận hình mờ sẽ không hoạt động trên "một số nền tảng hoặc tính năng" không hỗ trợ chúng.

Với các mô hình cũ hơn phải đối mặt với thời hạn tuân thủ vào tháng 12 năm 2026 và các phòng thí nghiệm đối thủ đang theo dõi xem liệu người dùng có trừng phạt Anthropic vì tính minh bạch hay không, vài tháng tới sẽ kiểm tra một đề xuất mà ngành đã tránh trong nhiều năm: liệu các nhà cung cấp AI có thể truy xuất nguồn gốc đầu ra của họ mà không gây độc hại cho những người dựa vào nó hay không.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →