Một nghiên cứu mới của các nhà khoa học máy tính MIT được công bố trên tạp chí Nature Communications hôm thứ Ba đưa ra một phát hiện có thể định hình lại cuộc tranh luận về bản quyền AI: khi các mô hình phổ biến được đào tạo trên nhiều dữ liệu hơn, kết quả đầu ra của chúng ngày càng không thể truy ngược lại bất kỳ phần tài liệu đào tạo cụ thể nào. Các nhà nghiên cứu gọi hiện tượng này là "phân rã thuộc tính". Đối với độc giả theo dõi thế giới chuyển động nhanh chóng của AI sáng tạo, bài báo này là một trong những kết quả nghiên cứu mang tính hệ quả hơn được AI Buzz Wire đưa ra trong tuần này.

Bài báo có tiêu đề "Đầu ra của các mô hình khuếch tán sáng tạo thường không thể phân bổ được" của tác giả Zheng Dai và David K. Gifford, cả hai đều liên kết với Phòng thí nghiệm khoa học máy tính và trí tuệ nhân tạo của MIT (CSAIL). Câu hỏi trọng tâm của họ rất đơn giản: khi một mô hình tổng quát tạo ra một hình ảnh, bạn có thể xác định được một mục cụ thể trong dữ liệu huấn luyện chịu trách nhiệm cho kết quả đầu ra đó không?

Những gì các nhà nghiên cứu tìm thấy

Câu trả lời ngày càng là không. Các nhà nghiên cứu cho thấy rằng phân bổ - được định nghĩa là nhiệm vụ xác định vị trí một phần dữ liệu đào tạo có thể chịu trách nhiệm cho một mẫu được tạo - "có thể trở nên bất khả thi nếu một mô hình được đào tạo trên một kho dữ liệu đủ lớn."

Các tác giả viết: “Chúng tôi nhận thấy rằng một mô hình càng được đào tạo dựa trên nhiều dữ liệu thì các mẫu được tạo ra của nó càng ít có khả năng quy kết hơn, một hiện tượng mà từ đó chúng tôi gọi là phân rã thuộc tính”.

Để kiểm tra điều này, nhóm đã phát triển một phương pháp "cắt bỏ" cho phép loại bỏ các ví dụ đào tạo cụ thể khỏi mô hình đã được đào tạo mà không cần đào tạo lại tốn kém. Sau đó, họ tiến hành các thử nghiệm giả định trên quy mô lớn: mô hình sẽ tạo ra điều gì nếu một hình ảnh cụ thể hoặc toàn bộ tác phẩm của người sáng tạo chưa bao giờ có trong tập huấn luyện?

Trong một số kết quả nổi bật nhất của nghiên cứu, các nhà nghiên cứu phát hiện ra rằng đối với các mô hình được đào tạo trên bộ dữ liệu đủ lớn, họ có thể loại bỏ bức Mona Lisa - hoặc thậm chí toàn bộ tác phẩm của Leonardo da Vinci - và mô hình vẫn có thể tái tạo hình ảnh hoặc phong cách nghệ thuật. Không có mục đào tạo nào chịu trách nhiệm về kết quả đầu ra.

Tại sao việc kiện tụng về bản quyền lại quan trọng

Những phát hiện này nằm giữa một chiến trường pháp lý đang sôi động. Các mô hình Khuếch tán như Midjourney và Stable Diffusion đã thu hút các vụ kiện từ các nghệ sĩ, những người cho rằng bản sao tác phẩm của họ trong dữ liệu đào tạo cho phép hệ thống AI tái tạo đầu ra và phong cách của chúng.

Trong một vụ kiện bản quyền đang diễn ra từ năm 2023, Andersen et al. v. Stability AI Ltd., các nguyên đơn đã cố gắng buộc Midjourney tiết lộ các bộ dữ liệu được sử dụng để đào tạo các mô hình của mình. Họ cáo buộc Midjourney đã xây dựng các bộ đào tạo của mình "bằng cách loại bỏ các hình ảnh liên quan đến tên của các nghệ sĩ cụ thể nhằm mục đích rõ ràng là cho phép mô hình của nó bắt chước nội dung biểu cảm của những nghệ sĩ đó."

Nghiên cứu của MIT gợi ý rằng việc thiết lập các liên kết nhân quả như vậy về mặt kỹ thuật có thể là không thể ở quy mô lớn. Như The Register, tờ báo đầu tiên báo cáo chi tiết về nghiên cứu, đã lưu ý, nghiên cứu này có vẻ sẽ khiến việc điều chỉnh AI trở nên khó khăn hơn thay vì dễ dàng hơn - trái ngược với những gì các tác giả hy vọng khi họ bắt đầu công việc.

Câu hỏi về sử dụng hợp lý

Trong thông cáo báo chí của MIT, Gifford lập luận rằng những phát hiện này có tác dụng theo cả hai hướng. Nếu kết quả đầu ra được tạo ra không liên quan gì đến bất kỳ phần dữ liệu đào tạo riêng lẻ nào, thì các mô hình có thể thực sự sáng tạo thay vì chỉ là máy sao chép.

Gifford nói: “Điều đó đặt ra câu hỏi về việc sử dụng hợp lý, về việc liệu bản thân các kết quả đầu ra có được giữ bản quyền như tác phẩm mới hay không và về cách các tác giả được bồi thường khi những gì đưa ra từ một mô hình không liên quan đến bất kỳ thứ gì trên internet”.

Ý nghĩa của nó còn mở rộng ra ngoài các trình tạo hình ảnh. Các mô hình khuếch tán đã trở thành kiến ​​trúc chủ đạo để tạo ra phương tiện nghe nhìn và ngày càng được sử dụng nhiều trong các ứng dụng khoa học, bao gồm mô hình cấu trúc protein và khám phá trị liệu. Các công cụ phân bổ cũng đã được đề xuất để loại bỏ máy, phát hiện ngộ độc dữ liệu, khả năng diễn giải mô hình, kiểm tra tính công bằng và tuân thủ quyền riêng tư.

Cảnh báo cho các công ty khởi nghiệp phân bổ

Nghiên cứu này cũng đưa ra lời cảnh báo đối với ngành công nghiệp đang phát triển của các công cụ xác minh nội dung và xuất xứ AI. Các nhà nghiên cứu nhận thấy rằng phân bổ dựa trên sự tương đồng - kết quả đầu ra được tạo ra với các hình ảnh đào tạo tương tự về mặt trực quan - tạo ra phân bổ sai trong chế độ dữ liệu đào tạo lớn.

Nói cách khác, một công cụ tuyên bố "hình ảnh AI này đến từ danh mục đầu tư của nghệ sĩ đó" có thể sai khi các người mẫu được đào tạo về hàng tỷ hình ảnh. Đối với các nền tảng, tòa án và cơ quan quản lý dựa vào phân bổ kỹ thuật để giải quyết tranh chấp về xuất xứ, kết quả của MIT cho thấy sự chắc chắn như vậy có thể nằm ngoài tầm với của các mô hình quy mô biên giới.

Điều gì xảy ra tiếp theo

Bài viết dự kiến sẽ được trích dẫn trong các cuộc tranh luận về chính sách và kiện tụng đang diễn ra, bao gồm các cuộc thảo luận xung quanh các yêu cầu về tính minh bạch của Đạo luật AI của EU và các đề xuất về hệ thống bồi thường cho nghệ sĩ. Nếu sự suy giảm phân bổ xảy ra đối với các mô hình sản xuất lớn nhất, thì các kế hoạch bồi thường dựa trên việc truy tìm kết quả đầu ra cho các tác phẩm cụ thể có thể cần phải được thiết kế lại xung quanh việc cấp phép tập thể thay vì theo dõi cấp độ hạng mục.

Nghiên cứu này cũng đưa ra một quan điểm tinh tế đối với các nhà phát triển AI: tính không thể phân bổ thực sự có thể củng cố các lập luận về sử dụng hợp lý trong việc đào tạo về dữ liệu có bản quyền, đồng thời làm suy yếu khả năng của các nghệ sĩ trong việc chứng minh tác hại cụ thể từ các kết quả đầu ra riêng lẻ. Cả hai bên trong cuộc chiến bản quyền sẽ tìm thấy thứ gì đó để sử dụng trong dữ liệu.

Đi trước AI

Để biết thêm các nghiên cứu và phân tích đột phá về AI, hãy truy cập AI Buzz Wire để biết tin tức hàng ngày về ngành AI.

Đọc thêm tin tức về AI →