Đại học Oxford đã cho phép OpenAI đào tạo các mô hình AI của mình trên các văn bản lịch sử từ Thư viện Bodleian, với tài liệu số hóa được sử dụng để “đưa vào bộ đào tạo OpenAI”, theo các tài liệu nội bộ được The Guardian báo cáo hôm thứ Bảy – một mục đích chưa bao giờ được đề cập khi quan hệ đối tác được công bố công khai.
Oxford tiết lộ sự hợp tác vào tháng 3 năm 2025 dưới dạng một dự án số hóa, nói rằng việc sử dụng phần mềm OpenAI để quét văn bản từ một trong những thư viện nổi tiếng nhất thế giới sẽ giúp nội dung được phổ biến rộng rãi hơn cho sinh viên và nhà nghiên cứu. Điều mà thông báo không đề cập là tài liệu này sẽ phục vụ việc đào tạo các mô hình thương mại của OpenAI. Các tài liệu nội bộ được Guardian xem xét đã thể hiện rõ mục đích đó, đánh dấu một trong những ví dụ rõ ràng nhất cho đến nay về việc một tổ chức văn hóa uy tín đang âm thầm cung cấp nguyên liệu thô cho ngành AI.
Quan hệ đối tác với mục đích không rõ ràng
Thông tin chi tiết về thỏa thuận này xuất hiện thông qua yêu cầu tự do thông tin, trong đó có biên bản cuộc họp của trường đại học ghi lại mối lo ngại của nhân viên – bao gồm cả các thành viên của ủy ban quản trị của Bodleian – về rủi ro danh tiếng khi hợp tác với công ty đằng sau ChatGPT. Nhân viên cũng nêu lên ảnh hưởng của thỏa thuận với một công ty công nghệ sử dụng nhiều năng lượng đối với các cam kết về môi trường của trường đại học.
Người phát ngôn của OpenAI bảo vệ chương trình, nói rằng công ty “tự hào” đảm bảo “các mô hình AI ngày nay bảo tồn kiến thức lịch sử thế giới cho tương lai”. Người phát ngôn nói thêm: “Với hơn một tỷ người sử dụng công nghệ này trong cuộc sống hàng ngày, điều quan trọng là nó phản ánh các nền văn hóa, lịch sử và quan điểm khác nhau”.
Từ những bản ballad Tudor đến luận án tiến sĩ
Quy mô của số hóa là đáng kể. Đến tháng 6 năm 2025, 125.000 hình ảnh được quét từ các luận án lịch sử đã được chia sẻ với OpenAI từ bộ sưu tập Bodleian, bao gồm cả các luận án tiến sĩ từ các trường đại học châu Âu và Mỹ được viết vào thế kỷ 19 và 20. Các tài liệu khác được quét bao gồm một bộ sưu tập hiếm hoi gồm 10.000 "bản ballad rộng rãi" thế kỷ XVI - lời bài hát và nốt nhạc từng được lưu hành trên các góc phố Tudor.
Không có điều nào trong số đó là bí mật theo nghĩa thông thường; phần lớn tài sản lịch sử của Bodleian là các tác phẩm thuộc phạm vi công cộng và luật bản quyền đặt ra một số hạn chế đối với các mô hình đào tạo đối với các văn bản cũ. Nhưng sự khác biệt giữa số hóa một thư viện dành cho học giả và đưa vào một bộ đào tạo thương mại là loại khác biệt mà các tổ chức trước đây thường phải nêu rõ. Oxford thì không - và sự thiếu sót đó không quan trọng đối với những gì nó nói về quyền hợp pháp hơn là những gì nó nói về tính minh bạch giữa một trường đại học và cộng đồng của chính nó.
Thư viện là biên giới dữ liệu mới
Cơn sốt giá sách thư viện có một động cơ kinh tế đơn giản: web mở đang cạn kiệt dữ liệu hữu ích. Khi các trang web cóp nhặt trở nên bão hòa với tài liệu do AI tạo ra, việc đào tạo về nội dung đó trở nên tuần hoàn và xuống cấp, đồng thời các nhà phát triển đã chuyển sang các bộ sưu tập sách vật lý, thường là lịch sử, như một nguồn văn bản mới do con người viết.
Các triệu chứng có thể nhìn thấy trên đường cao tốc. The Guardian đưa tin rằng những người bán sách cũ đã nhận thấy rất nhiều đơn đặt hàng với những tựa sách ít người biết đến - hướng dẫn sử dụng nông cụ ở Châu Phi thế kỷ 18, tiểu sử của những người lái xe ô tô những năm 1950 - chính xác là vì những cuốn sách như vậy khó có thể tồn tại ở dạng số hóa ở bất kỳ đâu trên mạng. Các nhà bán sách suy đoán việc mua hàng đại diện cho dữ liệu mới cho thế hệ mô hình AI tiếp theo.
OpenAI đã theo đuổi cùng một chiến lược trên khắp các học viện và tổ chức văn hóa. Công ty đã đạt được thỏa thuận với Thư viện Công cộng Boston, Caltech, MIT và Đại học Michigan trong một dự án có tên NextGenAI, với Oxford là thành viên duy nhất ở Vương quốc Anh của dự án. Bodleian, một trong những thư viện lâu đời nhất ở châu Âu với bộ sưu tập kéo dài hàng thiên niên kỷ, là thư viện được bổ sung nhiều tầng nhất.
Ý nghĩa của nó đối với các tổ chức văn hóa
Tình tiết ở Oxford có thể sẽ làm sâu sắc thêm cuộc tranh luận đang diễn ra khắp các bảo tàng, cơ quan lưu trữ và thư viện trên toàn thế giới: khi một công ty công nghệ đề nghị số hóa một bộ sưu tập miễn phí, điều gì thực sự được trao đổi? Số hóa mang lại lợi ích công cộng thực sự - khả năng truy cập, bảo tồn, khả năng tìm kiếm. Nhưng các tài liệu của Oxford cho thấy giá trị chảy theo cả hai hướng và việc sử dụng tập huấn luyện là quan trọng đối với OpenAI ngay cả khi nó không đủ quan trọng để công bố.
Đối với các tổ chức phải đối mặt với ngân sách eo hẹp, sự cám dỗ là điều dễ hiểu: số hóa chuyên nghiệp rất tốn kém và các công ty như OpenAI đang đề nghị thực hiện việc đó miễn phí. Các thành viên ủy ban quản trị của Bodleian, những người lo lắng về rủi ro danh tiếng, dường như đã trực cảm được điều mà các tài liệu FOI sau đó đã xác nhận - rằng thương hiệu của trường đại học đang mang lại tính hợp pháp cho nỗ lực thu thập dữ liệu, cho dù đó có phải là mục đích hay không.
Câu hỏi bây giờ là liệu các tổ chức khác có nhấn mạnh đến các điều khoản minh bạch trong quan hệ đối tác AI của họ hay không: tiết lộ rõ ràng về việc sử dụng đào tạo, chọn không tham gia đối với tài liệu nhạy cảm và báo cáo công khai về những gì được chia sẻ và lý do. Cho đến khi họ làm được điều đó, các bộ sưu tập lớn của thế giới sẽ tiếp tục trở thành dữ liệu đào tạo — mỗi lần một dự án số hóa thầm lặng.
---
Đi trước AICuộc chiến về dữ liệu đào tạo AI đang định hình lại các ngành công nghiệp vượt xa công nghệ. Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →