มหาวิทยาลัยออกซ์ฟอร์ดอนุญาตให้ OpenAI ฝึกอบรมโมเดล AI บนข้อความทางประวัติศาสตร์จากห้องสมุด Bodleian โดยใช้สื่อดิจิทัลเพื่อ "เติมชุดการฝึกอบรม OpenAI" ตามเอกสารภายในที่รายงานโดย The Guardian เมื่อวันเสาร์ ซึ่งเป็นวัตถุประสงค์ที่ไม่เคยมีการกล่าวถึงเมื่อมีการประกาศความร่วมมือต่อสาธารณะ

อ็อกซ์ฟอร์ดเปิดเผยความร่วมมือในเดือนมีนาคม 2568 ในรูปแบบโครงการดิจิทัล โดยกล่าวว่าการใช้ซอฟต์แวร์ OpenAI เพื่อสแกนข้อความจากห้องสมุดที่มีชื่อเสียงที่สุดแห่งหนึ่งของโลกจะทำให้เนื้อหาดังกล่าวเข้าถึงได้อย่างกว้างขวางมากขึ้นสำหรับนักศึกษาและนักวิจัย สิ่งที่ประกาศไม่ได้ระบุไว้ก็คือ เนื้อหาดังกล่าวจะสนับสนุนการฝึกอบรมโมเดลเชิงพาณิชย์ของ OpenAI เอกสารภายในที่ได้รับการตรวจสอบโดย Guardian ทำให้วัตถุประสงค์ดังกล่าวชัดเจน ถือเป็นตัวอย่างที่ชัดเจนที่สุดแห่งหนึ่งในปัจจุบันของสถาบันวัฒนธรรมอันทรงเกียรติที่จัดหา [วัตถุดิบสำหรับอุตสาหกรรม AI] (https://aibuzzwire.news) อย่างเงียบๆ

ความร่วมมือโดยมีวัตถุประสงค์ที่ไม่ได้ระบุไว้

รายละเอียดของข้อตกลงดังกล่าวเกิดขึ้นผ่านการร้องขอข้อมูลอย่างเสรี ซึ่งทำให้รายงานการประชุมของมหาวิทยาลัยบันทึกข้อกังวลของเจ้าหน้าที่ ซึ่งรวมถึงสมาชิกของคณะกรรมการกำกับดูแลของ Bodleian เกี่ยวกับความเสี่ยงด้านชื่อเสียงในการเป็นพันธมิตรกับบริษัทที่อยู่เบื้องหลัง ChatGPT เจ้าหน้าที่ยังกล่าวถึงผลกระทบจากข้อตกลงกับบริษัทเทคโนโลยีที่ใช้พลังงานสูงต่อพันธสัญญาด้านสิ่งแวดล้อมของมหาวิทยาลัย

โฆษกของ OpenAI ปกป้องโครงการนี้ โดยกล่าวว่าบริษัท "ภูมิใจ" ที่ทำให้แน่ใจว่า "โมเดล AI ในปัจจุบันจะรักษาความรู้ทางประวัติศาสตร์ของโลกไว้สำหรับอนาคต" “ด้วยผู้คนมากกว่าพันล้านคนที่ใช้เทคโนโลยีนี้ในชีวิตประจำวัน มันจึงเป็นสิ่งสำคัญที่มันสะท้อนถึงวัฒนธรรม ประวัติศาสตร์ และมุมมองที่แตกต่างกัน” โฆษกกล่าวเสริม

จากเพลงบัลลาดของทิวดอร์สู่วิทยานิพนธ์ระดับปริญญาเอก

ขนาดของการแปลงเป็นดิจิทัลมีความสำคัญมาก ภายในเดือนมิถุนายน พ.ศ. 2568 มีการแชร์ภาพที่สแกนจากวิทยานิพนธ์ทางประวัติศาสตร์จำนวน 125,000 ภาพกับ OpenAI จากคอลเลกชัน Bodleian รวมถึงวิทยานิพนธ์ระดับปริญญาเอกจากมหาวิทยาลัยในยุโรปและอเมริกาที่เขียนขึ้นในศตวรรษที่ 19 และ 20 เนื้อหาอื่นๆ ที่ถูกสแกน ได้แก่ คอลเลกชันหายากของ "เพลงบัลลาดข้างถนน" ในศตวรรษที่ 16 จำนวน 10,000 ชุด ซึ่งเป็นเนื้อเพลงและโน้ตดนตรีที่เคยเผยแพร่ตามมุมถนนทิวดอร์

ไม่มีสิ่งใดเป็นความลับในความหมายทั่วไป การถือครองทางประวัติศาสตร์ของ Bodleian ส่วนใหญ่เป็นผลงานสาธารณสมบัติ และกฎหมายลิขสิทธิ์ได้วางข้อจำกัดบางประการเกี่ยวกับรูปแบบการฝึกอบรมเกี่ยวกับข้อความที่เก่า แต่ความแตกต่างระหว่างการเปลี่ยนห้องสมุดให้เป็นดิจิทัลสำหรับนักวิชาการและการเติมชุดฝึกอบรมเชิงพาณิชย์ ถือเป็นความแตกต่างที่สถาบันต่างๆ ในอดีตคาดหวังให้พูดออกมาดังๆ อ็อกซ์ฟอร์ดไม่ได้ทำ และการละเว้นมีความสำคัญต่อสิ่งที่พูดเกี่ยวกับสิทธิทางกฎหมายน้อยกว่าสิ่งที่พูดเกี่ยวกับความโปร่งใสระหว่างมหาวิทยาลัยและชุมชนของตนเอง

ไลบรารี่เป็นขอบเขตข้อมูลใหม่

ความเร่งรีบในการหาชั้นวางห้องสมุดเป็นตัวขับเคลื่อนทางเศรษฐกิจง่ายๆ กล่าวคือ ข้อมูลที่เป็นประโยชน์ในเว็บแบบเปิดกำลังจะหมดลง เนื่องจากเว็บไซต์ที่ถูกคัดลอกมาเต็มไปด้วยเนื้อหาที่สร้างโดย AI การฝึกอบรมเกี่ยวกับเนื้อหานั้นจึงวนเวียนและเสื่อมโทรมลง และนักพัฒนาได้หันมาใช้คอลเลกชั่นหนังสือทางกายภาพซึ่งมักจะอิงประวัติศาสตร์เป็นแหล่งที่มาของข้อความสดใหม่ที่เขียนโดยมนุษย์

อาการที่เห็นได้ตามท้องถนน เดอะ การ์เดียน รายงานว่าผู้จำหน่ายหนังสือมือสองได้เห็นคำสั่งซื้อหนังสือที่ไม่ชัดเจนเป็นจำนวนมาก เช่น คู่มืออุปกรณ์การเกษตรในแอฟริกาในศตวรรษที่ 18 และชีวประวัติของคนขับรถในทศวรรษปี 1950 เนื่องจากหนังสือดังกล่าวไม่น่าจะมีอยู่ในรูปแบบดิจิทัลทุกที่ทางออนไลน์ ผู้จำหน่ายหนังสือคาดการณ์ว่าการซื้อดังกล่าวเป็นข้อมูลใหม่สำหรับโมเดล AI รุ่นต่อไป

OpenAI ได้ดำเนินการตามแนวทางเดียวกันในสถาบันการศึกษาและสถาบันวัฒนธรรม บริษัทได้ทำข้อตกลงกับห้องสมุดสาธารณะบอสตัน, คาลเทค, เอ็มไอที และมหาวิทยาลัยมิชิแกน ภายใต้โครงการที่เรียกว่า NextGenAI โดยมีอ็อกซ์ฟอร์ดเป็นสมาชิกโครงการในสหราชอาณาจักรเพียงคนเดียว Bodleian ซึ่งเป็นห้องสมุดที่เก่าแก่ที่สุดแห่งหนึ่งในยุโรปซึ่งมีคอลเลคชันต่างๆ ที่มีอายุนับพันปี ถือเป็นห้องสมุดที่มีเรื่องราวมากที่สุด

สถาบันวัฒนธรรมมีความหมายอย่างไร

เรื่องราวของอ็อกซ์ฟอร์ดมีแนวโน้มที่จะทำให้การถกเถียงที่เกิดขึ้นแล้วในพิพิธภัณฑ์ หอจดหมายเหตุ และห้องสมุดทั่วโลกรุนแรงขึ้น: เมื่อบริษัทเทคโนโลยีเสนอให้แปลงคอลเลกชั่นดิจิทัลให้ฟรี จริงๆ แล้วมีอะไรแลกเปลี่ยนกัน การแปลงเป็นดิจิทัลนำมาซึ่งประโยชน์สาธารณะอย่างแท้จริง — การเข้าถึง การอนุรักษ์ ความสามารถในการค้นหา แต่เอกสารของ Oxford แนะนำว่าค่าจะไหลไปทั้งสองทาง และการใช้ชุดการฝึกอบรมนั้นมีความสำคัญต่อ OpenAI แม้ว่าจะไม่เพียงพอต่อการประกาศก็ตาม

สำหรับสถาบันที่เผชิญกับงบประมาณที่จำกัด สิ่งล่อใจนั้นเป็นสิ่งที่เข้าใจได้ นั่นคือ การแปลงเป็นดิจิทัลอย่างมืออาชีพมีราคาแพง และบริษัทอย่าง OpenAI ก็เสนอให้ดำเนินการดังกล่าวโดยไม่มีค่าใช้จ่าย สมาชิกคณะกรรมการกำกับดูแลของ Bodleian ที่กังวลเกี่ยวกับความเสี่ยงด้านชื่อเสียงดูเหมือนจะเข้าใจสิ่งที่เอกสาร FOI ยืนยันในภายหลังว่าแบรนด์ของมหาวิทยาลัยให้ยืมความชอบธรรมในความพยายามในการรวบรวมข้อมูล ไม่ว่านั่นจะเป็นจุดประสงค์หรือไม่ก็ตาม

คำถามคือว่าสถาบันอื่น ๆ จะยืนกรานในมาตราความโปร่งใสในการเป็นหุ้นส่วนด้าน AI หรือไม่: การเปิดเผยอย่างชัดเจนเกี่ยวกับการใช้การฝึกอบรม การเลือกไม่ใช้เนื้อหาที่ละเอียดอ่อน และการรายงานต่อสาธารณะเกี่ยวกับสิ่งที่ถูกแบ่งปันและเหตุผล คอลเลกชันที่ยอดเยี่ยมของโลกจะกลายเป็นข้อมูลการฝึกอบรมต่อไป จนกว่าจะเป็นเช่นนั้น - โครงการดิจิทัลอย่างเงียบ ๆ ทีละโครงการ

---

ก้าวนำหน้า AI

การต่อสู้เพื่อแย่งชิงข้อมูลการฝึกอบรม AI กำลังพลิกโฉมอุตสาหกรรมไปไกลกว่าเทคโนโลยี รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →