John Schulman ผู้ร่วมก่อตั้ง OpenAI ซึ่งปัจจุบันดำรงตำแหน่งหัวหน้านักวิทยาศาสตร์ของ Thinking Machines กล่าวว่าเขาคาดหวังการพัฒนาตนเองแบบเรียกซ้ำ — ระบบ AI จะเร่งการพัฒนาของตัวเอง — ในเวลาประมาณสามถึงสี่ปี ซึ่งเป็นไทม์ไลน์ที่ทำให้เขาเป็นหนึ่งในนักพยากรณ์ที่ก้าวร้าวมากขึ้นในสาขานี้ Schulman ให้การประมาณการในระหว่างตอนโต๊ะกลมของ Dwarkesh Podcast ที่เผยแพร่เมื่อวันศุกร์ ซึ่งนักวิจัยจากห้องปฏิบัติการชายแดนสามคนอภิปรายอย่างเปิดเผยว่าอุตสาหกรรมนี้อยู่ใกล้เพดานแค่ไหน

บทสนทนาดังกล่าวนำเสนอมุมมองที่ไม่ค่อยมีใครระวังว่านักวิจัยใกล้ชายแดนกำลังคิดเกี่ยวกับความคืบหน้าอย่างไร โดยมาถึงท่ามกลางสัปดาห์ที่มีเสียงดังซึ่ง CEO ของ Nvidia Jensen Huang ประกาศว่า "AGI มาถึงแล้ว" และกลุ่มผู้ได้รับรางวัล Fields 25 คนเตือนว่าการไล่ตามเกณฑ์มาตรฐาน AI กำลังสร้างความเสียหายให้กับคณิตศาสตร์ สำหรับผู้อ่านที่ติดตาม การพัฒนา AI ล่าสุด ตอนนี้ถือเป็นข้อโต้แย้งที่มีประโยชน์ คนเหล่านี้คือคนที่สร้างระบบ และพวกเขาไม่เห็นด้วยอย่างยิ่ง

ใครอยู่โต๊ะ

พิธีกร Dwarkesh Patel กล่าวว่าเขารวบรวมแผงเนื่องจากแขกทำงานในสิ่งที่เขาเรียกว่า "ห้องทดลองและบริษัทที่ค่อนข้างเปิดกว้าง" ซึ่งหมายความว่าพวกเขาสามารถพูดในบันทึกได้ ผู้ที่จะเข้าร่วมกับ Schulman ได้แก่ Beren Millidge ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ Zyphra สตาร์ทอัพที่พัฒนาโมเดลโอเพ่นซอร์ส และ Charlie O'Neill หัวหน้าฝ่ายฝึกอบรมโมเดลที่ Baseten

ข้อมูลประจำตัวของชูลมานทำให้ไทม์ไลน์ของเขามีน้ำหนักเป็นพิเศษ เขาเป็นผู้ร่วมก่อตั้ง OpenAI และเป็นผู้นำการเรียนรู้แบบเสริมกำลังจากการวิจัยผลตอบรับของมนุษย์ซึ่งผลิตเทคนิคเบื้องหลัง ChatGPT ก่อนที่จะย้ายไปทำงานที่ Thinking Machines ซึ่งปัจจุบันเขาดำรงตำแหน่งหัวหน้านักวิทยาศาสตร์

กรณีต่อต้านภาวะเอกฐาน คนงานเหล็ก

Patel เปิดประเด็นด้วยคำถามที่ตรงประเด็น: หากปี 2036 มาถึงโดยไม่มีระบบอัจฉริยะนับพันล้านระบบที่เปลี่ยนแปลงโลก อะไรจะเป็นเหตุผลทางเทคนิค มิลลิดจ์เสนอกรณีที่ชัดเจนที่สุดสำหรับความสงสัย โดยอธิบายถึงสิ่งที่เขาเรียกว่ารูปแบบที่เกือบจะขัดแย้งกันของโมราเวค ซึ่งแบบจำลองนั้นเหนือกว่าเกณฑ์มาตรฐานใดก็ตามที่นักวิจัยวางไว้ตรงหน้า แต่ผลกระทบในโลกแห่งความเป็นจริงกลับทำให้ผิดหวัง

“ยังมีช่องว่างระหว่างการจำลองสู่จริงอย่างต่อเนื่อง ซึ่งขัดขวางทุกสิ่งทุกอย่าง” มิลลิดจ์กล่าว โดยอธิบายถึงโลกที่ AI กลายเป็น “เก่งมากในทุกสิ่งที่ผู้คนนำมาสร้างมาตรฐาน” โดยไม่ต้องสรุปเพิ่มเติม เขาเสริมว่าเขาคิดว่าผลลัพธ์นี้ไม่น่าเป็นไปได้ โดยชี้ให้เห็นหลักฐานที่แสดงว่าการเรียนรู้แบบเสริมกำลังได้แพร่หลายในทางปฏิบัติแล้ว

ชูลมานเห็นพ้องต้องกันว่าความก้าวหน้าไม่ได้เกิดขึ้นโดยอัตโนมัติ เขากล่าวกันว่ามนุษย์มีข้อได้เปรียบเหนือโมเดลในปัจจุบันอย่างแท้จริง และโมเดลใหม่แต่ละรุ่นก็ยังมีให้เห็นในบางพื้นที่ ขณะที่ยังคงมีปัญหาคอขวดในบางพื้นที่ ซึ่งเป็นรูปแบบที่กำหนดวงจรผลิตภัณฑ์หลายรอบล่าสุด

ลำดับเวลาที่รวดเร็ว: สองปี, สามถึงสี่, ห้าถึงสิบ

เมื่อพาเทลกดตัวเลข แผงก็แยกออกจากกัน เมื่อถูกถามว่าเมื่อใดที่ AI จะเพิ่มผลิตภาพให้กับพนักงานปกขาวที่มีความสามารถเป็นสิบเท่า ในตอนแรก Schulman ปฏิเสธที่จะให้ตัวเลขเพียงตัวเลขเดียว จากนั้นจึงตอบว่า "ฉันจะบอกว่าสองปี" มิลลิดจ์กล่าวว่าเขาสามารถ "เห็นแบบนั้นจริงๆ" โดยอ้างว่าได้รับผลประโยชน์มากกว่า 10 เท่าสำหรับงานบางประเภท โอนีลเป็นคนหัวโบราณที่สุด โดยตอบว่า "5 ถึง 10 ปี"

จากนั้น Patel ก็ผลักดันต่อไปโดยระบุลักษณะสถานการณ์ว่า "โดยพื้นฐานแล้วเป็นเพียง ASI" คำตอบของ Schulman: "ฉันจะบอกว่า 3-4 ปี" และเสริมว่าการวิจัย AI อัตโนมัตินั้น "ไม่ใช่หนึ่งในสิ่งที่ยากที่สุดสำหรับ AI เพราะมันเกี่ยวข้องกับงานมากมาย" ที่เทคนิคปัจจุบันสามารถเข้าถึงได้แล้ว การแลกเปลี่ยนนี้มีความโดดเด่นจากการที่นักวิจัยคนอื่น ๆ ประเมินผลการประมาณค่ากลับคืนเพียงเล็กน้อย

วิธีการฝึกอบรมนักวิจัยอัตโนมัติอย่างแท้จริง

ส่วนใหญ่ของตอนนี้เกี่ยวข้องกับกลไกของสถานการณ์ที่ชูลมานกำหนดราคา เมื่อถามว่าระบบ AI ที่ทำให้การวิจัย AI เป็นแบบอัตโนมัติได้รับการฝึกอบรมอย่างไร ชูลแมนอธิบายว่า "การผสมผสานระหว่างการเรียนรู้จากผลตอบรับของมนุษย์เพื่อซึมซับรสนิยมของนักวิจัย และเพียงสร้างสภาพแวดล้อมการปฏิบัติจำนวนมากที่เกี่ยวข้องกับการทำวิจัยแบบหลายขั้นตอน"

คำตอบนั้นเชื่อมโยงกับทิศทางของเงินของอุตสาหกรรม ข้อตกลงที่เพิ่งเสร็จสิ้นของ Google สำหรับ Mechanize การเริ่มต้นที่สร้างสภาพแวดล้อมการทำงานจำลองสำหรับตัวแทนการฝึกอบรม สะท้อนให้เห็นอย่างชัดเจนว่าพื้นที่การฝึกอบรมที่ดีกว่า ไม่ใช่แค่โมเดลที่ใหญ่กว่า จะขับเคลื่อนความสามารถรอบต่อไป Schulman ยังระบุถึงปัญหาหลักๆ อีกด้วย นั่นคือ ฟังก์ชันการให้รางวัลที่สร้างจากข้อมูลธรรมชาตินั้นยากต่อการระบุ และสัญญาณผิวเผิน เช่น ผู้ใช้ยอมรับการแก้ไขโค้ดหรือไม่ อาจทำให้การฝึกอบรมเข้าใจผิดได้

การกลั่นเทียบกับการรวมศูนย์

การคาดการณ์ที่เป็นรูปธรรมที่สุดประการหนึ่งของชูลมานเกี่ยวข้องกับโครงสร้างอุตสาหกรรม “ผมคิดว่าการกลั่นคือสิ่งสำคัญในการต่อสู้กับกองกำลังรวมศูนย์” เขากล่าว โดยให้เหตุผลว่าความสามารถที่เรียนรู้ผ่านการเรียนรู้แบบเสริมกำลังสามารถถ่ายโอนไปยังโมเดลขนาดเล็กได้ค่อนข้างง่าย ซึ่งกระจายความสามารถที่อยู่ติดชายแดนไปไกลกว่าบริษัทเพียงไม่กี่แห่งที่สามารถรับการฝึกอบรมชายแดนได้

สำหรับคำถามเกี่ยวกับสิ่งที่เหลืออยู่สำหรับมนุษย์ ชูลมานก็ตอบคำถามอย่างเด็ดขาด “ผมจะบอกว่างานสุดท้ายของมนุษย์หรือบทบาทของมนุษย์ที่จะคงอยู่ยาวนานที่สุด คือการกำหนดเป้าหมายและตัดสินใจว่าเราต้องการอะไรจริงๆ” เขากล่าว เมื่อ Patel สรุปว่า "การจัดตำแหน่งเป็นงานสุดท้าย" Schulman เห็นด้วยว่า "การจัดตำแหน่งคือคำตอบ" ในขณะที่สังเกตว่ามันสลายตัวเป็นการหาวัตถุประสงค์ที่ถูกต้องแล้วจึงบรรลุผลสำเร็จจริงๆ

จุดที่ตอนนี้เหมาะกับการอภิปรายไทม์ไลน์

คำบรรยายของตอนนี้ - "เราไม่ได้อยู่ใกล้เพดาน" - รวบรวมอายุโดยรวม: นักวิจัยที่มองเห็นรันเวย์ที่สำคัญข้างหน้าแม้ว่าพวกเขาจะโต้แย้งว่าเส้นทางจะเป็นหลุมเป็นบ่อเพียงใด การอภิปรายครอบคลุมถึงสิ่งที่ขับเคลื่อนความก้าวหน้าของห้องปฏิบัติการของจีน การเรียนรู้เสริมขอบฟ้าระยะไกลสามารถดึงเอาสติปัญญาทั่วไปออกมาได้หรือไม่ และเหตุใด RL จึงเริ่มทำงานได้ดีเหมือนเดิม

การอภิปรายสาธารณะเกี่ยวกับไทม์ไลน์ได้ทวีความรุนแรงมากขึ้นในทุกฝ่ายในเดือนนี้ คำประกาศ "AGI มาถึงแล้ว" ของ Huang ทำให้เกิดความกังขาจากนักวิเคราะห์ที่อ่านว่าเป็นกรณีธุรกิจมากกว่าการกล่าวอ้างทางวิทยาศาสตร์ ในขณะที่ Sam Altman ซีอีโอของ OpenAI บอกกับพนักงานว่าบริษัทเปิดรับที่จะชะลอการพัฒนาที่ล้ำสมัย เนื่องจากความกังวลด้านความปลอดภัยเพิ่มมากขึ้น ตามรายงานของ Bloomberg กรอบเวลาสามถึงสี่ปีของ Schulman สำหรับการพัฒนาตนเองแบบเรียกซ้ำนั้นอยู่ระหว่างการตลาดและการเลื่อนการชำระหนี้ ซึ่งเป็นการประเมินการทำงานจากผู้ที่มีประวัติในการสร้างเทคนิคที่ขับเคลื่อนภาคสนามในปัจจุบัน

เขาจะพูดถูกหรือไม่นั้นขึ้นอยู่กับคำถามในวงรอบเท่านั้น: การเรียนรู้แบบเสริมกำลังยังคงมองข้ามสภาพแวดล้อมการฝึกอบรมหรือไม่ และช่องว่างระหว่างประสิทธิภาพมาตรฐานและมูลค่าทางเศรษฐกิจที่แท้จริงยังคงปิดอยู่หรือไม่

ก้าวนำหน้า AI

นักวิจัยชายแดนกำลังถกเถียงถึงขีดจำกัดของ AI ในที่สาธารณะ ติดตามเรื่องราวในขณะที่พัฒนา

อ่านข่าว AI เพิ่มเติมบน AI Buzz Wire