จะเกิดอะไรขึ้นเมื่อโมเดลภาษาขนาดใหญ่ไม่เคยเห็นเนื้อหาเกินเกรด 5 เลย ทีมนักวิจัยเจ็ดคนตอบคำถามนั้นตามตัวอักษร: พวกเขาสร้าง LittleLearner ซึ่งเป็น LLM พารามิเตอร์ 5 พันล้านพารามิเตอร์ที่ได้รับการฝึกฝนตั้งแต่ต้นบนคลังข้อมูลที่กรองตามหลักสูตรโรงเรียนประถมศึกษาของสหรัฐอเมริกา แล้วทดสอบว่ามีสิ่งใด เช่น พารามิเตอร์ที่มากขึ้น การฝึกหลังการฝึกอบรมที่มากขึ้น และการแจ้งเตือนที่ชาญฉลาดยิ่งขึ้น สามารถผลักดันแบบจำลองให้ก้าวข้ามสิ่งที่ข้อมูลการฝึกล่วงหน้าสอนได้หรือไม่ คำตอบที่พวกเขารายงานคือไม่

บทความเรื่อง "LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure" ถูกส่งไปยัง arXiv เมื่อวันที่ 13 สิงหาคมโดย Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell และ Wieland Brendel ภายในวันที่ 16 สิงหาคม หัวข้อดังกล่าวกลายเป็นหัวข้อสนทนาของ Hacker News ที่ได้รับความนิยมอย่างรวดเร็ว โดยมีผู้โหวตมากกว่า 200 คน ในขณะที่นักวิจัยและผู้ปฏิบัติงานต่างถกเถียงกันถึงความหมายของสมมติฐานที่ชื่นชอบของอุตสาหกรรม นั่นคือ การหลังการฝึกอบรมสามารถเสกความสามารถออกมาได้ นี่เป็นการทดลองที่ขัดแย้งและระมัดระวังซึ่งเราเฝ้าดูใน การรายงานข่าวการวิจัย AI อย่างแน่นอน

แซนด์บ็อกซ์ที่มีขอบเขตความรู้

LLM สมัยใหม่ได้รับการฝึกฝนในทุกสิ่ง ซึ่งทำให้แทบจะเป็นไปไม่ได้เลยที่จะบอกได้ว่าทักษะที่แสดงให้เห็นนั้นได้รับการเรียนรู้อย่างแท้จริงในระหว่างการฝึกอบรมหรือเพียงได้รับจากการแจ้งเตือนที่ถูกต้องเท่านั้น วิธีแก้ปัญหาของทีมคือจำกัดการกระจายการฝึกอบรมเอง เริ่มต้นจาก FineWeb-Edu พวกเขากลั่นคลังข้อมูลโทเค็นจำนวน 88 พันล้านโทเค็นที่เรียกว่า LittleCurriculum ผ่านขั้นตอนการกรองห้าขั้นตอนที่สอดคล้องกับมาตรฐาน Common Core สำหรับโรงเรียนอนุบาลจนถึงชั้นประถมศึกษาปีที่ 5 แนวคิด ข้อเท็จจริง และคำศัพท์ที่สอนเหนือชั้นประถมศึกษาปีที่ 5 ได้รับการยกเว้นอย่างชัดเจน

ในคลังข้อมูลนี้ พวกเขาฝึกโมเดลในสามระดับ (พารามิเตอร์ 0.6B, 1.3B และ 5B) ตั้งแต่เริ่มต้น โดยแต่ละระดับจัดส่งไปพร้อมกับโมเดลการควบคุมที่ตรงกันซึ่งฝึกฝนกับข้อมูลที่ไม่มีการกรองด้วยสถาปัตยกรรมและงบประมาณโทเค็นเดียวกัน ผลลัพธ์ที่ได้คือแบบจำลองที่คล่องแคล่วเพียงพอสำหรับการประเมินปลายเปิด คุณสามารถสนทนากับเวอร์ชัน 5B ที่โฮสต์อยู่ในเบราว์เซอร์ แต่ก็มีขอบเขตความรู้ที่ชัดเจนและตีความได้: หากไม่ได้อยู่ในหลักสูตรระดับประถมศึกษา โมเดลจะไม่เคยเห็นมัน

การกระตุ้น ไม่ใช่การได้มา

การค้นพบหลักนั้นตรงไปตรงมา: ชุดเครื่องมือมาตรฐานสำหรับการสร้างโมเดลอย่างชาญฉลาดยิ่งขึ้นได้ขยายสิ่งที่ LittleLearner รู้อยู่แล้ว แต่ไม่มีสิ่งใดที่จะปรับปรุงประสิทธิภาพนอกขอบเขตได้อย่างมีนัยสำคัญ

การปรับขนาด ปรับปรุงความแม่นยำภายในความรู้ที่ได้รับการควบคุมของโมเดล และขยายออกไปเล็กน้อยตามวิถีการเรียนรู้เดียวกัน แต่ช่วยแก้ปัญหาที่ต้องใช้ความสามารถนอกเหนือจากสื่อเกรด 5 ได้เพียงเล็กน้อย หลังการฝึกอบรม ด้วย GRPO ซึ่งเป็นวิธีการเสริมกำลังและการเรียนรู้ที่อยู่เบื้องหลังความนิยมของโมเดลการให้เหตุผล ซึ่งช่วยเพิ่มความสามารถ K-5 ในขอบเขตได้อย่างมาก แต่ล้มเหลวในการกู้คืนความสามารถที่อยู่นอกเหนือ K-5 แม้ว่าจะได้รับการฝึกโดยใช้ข้อมูลอยู่นอกขอบเขตก็ตาม และ การเรียนรู้ในบริบท ซึ่งเป็นความมหัศจรรย์ในชีวิตประจำวันของการเติมความรู้ลงในทันที ช่วยให้โมเดลใช้สิ่งที่มี แต่ไม่ได้ปลดล็อกเหตุผลใหม่เกินขอบเขต

กล่าวโดยย่อคือ ตัวกรองการฝึกล่วงหน้าจะกำหนดเพดานความสามารถที่มีประสิทธิผล ผู้เขียนวางกรอบผลลัพธ์ไว้เป็นหลักฐานสำหรับความแตกต่างที่สนามพร่าเลือนอยู่ตลอดเวลา: หลังการฝึกอบรมและการกระตุ้นเตือน; การฝึกอบรมล่วงหน้าจะได้รับ

การควบคุมที่สะอาด, จุดตรวจสาธารณะ

วิธีการคือสิ่งที่ทำให้คำกล่าวอ้างมีพลัง เนื่องจากโมเดล LittleLearner ทุกโมเดลมาพร้อมกับการควบคุมที่ไม่มีการกรองที่ตรงกัน — สถาปัตยกรรมเดียวกัน จำนวนโทเค็นเดียวกัน สูตรการฝึกอบรมเดียวกัน — ทีมจึงสามารถระบุถึงความแตกต่างทางพฤติกรรมใดๆ ก็ตามจากตัวกรองหลักสูตรเพียงอย่างเดียว ผู้เชี่ยวชาญด้านคณิตศาสตร์หลังการฝึกอบรมเกี่ยวกับเกณฑ์มาตรฐาน MathCAMPS ให้ผู้วิจัยให้คะแนนผลการเรียนตามเกรดของโรงเรียน โดยติดตามอย่างแน่ชัดว่าความสามารถในขอบเขตสิ้นสุดลงที่จุดใด และแตกต่างจากเอกสารชายแดนส่วนใหญ่ ทุกอย่างเป็นแบบสาธารณะ: คลังข้อมูล ฐานและจุดตรวจหลังการฝึกอบรมทั้งสามระดับบน HuggingFace และการสาธิตการสนทนาที่โฮสต์ ดังนั้นทีมอิสระจึงสามารถตรวจสอบขอบเขตได้ด้วยตนเอง

การเปิดกว้างดังกล่าวกำลังกระตุ้นให้เกิดการอภิปรายข่าวของแฮ็กเกอร์ ผู้แสดงความคิดเห็นได้ทดสอบพฤติกรรมของโมเดลที่โฮสต์อยู่ที่ขอบความรู้ — ไม่ว่าจะละเว้น เดา หรือหลอนเมื่อผ่านเกรด 5 — และโต้เถียงเรื่องความหมาย: บางคนอ่านผลลัพธ์ว่าเป็นข่าวร้ายสำหรับการให้เหตุผลแบบเกินจริง คนอื่นๆ ชี้ให้เห็นว่าข้อมูลการฝึกอบรมล่วงหน้าระดับเว็บมีมากกว่าแนวคิดของโรงเรียนประถมศึกษา ดังนั้นเพดานของแบบจำลองชายแดนจึงสูงขึ้นตามลำดับ ผู้เขียนรายงานเองก็ระมัดระวังในประเด็นนี้เช่นกัน การกล่าวอ้างของพวกเขาเกี่ยวกับสิ่งที่การแทรกแซงมาตรฐานไม่สามารถทำได้สำหรับแบบจำลองที่เป็นที่รู้จักและมีการศึกษาแบบควบคุม ไม่ใช่การคาดการณ์โดยตรงเกี่ยวกับห้องปฏิบัติการชายแดน

เหตุใดจึงมีความสำคัญนอกเหนือจากห้องเรียน

การทดลองนี้พูดโดยตรงกับการอภิปรายสดใน AI ห้องปฏิบัติการ AI ใช้จ่ายหลายพันล้านในแผนหลังการฝึกอบรมโดยมีพื้นฐานมาจากแนวคิดที่ว่าการเรียนรู้แบบเสริมกำลังสามารถผลักดันโมเดลพื้นฐานได้เกินกว่าความสามารถที่มีอยู่จริง LittleLearner แนะนำว่าผลประโยชน์เหล่านั้นส่วนใหญ่อาจอยู่ภายใน — และถูกจำกัดด้วย — สิ่งที่ข้อมูลการฝึกอบรมล่วงหน้าสนับสนุน นั่นเป็นข้อโต้แย้งในการดูแลจัดการข้อมูลให้มากขึ้น และสำหรับการปฏิบัติต่อข้ออ้างเกี่ยวกับความสามารถหลังการฝึกอบรม "ที่เกิดขึ้นใหม่" ด้วยความกังขา

การเผยแพร่นี้ยังเป็นเครื่องมือวิจัยที่แท้จริง ไม่ใช่แค่รายงานเท่านั้น ทีมงานเปิดตัว LittleCurriculum และจุดตรวจสอบโมเดลทั้งหมดอย่างเปิดเผย และหน้าโปรเจ็กต์จะร่างการทดลองที่แซนด์บ็อกซ์เปิดใช้งาน: RL สามารถสร้างความสามารถได้จริง ๆ แทนที่จะให้รางวัลหรือไม่ วิธีที่โมเดลสามารถเรียนรู้แนวคิดใหม่อย่างแท้จริง เช่น จำนวนลบเมื่อนำมาใช้ และเครื่องจักรและเด็กๆ ต้องการการสัมผัสที่คล้ายคลึงกัน หรือทำผิดพลาดที่คล้ายกันเมื่อเรียนรู้เศษส่วนหรือไม่

สำหรับสาขาที่ไม่ค่อยได้รับการควบคุมที่ชัดเจน โมเดลที่มีการศึกษาระบุไว้อย่างชัดเจนถือเป็นของขวัญที่หายาก และสำหรับคนอื่นๆ นี่เป็นสิ่งเตือนใจที่ควรค่าแก่การปักหมุดไว้บนโต๊ะ ไม่มีนางแบบหรือบุคคลใดสามารถหาเหตุผลจากสิ่งที่พวกเขาไม่เคยได้รับการสอนได้

ก้าวนำหน้า AI

ความครอบคลุมระดับ peer-review ของการวิจัยที่ปรับรูปแบบ AI จัดส่งทุกวัน คั่นหน้าศูนย์กลางของเราสำหรับ การพัฒนา AI ล่าสุด

อ่านข่าว AI เพิ่มเติม →