โครงการโอเพ่นซอร์สใหม่กำลังดึงดูดความสนใจในการจัดการกับข้อจำกัดอันดื้อรั้นประการหนึ่งของการเรียนรู้ของเครื่อง: การสร้างแบบจำลองภาษาที่ไม่เคยหยุดเรียนรู้ โปรเจ็กต์นี้เรียกว่า mini-AGI โดยอธิบายตัวเองว่าเป็นการเรียนรู้อย่างต่อเนื่อง ซึ่งเป็นโมเดลภาษาระดับไบต์ที่ประกอบสถาปัตยกรรมของตัวเอง ฝึกฝนตั้งแต่เริ่มต้นบน GPU ตัวเดียวที่มี VRAM ขนาด 8GB และเรียนรู้ต่อไปจากทุกสิ่งที่อ่าน

โปรเจ็กต์นี้ปรากฏบน Hacker News ในช่วงสุดสัปดาห์ ซึ่งไต่ขึ้นสู่ระดับกว่าร้อยคะแนน และพื้นที่เก็บข้อมูลบน GitHub ได้รับการเผยแพร่ภายใต้ใบอนุญาต MIT จากข้อมูลของ README ของโปรเจ็กต์ เป้าหมายคือการแสดงให้เห็นว่าการเรียนรู้อย่างต่อเนื่องจากข้อมูลเพียงกระแสเดียว เป็นไปได้โดยไม่ลืมเรื่องร้ายแรง แม้แต่กับฮาร์ดแวร์ระดับผู้บริโภคทั่วไปก็ตาม For more context on this story, see our ongoing breaking AI news.

น้ำหนักบนดิสก์ ไม่ใช่ใน VRAM

เคล็ดลับสำคัญที่อยู่เบื้องหลัง mini-AGI คือแผนการจัดการหน่วยความจำที่แปลกใหม่ แทนที่จะเก็บพารามิเตอร์โมเดลทั้งหมดไว้ในหน่วยความจำ GPU ระบบจะจัดเก็บน้ำหนักเป็นไฟล์ธรรมดาบนดิสก์และเพจลงในกราฟิกการ์ดตามที่ต้องการ

ตัวเลือกการออกแบบนั้นมีผลกระทบที่สำคัญ: จำนวนพารามิเตอร์ของโมเดลถูกจำกัดด้วยพื้นที่ว่างในดิสก์ แทนที่จะเป็น VRAM README ระบุว่าโมเดลสามารถเพิ่มความสามารถใหม่ได้ในขณะที่ฝึกฝนเมื่อทำงานไม่เพียงพอ และลดความสามารถที่ไม่ต้องการอะไร การฝึกอบรมและการอนุมานดำเนินไปในเส้นทางโค้ดเดียวกันทุกประการ ดังนั้นจึงไม่มีระบบการปรับแต่งแบบแยกส่วนและไม่มีโมเดลพื้นฐานที่หยุดนิ่ง — ตามคำพูดของโปรเจ็กต์ การอ่านและการฝึกฝนนั้นเป็นเหตุการณ์เดียวกัน

ระบบกำหนดเป้าหมายไปที่พีซีหรือแล็ปท็อปที่มี GPU VRAM อย่างน้อย 8GB ซึ่งเป็นฮาร์ดแวร์ที่นักพัฒนาหลายรายมีอยู่แล้ว

ทำไมการเรียนรู้ต่อเนื่องจึงยาก

โมเดลภาษาส่วนใหญ่ที่มีอยู่ในปัจจุบันมีวงจรชีวิตเดียวกัน: ห้องปฏิบัติการฝึกโมเดล หยุดการทำงาน และจัดส่ง ผู้ใช้สามารถปรับแต่งขอบได้อย่างละเอียด แต่น้ำหนักพื้นฐานจะไม่เปลี่ยนแปลงอีกต่อไป ส่วนแรงจูงใจของโปรเจ็กต์ระบุว่าสิ่งนี้ทำให้โมเดลส่วนตัวทุกชิ้นเป็น "โมเดลของคนอื่นที่มีชั้นบางๆ ของคุณอยู่ด้านบน" ซึ่งเป็นโมเดลที่จะหยุดเรียนรู้ในวันที่จัดส่ง

อุปสรรคนี้เป็นที่รู้จักกันดีในการวิจัยการเรียนรู้ของเครื่อง: การลืมอย่างหายนะ แนวโน้มของโครงข่ายประสาทเทียมที่จะเขียนทับความรู้ที่เรียนรู้ก่อนหน้านี้เมื่อได้รับการฝึกอบรมกับข้อมูลใหม่ โมเดลที่เรียนรู้อย่างต่อเนื่องจากกระแสข้อมูลรายวันมักจะลดระดับของทุกสิ่งที่รู้มาก่อน

README สรุปข้อจำกัดที่กำหนดรูปแบบการออกแบบ โมเดลจะต้องพอดีกับ VRAM ขนาด 8GB — ไม่ใช่ด้วยการวัดปริมาณ เนื่องจากการฝึกต้องใช้การไล่ระดับสีและสถานะเครื่องมือเพิ่มประสิทธิภาพที่เพิ่มหน่วยความจำของน้ำหนักประมาณสามเท่า และต้องไม่ลืม โดยยึดถือสิ่งที่ได้เรียนรู้ไปแล้วไปพร้อมๆ กับการซึมซับเนื้อหาใหม่ๆ จากข้อความที่หลั่งไหลเข้ามาอย่างไม่สิ้นสุด

โมเดลระดับไบต์ที่สร้างขึ้นเอง

mini-AGI ทำงานที่ระดับไบต์มากกว่าบนโทเค็น โดยอ่านสตรีมของอักขระทีละชิ้น และดำเนินการตามขั้นตอนการไล่ระดับสีในแต่ละชิ้น โครงการยังกล่าวอีกว่าโมเดลนี้ "ประกอบสถาปัตยกรรมของตัวเอง" ซึ่งแยกความแตกต่างจากโมเดลทั่วไปที่ผู้สร้างเป็นผู้กำหนดโครงสร้างก่อนเริ่มการฝึกอบรม

วิธีการนี้เป็นการทดลองโดยเจตนา เป็นการสาธิตระบบการฝึกอบรมขนาดเล็ก ไม่ใช่ความท้าทายต่อระบบชายแดน

คำเตือนที่สำคัญ

ผู้เขียนโครงการมีความชัดเจนเกี่ยวกับสถานะปัจจุบันของระบบ ตามคำพูดของ README mini-AGI คือ "โมเดลระดับของเล่นขนาดเล็ก" และผู้อ่านไม่ควรคาดหวังความสามารถระดับแนวหน้า ประเด็นของแบบฝึกหัดคือการแสดงให้เห็นว่าการเรียนรู้อย่างต่อเนื่องจากสตรีมข้อมูลเดียวโดยไม่ลืมหายนะนั้นเป็นไปได้เลย และเป็นไปได้บนฮาร์ดแวร์ที่เกือบทุกคนสามารถเข้าถึงได้

น้ำหนักของแบบจำลองยังไม่ได้เผยแพร่ การฝึกซ้อมยังคงเสร็จสิ้นการส่งผ่านคลังข้อมูลที่เรียนรู้เป็นครั้งแรก และผู้เขียนกล่าวว่าน้ำหนักจะถูกปล่อยออกมาเมื่อการส่งผ่านนั้นเสร็จสิ้น ซึ่งในอัตราปัจจุบันจะใช้เวลาอีกสองสามสัปดาห์ จนกว่าจะถึงตอนนั้น ผู้สังเกตการณ์สามารถตรวจสอบตัวอย่างจากประวัติการฝึกซ้อมบนหน้าโครงการเพื่อดูว่าแบบจำลองมีการปรับปรุงอย่างไรตลอดการอ่าน

ทำไมมันถึงสำคัญ

หากแนวทางนี้ยังคงอยู่เมื่อโมเดลปรับขนาดตามขนาดที่มีความสามารถมากขึ้น มันจะชี้ไปที่การเป็นเจ้าของ AI ประเภทอื่น: โมเดลส่วนบุคคลที่ทำงานบนเครื่องของคุณเอง เรียนรู้อย่างต่อเนื่องจากเอกสารและข้อมูลที่คุณป้อนให้ และไม่เคยทำให้น้ำหนักของพวกมันถูกแช่แข็งตามกำหนดการเปิดตัวของผู้ขาย

โครงการนี้ยังเป็นเครื่องเตือนใจว่าไม่ใช่งานที่น่าสนใจใน AI ทั้งหมดจะเกิดขึ้นที่ชายแดน ด้วย GPU สำหรับผู้บริโภคเพียงตัวเดียว พื้นที่ดิสก์ธรรมดา และใบอนุญาต MIT mini-AGI พยายามตอบคำถามที่แล็บขนาดใหญ่เลี่ยงไปเป็นส่วนใหญ่ ไม่ว่าจะสร้างแบบจำลองเพื่อเรียนรู้วิธีการทำงานของผู้คนอย่างต่อเนื่อง ไม่ว่าจะต้องเผชิญอะไรก็ตามในลำดับต่อไป

โค้ดและเอกสารประกอบมีอยู่ใน GitHub สำหรับใครก็ตามที่มีฮาร์ดแวร์ที่เข้ากันได้ซึ่งต้องการติดตาม แยกโปรเจ็กต์ หรือฝึกฝนโมเดลต่อไปตามที่เห็นสมควร

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →