یک پروژه منبع باز جدید توجه را برای مقابله با یکی از محدودیت های سرسخت یادگیری ماشین جلب می کند: ساخت یک مدل زبان که هرگز یادگیری را متوقف نمی کند. این پروژه که mini-AGI نامیده میشود، خود را به عنوان یک مدل زبانی در سطح بایت و یادگیری مداوم توصیف میکند که معماری خود را مونتاژ میکند، از ابتدا روی یک GPU با 8 گیگابایت VRAM آموزش میدهد و از هر چیزی که میخواند یاد میگیرد.
این پروژه در آخر هفته در Hacker News ظاهر شد، جایی که به بیش از صد نقطه صعود کرد و مخزن آن در GitHub تحت مجوز MIT منتشر شد. با توجه به README این پروژه، هدف نشان دادن این است که یادگیری مداوم از یک جریان واحد داده - بدون فراموشی فاجعهبار - حتی بر روی سختافزار متوسط و درجه یک مصرفکننده امکانپذیر است. For more context on this story, see our ongoing latest AI developments.
وزن روی دیسک، نه در VRAM
ترفند اصلی پشت mini-AGI یک طرح مدیریت حافظه غیر متعارف است. به جای نگه داشتن تمام پارامترهای مدل در حافظه GPU، سیستم وزن های خود را به عنوان فایل های معمولی روی دیسک ذخیره می کند و در صورت نیاز آنها را روی کارت گرافیک صفحه می کند.
این انتخاب طراحی یک نتیجه مهم دارد: تعداد پارامترهای مدل به جای VRAM توسط فضای دیسک آزاد محدود می شود. README بیان میکند که این مدل میتواند ظرفیت جدیدی را در حین تمرین در زمانی که کوتاه است افزایش دهد، و ظرفیتی را که هیچ چیز درخواست نمیکند، هرس کند. آموزش و استنتاج دقیقاً از طریق یک مسیر کد انجام می شود، بنابراین هیچ رژیم تنظیم دقیق جداگانه و هیچ مدل پایه ثابتی وجود ندارد - به قول پروژه، خواندن و آموزش، یک رویداد هستند.
هدف این سیستم یک رایانه شخصی یا لپ تاپ با حداقل 8 گیگابایت VRAM GPU است، سخت افزاری که بسیاری از توسعه دهندگان از قبل دارند.
چرا یادگیری مداوم سخت است
اکثر مدلهای زبان موجود امروز از چرخه حیات یکسانی پیروی میکنند: یک آزمایشگاه یک مدل را آموزش میدهد، آن را منجمد میکند و آن را ارسال میکند. کاربران می توانند لبه ها را به خوبی تنظیم کنند، اما وزن پایه دیگر هرگز تغییر نمی کند. بخش انگیزه پروژه استدلال میکند که این باعث میشود هر مدلی که شخصاً مالک آن است، «مدل شخص دیگری با لایهای نازک از شما در بالا باشد» – مدلی که از روز ارسال آن یاد نمیگیرد.
این مانع در تحقیقات یادگیری ماشینی شناخته شده است: فراموشی فاجعه بار، تمایل شبکه های عصبی برای بازنویسی دانش آموخته شده قبلی در هنگام آموزش بر روی داده های جدید. مدلی که به طور مداوم از جریان روزانه اطلاعات می آموزد، معمولاً هر چیزی را که قبلاً می دانست، تنزل می دهد.
README محدودیت هایی را که طراحی را شکل داده اند، تشریح می کند. این مدل باید روی 8 گیگابایت VRAM قرار گیرد - نه با کوانتیزه کردن، زیرا آموزش نیاز به گرادیان و حالت بهینهساز دارد که تقریباً سه برابر حافظه خود وزنهها اضافه میکند. و باید فراموش نکند، در حالی که مطالب جدید را از یک جریان بی پایان متن جذب می کند، به آنچه قبلاً آموخته است نگاه دارد.
یک مدل در سطح بایت که خودش را می سازد
mini-AGI به جای توکن ها در سطح بایت عمل می کند، جریانی از کاراکترها را یک تکه در یک زمان می خواند و یک گام گرادیان روی هر تکه بردارید. این پروژه همچنین می گوید که این مدل «معماری خود را مونتاژ می کند» و آن را از مدل های معمولی متمایز می کند که ساختار آنها قبل از شروع آموزش توسط سازندگان آنها ثابت شده است.
این رویکرد عمداً تجربی است. این یک نمایش در مقیاس کوچک از یک رژیم آموزشی است، نه چالشی برای سیستم های مرزی.
هشدارهای مهم
نویسنده پروژه در مورد وضعیت فعلی سیستم صریح است. به قول خود README، mini-AGI "یک مدل کوچک در سطح اسباب بازی" است و خوانندگان نباید انتظار قابلیت های سطح مرزی داشته باشند. هدف این تمرین نشان دادن این است که یادگیری مداوم از یک جریان داده بدون فراموشی فاجعهبار به هیچ وجه امکانپذیر است - و بر روی سختافزاری که تقریباً هر کسی میتواند به آن دسترسی داشته باشد امکانپذیر است.
وزن این مدل هنوز منتشر نشده است. دوره آموزشی هنوز در حال تکمیل اولین پاس خود بر روی مجموعه ای است که از آن یاد می گیرد، و نویسنده می گوید که وزن ها پس از تکمیل آن پاس آزاد می شوند، که با نرخ فعلی چند هفته دیگر فاصله دارد. تا آن زمان، ناظران می توانند نمونه هایی از تاریخچه دوره آموزشی را در صفحه پروژه بررسی کنند تا ببینند که مدل در طول مطالعه چگونه بهبود یافته است.
چرا مهم است
اگر این رویکرد با افزایش مقیاس مدل به اندازههای توانمندتر ادامه پیدا کند، به نوع دیگری از مالکیت هوش مصنوعی اشاره میکند: مدلهای شخصی که روی دستگاه شما زندگی میکنند، از اسناد و دادههایی که به آنها میدهید یاد میگیرند و هرگز وزن آنها بر اساس برنامه زمانبندی انتشار یک فروشنده ثابت نمیشود.
این پروژه همچنین یادآوری است که همه کارهای جالب در زمینه هوش مصنوعی در مرز انجام نمی شود. mini-AGI با یک پردازنده گرافیکی تک مصرف کننده، فضای دیسک معمولی و مجوز MIT در تلاش است به سوالی پاسخ دهد که آزمایشگاه های بزرگ تا حد زیادی از آن کنار گذاشته شده اند - آیا می توان مدلی را برای یادگیری روشی که مردم انجام می دهند: به طور مداوم، از هر آنچه که در آینده با آن مواجه می شود ساخته شود.
کد و مستندات در GitHub برای هرکسی که سخت افزار سازگاری دارد و می خواهد آن را دنبال کند، پروژه را پشت سر بگذارد، یا به آموزش مدل به دلخواه خود ادامه دهد، در دسترس است.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →