یک پروژه منبع باز جدید توجه را برای مقابله با یکی از محدودیت های سرسخت یادگیری ماشین جلب می کند: ساخت یک مدل زبان که هرگز یادگیری را متوقف نمی کند. این پروژه که mini-AGI نامیده می‌شود، خود را به عنوان یک مدل زبانی در سطح بایت و یادگیری مداوم توصیف می‌کند که معماری خود را مونتاژ می‌کند، از ابتدا روی یک GPU با 8 گیگابایت VRAM آموزش می‌دهد و از هر چیزی که می‌خواند یاد می‌گیرد.

این پروژه در آخر هفته در Hacker News ظاهر شد، جایی که به بیش از صد نقطه صعود کرد و مخزن آن در GitHub تحت مجوز MIT منتشر شد. با توجه به README این پروژه، هدف نشان دادن این است که یادگیری مداوم از یک جریان واحد داده - بدون فراموشی فاجعه‌بار - حتی بر روی سخت‌افزار متوسط ​​و درجه یک مصرف‌کننده امکان‌پذیر است. For more context on this story, see our ongoing latest AI developments.

وزن روی دیسک، نه در VRAM

ترفند اصلی پشت mini-AGI یک طرح مدیریت حافظه غیر متعارف است. به جای نگه داشتن تمام پارامترهای مدل در حافظه GPU، سیستم وزن های خود را به عنوان فایل های معمولی روی دیسک ذخیره می کند و در صورت نیاز آنها را روی کارت گرافیک صفحه می کند.

این انتخاب طراحی یک نتیجه مهم دارد: تعداد پارامترهای مدل به جای VRAM توسط فضای دیسک آزاد محدود می شود. README بیان می‌کند که این مدل می‌تواند ظرفیت جدیدی را در حین تمرین در زمانی که کوتاه است افزایش دهد، و ظرفیتی را که هیچ چیز درخواست نمی‌کند، هرس کند. آموزش و استنتاج دقیقاً از طریق یک مسیر کد انجام می شود، بنابراین هیچ رژیم تنظیم دقیق جداگانه و هیچ مدل پایه ثابتی وجود ندارد - به قول پروژه، خواندن و آموزش، یک رویداد هستند.

هدف این سیستم یک رایانه شخصی یا لپ تاپ با حداقل 8 گیگابایت VRAM GPU است، سخت افزاری که بسیاری از توسعه دهندگان از قبل دارند.

چرا یادگیری مداوم سخت است

اکثر مدل‌های زبان موجود امروز از چرخه حیات یکسانی پیروی می‌کنند: یک آزمایشگاه یک مدل را آموزش می‌دهد، آن را منجمد می‌کند و آن را ارسال می‌کند. کاربران می توانند لبه ها را به خوبی تنظیم کنند، اما وزن پایه دیگر هرگز تغییر نمی کند. بخش انگیزه پروژه استدلال می‌کند که این باعث می‌شود هر مدلی که شخصاً مالک آن است، «مدل شخص دیگری با لایه‌ای نازک از شما در بالا باشد» – مدلی که از روز ارسال آن یاد نمی‌گیرد.

این مانع در تحقیقات یادگیری ماشینی شناخته شده است: فراموشی فاجعه بار، تمایل شبکه های عصبی برای بازنویسی دانش آموخته شده قبلی در هنگام آموزش بر روی داده های جدید. مدلی که به طور مداوم از جریان روزانه اطلاعات می آموزد، معمولاً هر چیزی را که قبلاً می دانست، تنزل می دهد.

README محدودیت هایی را که طراحی را شکل داده اند، تشریح می کند. این مدل باید روی 8 گیگابایت VRAM قرار گیرد - نه با کوانتیزه کردن، زیرا آموزش نیاز به گرادیان و حالت بهینه‌ساز دارد که تقریباً سه برابر حافظه خود وزنه‌ها اضافه می‌کند. و باید فراموش نکند، در حالی که مطالب جدید را از یک جریان بی پایان متن جذب می کند، به آنچه قبلاً آموخته است نگاه دارد.

یک مدل در سطح بایت که خودش را می سازد

mini-AGI به جای توکن ها در سطح بایت عمل می کند، جریانی از کاراکترها را یک تکه در یک زمان می خواند و یک گام گرادیان روی هر تکه بردارید. این پروژه همچنین می گوید که این مدل «معماری خود را مونتاژ می کند» و آن را از مدل های معمولی متمایز می کند که ساختار آنها قبل از شروع آموزش توسط سازندگان آنها ثابت شده است.

این رویکرد عمداً تجربی است. این یک نمایش در مقیاس کوچک از یک رژیم آموزشی است، نه چالشی برای سیستم های مرزی.

هشدارهای مهم

نویسنده پروژه در مورد وضعیت فعلی سیستم صریح است. به قول خود README، mini-AGI "یک مدل کوچک در سطح اسباب بازی" است و خوانندگان نباید انتظار قابلیت های سطح مرزی داشته باشند. هدف این تمرین نشان دادن این است که یادگیری مداوم از یک جریان داده بدون فراموشی فاجعه‌بار به هیچ وجه امکان‌پذیر است - و بر روی سخت‌افزاری که تقریباً هر کسی می‌تواند به آن دسترسی داشته باشد امکان‌پذیر است.

وزن این مدل هنوز منتشر نشده است. دوره آموزشی هنوز در حال تکمیل اولین پاس خود بر روی مجموعه ای است که از آن یاد می گیرد، و نویسنده می گوید که وزن ها پس از تکمیل آن پاس آزاد می شوند، که با نرخ فعلی چند هفته دیگر فاصله دارد. تا آن زمان، ناظران می توانند نمونه هایی از تاریخچه دوره آموزشی را در صفحه پروژه بررسی کنند تا ببینند که مدل در طول مطالعه چگونه بهبود یافته است.

چرا مهم است

اگر این رویکرد با افزایش مقیاس مدل به اندازه‌های توانمندتر ادامه پیدا کند، به نوع دیگری از مالکیت هوش مصنوعی اشاره می‌کند: مدل‌های شخصی که روی دستگاه شما زندگی می‌کنند، از اسناد و داده‌هایی که به آن‌ها می‌دهید یاد می‌گیرند و هرگز وزن آن‌ها بر اساس برنامه زمان‌بندی انتشار یک فروشنده ثابت نمی‌شود.

این پروژه همچنین یادآوری است که همه کارهای جالب در زمینه هوش مصنوعی در مرز انجام نمی شود. mini-AGI با یک پردازنده گرافیکی تک مصرف کننده، فضای دیسک معمولی و مجوز MIT در تلاش است به سوالی پاسخ دهد که آزمایشگاه های بزرگ تا حد زیادی از آن کنار گذاشته شده اند - آیا می توان مدلی را برای یادگیری روشی که مردم انجام می دهند: به طور مداوم، از هر آنچه که در آینده با آن مواجه می شود ساخته شود.

کد و مستندات در GitHub برای هرکسی که سخت افزار سازگاری دارد و می خواهد آن را دنبال کند، پروژه را پشت سر بگذارد، یا به آموزش مدل به دلخواه خود ادامه دهد، در دسترس است.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →