وقتی یک مدل زبان بزرگ هرگز مطالبی فراتر از کلاس پنجم نمی بیند چه اتفاقی می افتد؟ تیمی متشکل از هفت محقق به این سوال به معنای واقعی کلمه پاسخ دادند: آنها LittleLearner را ساختند، یک LLM با 5 میلیارد پارامتر که از ابتدا بر روی یک مجموعه فیلتر شده در برنامه درسی مدارس ابتدایی ایالات متحده آموزش داده شده بود، و سپس آزمایش کردند که آیا چیزی - پارامترهای بیشتر، بعد از آموزش بیشتر، داده های هوشمندانه تر - می تواند آن را به مدل قبلی سوق دهد یا خیر. آنها گزارش می دهند که پاسخ منفی است.
مقاله با عنوان «آموزنده کوچک: مدلهای زبانی تحت تأثیر دانش کنترلشده آموزشی» در ۱۳ آگوست توسط فانفی لی، جانا زلر، مانوئل پرادا-کورال، تادووس ویدمر، پراسانا مایلواهانان، رایان کوترل و ویلند برندل به arXiv ارسال شد. در 16 آگوست، این موضوع موضوع یک گفتگوی سریع هکر نیوز با بیش از 200 رأی مثبت بود، زیرا محققان و پزشکان در مورد معنای این فرضیه مورد علاقه صنعت بحث کردند - اینکه پس از آموزش میتواند قابلیتها را از هوا به وجود آورد. این دقیقاً همان آزمایش دقیق و مخالفی است که ما در [پوشش تحقیقاتی هوش مصنوعی] (https://aibuzzwire.news) به دنبال آن هستیم.
جعبه شنی با مرز دانش
LLMهای مدرن اساساً در همه چیز آموزش می بینند، که تقریباً غیرممکن می کند که بگوییم آیا یک مهارت نشان داده شده واقعاً در طول آموزش آموخته شده است یا صرفاً با درخواست صحیح ایجاد شده است. راه حل تیم این بود که خود توزیع تمرین را محدود کند. با شروع از FineWeb-Edu، آنها یک مجموعه 88 میلیارد توکنی - با نام LittleCurriculum - را از طریق یک خط لوله فیلتر پنج مرحله ای که با استانداردهای اصلی مشترک برای مهدکودک تا کلاس 5 همسو بود، تقطیر کردند. مفاهیم، حقایق و واژگانی که در بالای کلاس 5 تدریس می شد به صراحت حذف شدند.
در این مجموعه، آنها مدلها را در سه مقیاس (پارامترهای 0.6B، 1.3B، و 5B) از ابتدا آموزش دادند، که هر کدام همراه با یک مدل کنترل منطبق که بر روی دادههای فیلتر نشده با معماری و بودجه رمز مشابه آموزش داده شده بود، ارسال شد. نتیجه مدلی است که برای ارزیابی باز به اندازه کافی مسلط است - شما می توانید با یک نسخه میزبانی شده 5B در یک مرورگر چت کنید - اما دارای مرز دانش قابل تفسیر و واضح است: اگر در برنامه درسی ابتدایی نبود، مدل هرگز آن را نمی دید.
استخراج، نه اکتساب
یافته اصلی صریح است: جعبه ابزار استاندارد برای هوشمندتر کردن مدلها، آنچه LittleLearner قبلاً میدانست، تقویت میکند، اما هیچیک از آنها به طور معناداری عملکرد خارج از محدوده را بهبود نمیبخشد.
مقیاسسازی دقت را در دانش کنترلشده مدل بهبود بخشید و تا حدی در مسیر یادگیری یکسان گسترش داد، اما برای مشکلاتی که نیاز به قابلیتهایی فراتر از مواد درجه 5 دارند، کار چندانی نکرد. پس از آموزش با GRPO - روش یادگیری تقویتی در پشت بسیاری از رونق مدل استدلال - به طور قابل توجهی توانایی های K-5 را تقویت کرد، اما نتوانست توانایی های فراتر از K-5 را حتی زمانی که با داده های خارج از محدوده آموزش داده شده بود، بازیابی کند. و آموزش درون متنی، جادوی روزمره پر کردن دانش در یک اعلان، به مدل کمک کرد تا از آنچه داشت استفاده کند اما استدلال جدیدی را فراتر از مرز باز نکرد.فیلتر پیش تمرین به طور خلاصه سقف قابلیت موثر را تعیین می کند. نویسندگان نتیجه را به عنوان شواهدی برای تمایزی که زمینه دائماً محو میکند، قاب میکنند: پس از آموزش و ایجاد انگیزه. پیش تمرین به دست می آورد.
کنترل های تمیز، پست های بازرسی عمومی
روش شناسی چیزی است که به ادعاها قدرت می دهد. از آنجا که هر مدل LittleLearner با یک کنترل بدون فیلتر منطبق ارائه می شود - معماری یکسان، تعداد نشانه های مشابه، دستورالعمل آموزشی یکسان - تیم می تواند هر تفاوت رفتاری را به تنهایی به فیلتر برنامه درسی نسبت دهد. متخصصان ریاضی که پس از آموزش در معیار MathCAMPS به محققان اجازه میدهند عملکرد را بر اساس پایه مدرسه ارزیابی کنند و دقیقاً جایی که توانایی درون محدوده به پایان میرسد را ردیابی کنند. و بر خلاف بسیاری از مقالات مرزی، همه چیز عمومی است: بدنه، پایگاه و پست های بازرسی پس از آموزش در هر سه مقیاس در HuggingFace، و دمو چت میزبانی شده، بنابراین تیم های مستقل می توانند خودشان مرز را بررسی کنند.
این باز بودن به بحث هکر نیوز دامن می زند. مفسران رفتار مدل میزبانی شده را در لبه دانش آن آزمایش میکنند - چه زمانی که کلاس 5 را پشت سر بگذارد، خودداری میکند، حدس میزند یا توهم میزند - و بر سر پیامدهای آن بحث میکنند: برخی نتایج را بهعنوان خبر بدی برای هیاهوی مدلهای استدلالی میخوانند، برخی دیگر اشاره میکنند که دادههای پیشآموزشی در مقیاس وب بسیار بیشتر از مفاهیم مربوط به مدل مدرسه ابتدایی است، بنابراین سقفهای بالاتر از مفاهیم مدل مدرسه ابتدایی است. نویسندگان مقاله خود در این مورد مراقب هستند: ادعای آنها در مورد آنچه مداخلات استاندارد نمی تواند برای مدلی با آموزش شناخته شده و کنترل شده انجام دهد، نه پیش بینی مستقیم در مورد آزمایشگاه های مرزی است.
چرا فراتر از کلاس مهم است
این آزمایش مستقیماً به بحث های زنده در هوش مصنوعی صحبت می کند. آزمایشگاههای هوش مصنوعی میلیاردها دلار را صرف رژیمهای پس از آموزش میکنند که بر اساس این ایده که یادگیری تقویتی میتواند یک مدل پایه را فراتر از تواناییهای خام آن پیش ببرد. LittleLearner پیشنهاد میکند که این دستاوردها ممکن است تا حد زیادی در آن چیزی که دادههای پیشآموزشی پشتیبانی میکند زندگی کنند – و محدود به آن باشند. این استدلالی است برای اهمیت دادن بیشتر به نگهداری داده ها، و برای رسیدگی به ادعاهای مربوط به قابلیت های "ظهور" پس از آموزش با شک و تردید.
انتشار همچنین یک ابزار تحقیقاتی واقعی است، نه فقط یک مقاله. تیم LittleCurriculum و تمام نقاط بازرسی مدل را آشکارا منتشر کرد، و صفحه پروژه آزمایشهایی را که جعبه شنی قادر میسازد ترسیم میکند: آیا RL میتواند واقعاً به جای پاداش دادن به آن قابلیت ایجاد کند، چگونه یک مدل به طور کارآمد مفهوم جدیدی مانند اعداد منفی را هنگام معرفی میآموزد، و اینکه آیا ماشینها و کودکان به نوردهی مشابه نیاز دارند - یا اشتباهات مشابهی را انجام میدهند.
برای رشتهای که به ندرت کنترلهای تمیز دریافت میکند، مدلی با تحصیلات مشخص شده یک هدیه نادر است. و برای هر کس دیگری، این یادآوری است که ارزش دارد بالای میز سنجاق شود: هیچ مدل – یا شخصی – نمی تواند راه خود را از چیزی که هرگز به او آموزش نداده است، دلیل بیاورد.
از هوش مصنوعی جلوتر بمانید
پوشش همتا با درجه بررسی مجدد هوش مصنوعی پژوهشی، روزانه ارائه می شود. مرکز ما را برای آخرین تحولات هوش مصنوعی نشانه گذاری کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →