وقتی یک مدل زبان بزرگ هرگز مطالبی فراتر از کلاس پنجم نمی بیند چه اتفاقی می افتد؟ تیمی متشکل از هفت محقق به این سوال به معنای واقعی کلمه پاسخ دادند: آنها LittleLearner را ساختند، یک LLM با 5 میلیارد پارامتر که از ابتدا بر روی یک مجموعه فیلتر شده در برنامه درسی مدارس ابتدایی ایالات متحده آموزش داده شده بود، و سپس آزمایش کردند که آیا چیزی - پارامترهای بیشتر، بعد از آموزش بیشتر، داده های هوشمندانه تر - می تواند آن را به مدل قبلی سوق دهد یا خیر. آنها گزارش می دهند که پاسخ منفی است.

مقاله با عنوان «آموزنده کوچک: مدل‌های زبانی تحت تأثیر دانش کنترل‌شده آموزشی» در ۱۳ آگوست توسط فانفی لی، جانا زلر، مانوئل پرادا-کورال، تادووس ویدمر، پراسانا مایلواهانان، رایان کوترل و ویلند برندل به arXiv ارسال شد. در 16 آگوست، این موضوع موضوع یک گفتگوی سریع هکر نیوز با بیش از 200 رأی مثبت بود، زیرا محققان و پزشکان در مورد معنای این فرضیه مورد علاقه صنعت بحث کردند - اینکه پس از آموزش می‌تواند قابلیت‌ها را از هوا به وجود آورد. این دقیقاً همان آزمایش دقیق و مخالفی است که ما در [پوشش تحقیقاتی هوش مصنوعی] (https://aibuzzwire.news) به دنبال آن هستیم.

جعبه شنی با مرز دانش

LLMهای مدرن اساساً در همه چیز آموزش می بینند، که تقریباً غیرممکن می کند که بگوییم آیا یک مهارت نشان داده شده واقعاً در طول آموزش آموخته شده است یا صرفاً با درخواست صحیح ایجاد شده است. راه حل تیم این بود که خود توزیع تمرین را محدود کند. با شروع از FineWeb-Edu، آنها یک مجموعه 88 میلیارد توکنی - با نام LittleCurriculum - را از طریق یک خط لوله فیلتر پنج مرحله ای که با استانداردهای اصلی مشترک برای مهدکودک تا کلاس 5 همسو بود، تقطیر کردند. مفاهیم، ​​حقایق و واژگانی که در بالای کلاس 5 تدریس می شد به صراحت حذف شدند.

در این مجموعه، آنها مدل‌ها را در سه مقیاس (پارامترهای 0.6B، 1.3B، و 5B) از ابتدا آموزش دادند، که هر کدام همراه با یک مدل کنترل منطبق که بر روی داده‌های فیلتر نشده با معماری و بودجه رمز مشابه آموزش داده شده بود، ارسال شد. نتیجه مدلی است که برای ارزیابی باز به اندازه کافی مسلط است - شما می توانید با یک نسخه میزبانی شده 5B در یک مرورگر چت کنید - اما دارای مرز دانش قابل تفسیر و واضح است: اگر در برنامه درسی ابتدایی نبود، مدل هرگز آن را نمی دید.

استخراج، نه اکتساب

یافته اصلی صریح است: جعبه ابزار استاندارد برای هوشمندتر کردن مدل‌ها، آنچه LittleLearner قبلاً می‌دانست، تقویت می‌کند، اما هیچ‌یک از آن‌ها به طور معناداری عملکرد خارج از محدوده را بهبود نمی‌بخشد.

مقیاس‌سازی دقت را در دانش کنترل‌شده مدل بهبود بخشید و تا حدی در مسیر یادگیری یکسان گسترش داد، اما برای مشکلاتی که نیاز به قابلیت‌هایی فراتر از مواد درجه 5 دارند، کار چندانی نکرد. پس از آموزش با GRPO - روش یادگیری تقویتی در پشت بسیاری از رونق مدل استدلال - به طور قابل توجهی توانایی های K-5 را تقویت کرد، اما نتوانست توانایی های فراتر از K-5 را حتی زمانی که با داده های خارج از محدوده آموزش داده شده بود، بازیابی کند. و آموزش درون متنی، جادوی روزمره پر کردن دانش در یک اعلان، به مدل کمک کرد تا از آنچه داشت استفاده کند اما استدلال جدیدی را فراتر از مرز باز نکرد.

فیلتر پیش تمرین به طور خلاصه سقف قابلیت موثر را تعیین می کند. نویسندگان نتیجه را به عنوان شواهدی برای تمایزی که زمینه دائماً محو می‌کند، قاب می‌کنند: پس از آموزش و ایجاد انگیزه. پیش تمرین به دست می آورد.

کنترل های تمیز، پست های بازرسی عمومی

روش شناسی چیزی است که به ادعاها قدرت می دهد. از آنجا که هر مدل LittleLearner با یک کنترل بدون فیلتر منطبق ارائه می شود - معماری یکسان، تعداد نشانه های مشابه، دستورالعمل آموزشی یکسان - تیم می تواند هر تفاوت رفتاری را به تنهایی به فیلتر برنامه درسی نسبت دهد. متخصصان ریاضی که پس از آموزش در معیار MathCAMPS به محققان اجازه می‌دهند عملکرد را بر اساس پایه مدرسه ارزیابی کنند و دقیقاً جایی که توانایی درون محدوده به پایان می‌رسد را ردیابی کنند. و بر خلاف بسیاری از مقالات مرزی، همه چیز عمومی است: بدنه، پایگاه و پست های بازرسی پس از آموزش در هر سه مقیاس در HuggingFace، و دمو چت میزبانی شده، بنابراین تیم های مستقل می توانند خودشان مرز را بررسی کنند.

این باز بودن به بحث هکر نیوز دامن می زند. مفسران رفتار مدل میزبانی شده را در لبه دانش آن آزمایش می‌کنند - چه زمانی که کلاس 5 را پشت سر بگذارد، خودداری می‌کند، حدس می‌زند یا توهم می‌زند - و بر سر پیامدهای آن بحث می‌کنند: برخی نتایج را به‌عنوان خبر بدی برای هیاهوی مدل‌های استدلالی می‌خوانند، برخی دیگر اشاره می‌کنند که داده‌های پیش‌آموزشی در مقیاس وب بسیار بیشتر از مفاهیم مربوط به مدل مدرسه ابتدایی است، بنابراین سقف‌های بالاتر از مفاهیم مدل مدرسه ابتدایی است. نویسندگان مقاله خود در این مورد مراقب هستند: ادعای آنها در مورد آنچه مداخلات استاندارد نمی تواند برای مدلی با آموزش شناخته شده و کنترل شده انجام دهد، نه پیش بینی مستقیم در مورد آزمایشگاه های مرزی است.

چرا فراتر از کلاس مهم است

این آزمایش مستقیماً به بحث های زنده در هوش مصنوعی صحبت می کند. آزمایشگاه‌های هوش مصنوعی میلیاردها دلار را صرف رژیم‌های پس از آموزش می‌کنند که بر اساس این ایده که یادگیری تقویتی می‌تواند یک مدل پایه را فراتر از توانایی‌های خام آن پیش ببرد. LittleLearner پیشنهاد می‌کند که این دستاوردها ممکن است تا حد زیادی در آن چیزی که داده‌های پیش‌آموزشی پشتیبانی می‌کند زندگی کنند – و محدود به آن باشند. این استدلالی است برای اهمیت دادن بیشتر به نگهداری داده ها، و برای رسیدگی به ادعاهای مربوط به قابلیت های "ظهور" پس از آموزش با شک و تردید.

انتشار همچنین یک ابزار تحقیقاتی واقعی است، نه فقط یک مقاله. تیم LittleCurriculum و تمام نقاط بازرسی مدل را آشکارا منتشر کرد، و صفحه پروژه آزمایش‌هایی را که جعبه شنی قادر می‌سازد ترسیم می‌کند: آیا RL می‌تواند واقعاً به جای پاداش دادن به آن قابلیت ایجاد کند، چگونه یک مدل به طور کارآمد مفهوم جدیدی مانند اعداد منفی را هنگام معرفی می‌آموزد، و اینکه آیا ماشین‌ها و کودکان به نوردهی مشابه نیاز دارند - یا اشتباهات مشابهی را انجام می‌دهند.

برای رشته‌ای که به ندرت کنترل‌های تمیز دریافت می‌کند، مدلی با تحصیلات مشخص شده یک هدیه نادر است. و برای هر کس دیگری، این یادآوری است که ارزش دارد بالای میز سنجاق شود: هیچ مدل – یا شخصی – نمی تواند راه خود را از چیزی که هرگز به او آموزش نداده است، دلیل بیاورد.

از هوش مصنوعی جلوتر بمانید

پوشش همتا با درجه بررسی مجدد هوش مصنوعی پژوهشی، روزانه ارائه می شود. مرکز ما را برای آخرین تحولات هوش مصنوعی نشانه گذاری کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →