یک تیم تحقیقاتی از FAIR در متا، دانشگاه آکسفورد و دانشگاه کالج لندن، مدلهای اولویت تحقیقاتی هوش مصنوعی (RPMs) را معرفی کردهاند، روشی برای تصمیمگیری برای تصمیمگیری اینکه یک عامل تحقیقاتی مستقل باید کدام آزمایشهای یادگیری ماشین را اجرا کند. بر اساس گزارش MarkTechPost در مورد کار، به جای پیشبینی چگونگی امتیاز آزمایش، یک RPM کاندیداهای اجرا نشده را رتبهبندی میکند و امیدوارکنندهترین را انتخاب میکند، تغییری که تیم میگوید به تنگنای واقعی در تحقیقات مبتنی بر هوش مصنوعی میپردازد: محاسبه تأیید.
این ایده در لحظهای مطرح میشود که عوامل تحقیقاتی میتوانند آزمایشهای خود را پیشنهاد، اجرا و امتیاز دهند. تولید ایده ارزان است. اعدام نیست آموزش یک کاندید میتواند ساعتها تا چند روز از زمان GPU را صرف کند، بنابراین یک نماینده به ناچار آزمایشهای بسیار بیشتری را نسبت به توانایی اجرا پیشنهاد میکند. این که نامزدها اعدام شوند، همانطور که تیم آن را چارچوب بندی می کند، اهرم واقعی پیشرفت تحقیقات است. برای آزمایشگاههایی که بالا رفتن صورتحسابهای محاسباتیشان را تماشا میکنند، این قاببندی دقیقاً دلیلی است که این کار باعث جلب توجه آخرین پیشرفتهای هوش مصنوعی در اتوماسیون تحقیقاتی شده است.
چرا انتخاب آزمایش گلوگاه است
این تیم دریافتند که مدلهای زبان در پیشبینی معیارهای مطلق یا نتایج اجرا غیرقابل اعتماد هستند. یک مدل نمی تواند به یک آزمایش کاندید نگاه کند و امتیازی را که به دست می آورد به طور دقیق پیش بینی کند. محققان دریافتند آنچه که می تواند انجام دهد این است که قضاوت کند که کدام یک از دو نامزد بهتر است - یک مقایسه نسبی به جای یک پیش بینی مطلق. RPM ها کاملاً حول این تمایز ساخته شده اند: آنها هرگز یک امتیاز را پیش بینی نمی کنند، بلکه فقط رتبه بندی می کنند.
این سیستم در داخل AIRA-dojo، یک داربست جستجوی درخت تکاملی منبع باز اجرا میشود که آزمایشهای یادگیری ماشین را از طریق انتخاب والد حریصانه و عملگرهای Draft، Improve و Debug ایجاد میکند و گره با بالاترین امتیاز اعتبار را در پایان بازمیگرداند. معیار، AIRS-Bench نیز منبع باز است. هر دو داربست و مدل ترجیحی از Qwen3.6-27B به عنوان ستون فقرات خود استفاده می کنند، که تیم توجه می کند وزنه های باز است.
چگونه مسابقات حذفی کار می کند
عامل به جای ایجاد یک آزمایش فرزند و اجرای آن، یک عملگر را 15 بار به صورت موازی برای تولید 15 نامزد اجرا نشده اعمال می کند. سپس RPM آنها را به صورت زوجی در یک تورنمنت حذفی مقایسه می کند و فقط برنده اجرا می شود. هر مقایسه بر اساس گرههای زمینه جمعآوریشده توسط اولین قدم زدن از درخت کاوششده، با هر کاندید در کنار امتیازهای اعتبارسنجی نیاکانش نشان داده میشود، بنابراین قضاوت از تاریخچه جستجوی واقعی عامل به جای در خلأ، استدلال میکند.
این مقاله دو نوع را با بودجه های محاسباتی متفاوت توصیف می کند:
- RPM فقط استنتاج - یک LLM-به عنوان یک داور که طرح های نامزد، کد و تاریخچه جستجو را در یک پاس مقایسه می کند. درخواست آن با MIPROv2 از چارچوب DSPy بهینه شد و با چیزی که تیم آن را روبریک اصلی-بازرس می نامد همگرا شد: اشکالات قابل رفع را تحمل می کند، توسعه پذیری پاداش می دهد و جهت های تحقیقاتی اضافی را جریمه می کند. دقت مقایسه آفلاین 57.7 تا 59.0 درصد اندازه گیری شد.
- RPM عامل - همان قاضی به اضافه یک جعبه شنی که محیط عامل را شبیه سازی می کند، از جمله یک واحد پردازش گرافیکی H200، با ابزارهای محدود به Python، Bash و یک اقدام ارائه راه حل. آزمایشهای آزمایشی در مقیاس کوچک را اجرا میکند، سپس یک مدل بازخورد یا آموزندهترین آزمایش بعدی را پیشنهاد میکند یا به حلقه پایان میدهد. خلبانها روی 30 با آستانه 60 ثانیه محدود شدهاند، و بودجه زمان باقیمانده عمداً اغراقآمیز است - 2700 ثانیه در برابر 300 واقعی گزارش شده است - بنابراین عامل بهینهسازی را زود متوقف نمیکند.
قاضی که مانند یک بازپرس اصلی تنظیم شده است
قاب بندی اصلی و محقق بخش بی سر و صدا جالب است. به جای پاداش دادن به کاندیداهایی که حداکثر چشمگیر به نظر می رسند، روبریک بهینه شده نشان می دهد که چگونه یک محقق باتجربه ایده ها را تریاژ می کند: کدهای باگی که می توان آنها را اصلاح کرد، کدهای صیقلی را که به دنبال بن بست هستند شکست می دهد، و مسیرهایی که درخت موجود را تکرار می کنند ارزش کمتری نسبت به موارد جدید دارند. نتایج این تیم نشان میدهد که این موضوع که از طریق بهینهسازی سریع و نه تنظیم دستی آموخته شده است، چیزی است که باعث بهبود میشود.
نتایج محک در AIRS-Bench
ارزیابی شامل 20 تکلیف عمومی متنی و جدولی بود که هر کار 24 ساعت در یک H200 و 10 دانه تصادفی داده شد. بسیار مهم، همان ستون فقرات Qwen3.6-27B هم عملگرهای آزمایش و هم مدل ترجیحی را تامین میکرد، بنابراین دستاوردها از لایه انتخاب بهجای یک مدل داور قویتر میآیند. میانگین نمرات نرمال شده:
- بدون RPM (انتخاب تصادفی): 0.684
- RPM فقط استنتاج: 0.711
- RPM عامل: 0.729
- اوراکل اعتبارسنجی (سقف): 0.748
- اوراکل تست (سقف): 0.759
احتمال بهبود نسبت به انتخاب تصادفی برای نوع فقط استنتاج 0.5923 و برای نوع عاملی 0.5913 بود، با فاصله اطمینان 95 درصد مرزهای پایین 0.5066 و 0.5018 - بالاتر از آستانه 0.5 برای آماری به جای اینکه تیم تغییر کند، بسیار مهم است.
کارایی نتیجه عملی تر است. RPM فقط استنتاجی به امتیاز نهایی پایه تصادفی 0.684 در 14.88 ساعت رسید، یک افزایش سرعت 1.61 برابر، در حالی که نوع عاملی به 15.50 ساعت نیاز داشت، یک سرعت 1.55x. حتی با احتساب سربار استنباط داور خود میزبان، اعداد تعدیل شده مطلوب باقی ماندند.
اوزان باز و اخطارهای صادقانه
این تیم پیشاپیش این است که RPM ها امروزه فقط تا حدی قابل استقرار هستند. اجزاء باز هستند - ستون فقرات منجمد شده از قبل آموزش دیده بدون تنظیم دقیق، داربست منبع باز و معیار، و مدل های ستون فقرات با وزن باز - اما نیاز نوع عامل و سربار آزمایش آزمایشی آن به این معنی است که بیشتر آزمایشگاه ها با نسخه فقط استنتاج شروع می کنند. محققان همچنین خاطرنشان می کنند که مراحل Debug به انتخاب تصادفی در نوع عامل باز می گردد زیرا زمان آزمایشی با ساعت خود عامل رقابت می کند.
اهمیت بزرگتر ممکن است جهت دار باشد. از آنجایی که عوامل تحقیقاتی مستقل از دمو به استفاده روزانه در آزمایشگاههای صنعتی میروند، منابع کمیاب دیگر ایدهها نیستند، بلکه ساعتهای GPU و روشهایی هستند که پیشرفت بیشتری را از یک ترکیب بودجه محاسباتی ثابت در طول زمان کاهش میدهند. رتبه بندی قبل از دویدن ایده ساده ای است و اعداد AIRS-Bench نشان می دهد که این ایده به اندازه کافی خوب کار می کند که اهمیت داشته باشد.
[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)
در [AI Buzz Wire] (https://aibuzzwire.news) با تحقیقاتی که مدل های فردا را شکل می دهد، همراه باشید.
اخبار هوش مصنوعی را بیشتر بخوانید →