یک تیم تحقیقاتی از FAIR در متا، دانشگاه آکسفورد و دانشگاه کالج لندن، مدل‌های اولویت تحقیقاتی هوش مصنوعی (RPMs) را معرفی کرده‌اند، روشی برای تصمیم‌گیری برای تصمیم‌گیری اینکه یک عامل تحقیقاتی مستقل باید کدام آزمایش‌های یادگیری ماشین را اجرا کند. بر اساس گزارش MarkTechPost در مورد کار، به جای پیش‌بینی چگونگی امتیاز آزمایش، یک RPM کاندیداهای اجرا نشده را رتبه‌بندی می‌کند و امیدوارکننده‌ترین را انتخاب می‌کند، تغییری که تیم می‌گوید به تنگنای واقعی در تحقیقات مبتنی بر هوش مصنوعی می‌پردازد: محاسبه تأیید.

این ایده در لحظه‌ای مطرح می‌شود که عوامل تحقیقاتی می‌توانند آزمایش‌های خود را پیشنهاد، اجرا و امتیاز دهند. تولید ایده ارزان است. اعدام نیست آموزش یک کاندید می‌تواند ساعت‌ها تا چند روز از زمان GPU را صرف کند، بنابراین یک نماینده به ناچار آزمایش‌های بسیار بیشتری را نسبت به توانایی اجرا پیشنهاد می‌کند. این که نامزدها اعدام شوند، همانطور که تیم آن را چارچوب بندی می کند، اهرم واقعی پیشرفت تحقیقات است. برای آزمایشگاه‌هایی که بالا رفتن صورت‌حساب‌های محاسباتی‌شان را تماشا می‌کنند، این قاب‌بندی دقیقاً دلیلی است که این کار باعث جلب توجه آخرین پیشرفت‌های هوش مصنوعی در اتوماسیون تحقیقاتی شده است.

چرا انتخاب آزمایش گلوگاه است

این تیم دریافتند که مدل‌های زبان در پیش‌بینی معیارهای مطلق یا نتایج اجرا غیرقابل اعتماد هستند. یک مدل نمی تواند به یک آزمایش کاندید نگاه کند و امتیازی را که به دست می آورد به طور دقیق پیش بینی کند. محققان دریافتند آنچه که می تواند انجام دهد این است که قضاوت کند که کدام یک از دو نامزد بهتر است - یک مقایسه نسبی به جای یک پیش بینی مطلق. RPM ها کاملاً حول این تمایز ساخته شده اند: آنها هرگز یک امتیاز را پیش بینی نمی کنند، بلکه فقط رتبه بندی می کنند.

این سیستم در داخل AIRA-dojo، یک داربست جستجوی درخت تکاملی منبع باز اجرا می‌شود که آزمایش‌های یادگیری ماشین را از طریق انتخاب والد حریصانه و عملگرهای Draft، Improve و Debug ایجاد می‌کند و گره با بالاترین امتیاز اعتبار را در پایان بازمی‌گرداند. معیار، AIRS-Bench نیز منبع باز است. هر دو داربست و مدل ترجیحی از Qwen3.6-27B به عنوان ستون فقرات خود استفاده می کنند، که تیم توجه می کند وزنه های باز است.

چگونه مسابقات حذفی کار می کند

عامل به جای ایجاد یک آزمایش فرزند و اجرای آن، یک عملگر را 15 بار به صورت موازی برای تولید 15 نامزد اجرا نشده اعمال می کند. سپس RPM آنها را به صورت زوجی در یک تورنمنت حذفی مقایسه می کند و فقط برنده اجرا می شود. هر مقایسه بر اساس گره‌های زمینه جمع‌آوری‌شده توسط اولین قدم زدن از درخت کاوش‌شده، با هر کاندید در کنار امتیازهای اعتبارسنجی نیاکانش نشان داده می‌شود، بنابراین قضاوت از تاریخچه جستجوی واقعی عامل به جای در خلأ، استدلال می‌کند.

این مقاله دو نوع را با بودجه های محاسباتی متفاوت توصیف می کند:

  • RPM فقط استنتاج - یک LLM-به عنوان یک داور که طرح های نامزد، کد و تاریخچه جستجو را در یک پاس مقایسه می کند. درخواست آن با MIPROv2 از چارچوب DSPy بهینه شد و با چیزی که تیم آن را روبریک اصلی-بازرس می نامد همگرا شد: اشکالات قابل رفع را تحمل می کند، توسعه پذیری پاداش می دهد و جهت های تحقیقاتی اضافی را جریمه می کند. دقت مقایسه آفلاین 57.7 تا 59.0 درصد اندازه گیری شد.
  • RPM عامل - همان قاضی به اضافه یک جعبه شنی که محیط عامل را شبیه سازی می کند، از جمله یک واحد پردازش گرافیکی H200، با ابزارهای محدود به Python، Bash و یک اقدام ارائه راه حل. آزمایش‌های آزمایشی در مقیاس کوچک را اجرا می‌کند، سپس یک مدل بازخورد یا آموزنده‌ترین آزمایش بعدی را پیشنهاد می‌کند یا به حلقه پایان می‌دهد. خلبان‌ها روی 30 با آستانه 60 ثانیه محدود شده‌اند، و بودجه زمان باقی‌مانده عمداً اغراق‌آمیز است - 2700 ثانیه در برابر 300 واقعی گزارش شده است - بنابراین عامل بهینه‌سازی را زود متوقف نمی‌کند.

قاضی که مانند یک بازپرس اصلی تنظیم شده است

قاب بندی اصلی و محقق بخش بی سر و صدا جالب است. به جای پاداش دادن به کاندیداهایی که حداکثر چشمگیر به نظر می رسند، روبریک بهینه شده نشان می دهد که چگونه یک محقق باتجربه ایده ها را تریاژ می کند: کدهای باگی که می توان آنها را اصلاح کرد، کدهای صیقلی را که به دنبال بن بست هستند شکست می دهد، و مسیرهایی که درخت موجود را تکرار می کنند ارزش کمتری نسبت به موارد جدید دارند. نتایج این تیم نشان می‌دهد که این موضوع که از طریق بهینه‌سازی سریع و نه تنظیم دستی آموخته شده است، چیزی است که باعث بهبود می‌شود.

نتایج محک در AIRS-Bench

ارزیابی شامل 20 تکلیف عمومی متنی و جدولی بود که هر کار 24 ساعت در یک H200 و 10 دانه تصادفی داده شد. بسیار مهم، همان ستون فقرات Qwen3.6-27B هم عملگرهای آزمایش و هم مدل ترجیحی را تامین می‌کرد، بنابراین دستاوردها از لایه انتخاب به‌جای یک مدل داور قوی‌تر می‌آیند. میانگین نمرات نرمال شده:

  • بدون RPM (انتخاب تصادفی): 0.684
  • RPM فقط استنتاج: 0.711
  • RPM عامل: 0.729
  • اوراکل اعتبارسنجی (سقف): 0.748
  • اوراکل تست (سقف): 0.759

احتمال بهبود نسبت به انتخاب تصادفی برای نوع فقط استنتاج 0.5923 و برای نوع عاملی 0.5913 بود، با فاصله اطمینان 95 درصد مرزهای پایین 0.5066 و 0.5018 - بالاتر از آستانه 0.5 برای آماری به جای اینکه تیم تغییر کند، بسیار مهم است.

کارایی نتیجه عملی تر است. RPM فقط استنتاجی به امتیاز نهایی پایه تصادفی 0.684 در 14.88 ساعت رسید، یک افزایش سرعت 1.61 برابر، در حالی که نوع عاملی به 15.50 ساعت نیاز داشت، یک سرعت 1.55x. حتی با احتساب سربار استنباط داور خود میزبان، اعداد تعدیل شده مطلوب باقی ماندند.

اوزان باز و اخطارهای صادقانه

این تیم پیشاپیش این است که RPM ها امروزه فقط تا حدی قابل استقرار هستند. اجزاء باز هستند - ستون فقرات منجمد شده از قبل آموزش دیده بدون تنظیم دقیق، داربست منبع باز و معیار، و مدل های ستون فقرات با وزن باز - اما نیاز نوع عامل و سربار آزمایش آزمایشی آن به این معنی است که بیشتر آزمایشگاه ها با نسخه فقط استنتاج شروع می کنند. محققان همچنین خاطرنشان می کنند که مراحل Debug به انتخاب تصادفی در نوع عامل باز می گردد زیرا زمان آزمایشی با ساعت خود عامل رقابت می کند.

اهمیت بزرگتر ممکن است جهت دار باشد. از آنجایی که عوامل تحقیقاتی مستقل از دمو به استفاده روزانه در آزمایشگاه‌های صنعتی می‌روند، منابع کمیاب دیگر ایده‌ها نیستند، بلکه ساعت‌های GPU و روش‌هایی هستند که پیشرفت بیشتری را از یک ترکیب بودجه محاسباتی ثابت در طول زمان کاهش می‌دهند. رتبه بندی قبل از دویدن ایده ساده ای است و اعداد AIRS-Bench نشان می دهد که این ایده به اندازه کافی خوب کار می کند که اهمیت داشته باشد.

[از هوش مصنوعی جلوتر بمانید] (https://aibuzzwire.news)

در [AI Buzz Wire] (https://aibuzzwire.news) با تحقیقاتی که مدل های فردا را شکل می دهد، همراه باشید.

اخبار هوش مصنوعی را بیشتر بخوانید →