Дослідницька група з FAIR в Meta, Оксфордському університеті та Університетському коледжі Лондона представила моделі переваг AI Research Preferences (RPM) — метод для визначення того, які експерименти з машинним навчанням повинен запускати автономний дослідницький агент. Замість того, щоб передбачати оцінку експерименту, RPM ранжує невиконані кандидати та вибирає найбільш перспективного. Ця зміна, за словами команди, усуває справжнє вузьке місце в дослідженнях, керованих ШІ: верифікаційні обчислення, згідно зі звітом MarkTechPost про роботу.

Ідея виникає в той момент, коли дослідники вже можуть пропонувати, впроваджувати та оцінювати власні експерименти. Генерація ідей дешева; виконання не є. Навчання одного кандидата може зайняти години або дні роботи графічного процесора, тому агент неминуче пропонує набагато більше експериментів, ніж може дозволити собі провести. Те, яких кандидатів страчують, на думку команди, є справжнім важелем прогресу дослідження. Для лабораторій, які спостерігають за зростанням своїх рахунків за обчислення, ця робота саме тому привертає увагу останніх розробок ШІ в автоматизації досліджень.

Чому вибір експерименту є вузьким місцем

Команда виявила, що мовні моделі ненадійні для прогнозування абсолютних показників або результатів виконання. Модель не може розглянути експеримент-кандидат і точно передбачити результат, який вона отримає. Дослідники з’ясували, що він може визначити, який із двох кандидатів є кращим — це відносне порівняння, а не абсолютний прогноз. RPM побудовані виключно на цій відмінності: вони ніколи не прогнозують оцінку, вони лише рейтингують.

Система працює всередині AIRA-dojo, еволюційного дерева пошуку з відкритим вихідним кодом, який генерує експерименти з машинним навчанням за допомогою жадібного батьківського вибору та операторів Draft, Improve і Debug, повертаючи вузол із найвищим балом перевірки в кінці. Тест AIRS-Bench також має відкритий код. І каркас, і модель переваг використовують Qwen3.6-27B як основу, яка, як зазначає команда, є відкритими вагами.

Як працює турнір на вибування

Замість того, щоб створити один дочірній експеримент і виконати його, агент застосовує оператор 15 разів паралельно, щоб отримати 15 невиконаних кандидатів. Потім RPM порівнює їх попарно в турнірі з вибуванням, і лише переможець страчується. Кожне порівняння ґрунтується на контекстних вузлах, зібраних шляхом огляду вивченого дерева, причому кожен кандидат відображається поряд з оцінками перевірки його предків, тому суддя міркує на основі фактичної історії пошуку агента, а не у вакуумі.

У документі описано два варіанти з різними обчислювальними бюджетами:

  • Inference-only RPM — LLM-as-a-judge, який порівнює плани кандидатів, код і історію пошуку за один прохід. Його підказку було оптимізовано за допомогою MIPROv2 із фреймворку DSPy та зведено до того, що команда називає рубрикою головного дослідника: воно допускає виправні помилки, винагороджує за розширюваність і карає зайві напрямки дослідження. Точність порівняння в автономному режимі становила від 57,7 до 59,0 відсотків.
  • Agentic RPM — той самий суддя плюс пісочниця, яка клонує середовище агента, включно з одним графічним процесором H200, з інструментами, обмеженими Python, Bash і дією надсилання рішення. Він запускає невеликі пілотні експерименти, потім модель зворотного зв’язку або пропонує найбільш інформативний наступний експеримент, або завершує цикл. Кількість пілотів обмежена 30 із 60-секундним порогом, а бюджет, що залишився, навмисно завищений — повідомляється про 2700 секунд проти реальних 300 — тому агент не припиняє оптимізацію передчасно.

Суддя, налаштований як головний слідчий

Обрамлення головного дослідника — це тихо цікава частина. Замість того, щоб винагороджувати кандидатів, які виглядають максимально вражаюче, оптимізована рубрика відображає те, як досвідчений дослідник сортує ідеї: помилковий код, який можна виправити, перемагає відшліфований код, який веде в глухий кут, а вказівки, які дублюють існуюче дерево, коштують менше, ніж нові. Ця рубрика, отримана шляхом швидкої оптимізації, а не ручного налаштування, є тим, що несе покращення, припускають видалення команди.

Результати тестування на AIRS-Bench

Оцінка охоплювала 20 загальнодоступних текстових і табличних завдань, на кожне завдання було відведено 24 години на один H200 і 10 випадкових початкових значень. Важливо те, що та сама магістраль Qwen3.6-27B керувала як операторами експерименту, так і моделлю переваг, тому виграш походить від рівня вибору, а не від сильнішої моделі оцінки. Середні нормовані бали:

  • Без обертів (випадковий вибір): 0,684
  • Обороти в хвилину лише для висновків: 0,711
  • Обороти агента: 0,729
  • Оракул перевірки (стеля): 0,748
  • Тестовий оракул (стеля): 0,759

Імовірність покращення в порівнянні з випадковим вибором становила 0,5923 для варіанту лише для висновків і 0,5913 для агентного, з нижніми межами 95-відсоткового довірчого інтервалу 0,5066 і 0,5018 — вище порогу 0,5 для статистичної значущості, хоча команда відверта, що межі скромні, а не трансформаційні.

Ефективність – це більш практичний результат. RPM лише для висновків досяг кінцевого результату випадкового базового рівня 0,684 за 14,88 годин, що є прискоренням у 1,61 разу, тоді як для агентського варіанту потрібно 15,50 годин, що є прискоренням у 1,55 рази. Навіть з урахуванням накладних витрат на висновок суддів, скориговані цифри залишаються сприятливими.

Відкриті ваги та чесні застереження

Команда наперед заявляє, що RPM сьогодні можна розгорнути лише частково. Компоненти є відкритими — заморожені попередньо навчені магістралі без тонкого налаштування, каркас із відкритим вихідним кодом і еталонні показники, а також моделі магістралі з відкритими ваговими коефіцієнтами — але вимоги пісочниці агентного варіанту та накладні витрати на пілотний експеримент означають, що більшість лабораторій починатимуть із версії лише для висновків. Дослідники також відзначають, що кроки Debug повертаються до випадкового вибору в агентському варіанті, оскільки пілотний час конкурує з власним годинником агента.

Більше значення може бути спрямованим. Оскільки автономні дослідницькі агенти переходять від демонстрацій до щоденного використання в промислових лабораторіях, дефіцитним ресурсом є не ідеї, а години GPU та методи, які з часом вичавлюють більший прогрес із фіксованого обчислювального бюджету. Ранжування перед запуском є ​​простою ідеєю, і цифри AIRS-Bench показують, що ця ідея працює достатньо добре, щоб мати значення.

Будьте попереду ШІ

Будьте в курсі досліджень, які формують моделі завтрашнього дня, на AI Buzz Wire.

Читати більше новин AI →