Исследовательская группа из FAIR в Мете, Оксфордского университета и Университетского колледжа Лондона представила модели предпочтений исследований ИИ (RPM) — метод, позволяющий решить, какие эксперименты по машинному обучению действительно следует проводить автономному исследовательскому агенту. Вместо того, чтобы предсказывать, как будет оцениваться эксперимент, RPM ранжирует невыполненных кандидатов и выбирает наиболее многообещающего. По словам команды, этот сдвиг устраняет реальное узкое место в исследованиях, основанных на искусственном интеллекте: проверочные вычисления, согласно отчету MarkTechPost о работе.

Идея возникла в тот момент, когда исследовательские агенты уже могут предлагать, реализовывать и оценивать свои собственные эксперименты. Генерация идей обходится дешево; исполнение нет. Обучение одного кандидата может занять от нескольких часов до нескольких дней времени графического процессора, поэтому агент неизбежно предлагает гораздо больше экспериментов, чем он может себе позволить. То, какие кандидаты будут казнены, по мнению команды, является реальным рычагом прогресса исследований. Для лабораторий, наблюдающих за ростом своих счетов за вычислительные услуги, именно эта концепция привлекает внимание к новейшим разработкам в области искусственного интеллекта в области автоматизации исследований.

Почему выбор эксперимента является узким местом

Команда обнаружила, что языковые модели ненадежны при прогнозировании абсолютных показателей или результатов выполнения. Модель не может посмотреть на эксперимент-кандидат и точно предсказать, какую оценку он достигнет. Исследователи обнаружили, что он может определить, какой из двух кандидатов лучше — относительное сравнение, а не абсолютный прогноз. RPM полностью построены на этом различии: они никогда не прогнозируют оценку, они только ранжируют.

Система работает внутри AIRA-dojo, платформы поиска по эволюционному дереву с открытым исходным кодом, которая генерирует эксперименты по машинному обучению посредством жадного родительского выбора и операторов «Черновик», «Улучшение» и «Отладка», возвращая в конце узел с наивысшим баллом проверки. Тест AIRS-Bench также имеет открытый исходный код. И каркас, и модель предпочтений используют Qwen3.6-27B в качестве основы, которая, как отмечает команда, представляет собой открытые веса.

Как работает турнир на выбывание

Вместо того, чтобы генерировать один дочерний эксперимент и выполнять его, агент применяет оператор 15 раз параллельно, чтобы создать 15 невыполненных кандидатов. Затем RPM сравнивает их попарно в турнире на выбывание, и казнится только победитель. Каждое сравнение основано на узлах контекста, собранных в ходе обхода исследуемого дерева в ширину, при этом каждый кандидат отображается рядом с оценками проверки его предков, поэтому судья делает выводы на основе фактической истории поиска агента, а не в вакууме.

В статье описываются два варианта с разными вычислительными бюджетами:

  • RPM только для вывода — LLM в качестве судьи, который сравнивает планы кандидатов, код и историю поиска за один проход. Его подсказка была оптимизирована с помощью MIPROv2 из среды DSPy и сводилась к тому, что команда называет рубрикой «главный исследователь»: она допускает исправимые ошибки, поощряет расширяемость и наказывает избыточные направления исследований. Точность офлайн-сравнения составила от 57,7 до 59,0 процента.
  • Agentic RPM — тот же судья плюс песочница, которая клонирует среду агента, включая один графический процессор H200, с инструментами, ограниченными Python, Bash и действием отправки решения. Он проводит небольшие пилотные эксперименты, а затем модель обратной связи либо предлагает наиболее информативный следующий эксперимент, либо завершает цикл. Количество пилотов ограничено 30 с порогом в 60 секунд, а оставшийся бюджет времени намеренно завышен — заявленные 2700 секунд против реальных 300 — поэтому агент не прекращает оптимизацию раньше времени.

Судья, настроенный как главный следователь

Взаимосвязь между руководителем и следователем — это довольно интересная часть. Вместо того, чтобы награждать кандидатов, которые выглядят максимально впечатляюще, оптимизированная рубрика отражает то, как опытный исследователь сортирует идеи: код с ошибками, который можно исправить, превосходит отлаженный код, ведущий в тупик, а направления, дублирующие существующее дерево, стоят меньше, чем новые. Эта рубрика, изученная посредством быстрой оптимизации, а не ручной настройки, и является тем, что обеспечивает улучшение, как показывают результаты абляции команды.

Результаты тестов на AIRS-Bench

Оценка охватывала 20 общедоступных текстовых и табличных задач, на каждую задачу отводилось 24 часа на одном H200 и 10 случайных начальных значений. Важно отметить, что одна и та же магистральная сеть Qwen3.6-27B питала как операторов эксперимента, так и модель предпочтений, поэтому выигрыш достигается за счет уровня выбора, а не более сильной модели оценки. Средние нормализованные баллы:

  • Без оборотов в минуту (случайный выбор): 0,684
  • Число оборотов в минуту только для вывода: 0,711
  • Агентское число оборотов в минуту: 0,729
  • Оракул проверки (потолок): 0,748
  • Тест оракула (потолок): 0,759

Вероятность улучшения по сравнению со случайным выбором составила 0,5923 для варианта только вывода и 0,5913 для агентного варианта, с нижними границами 95-процентного доверительного интервала 0,5066 и 0,5018 — выше порога статистической значимости 0,5, хотя команда откровенно заявляет, что границы скорее скромные, чем преобразующие.

Эффективность – более практичный результат. RPM, предназначенный только для вывода, достиг конечного результата случайного базового уровня 0,684 за 14,88 часов, что означает ускорение в 1,61 раза, тогда как агентному варианту потребовалось 15,50 часов, что означает ускорение в 1,55 раза. Даже с учетом накладных расходов, связанных с выводами судей, скорректированные цифры остались благоприятными.

Открытые веса и честные предостережения

Команда прямо заявляет, что RPM сегодня доступны лишь частично. Компоненты являются открытыми — замороженные предварительно обученные магистральные сети без точной настройки, каркас и тесты с открытым исходным кодом, а также модели магистральных сетей с открытыми весами — но требования к «песочнице» агентного варианта и накладные расходы на пилотные эксперименты означают, что большинство лабораторий начнут с версии, предназначенной только для вывода. Исследователи также отмечают, что этапы отладки в агентском варианте возвращаются к случайному выбору, поскольку пилотное время конкурирует с собственными часами агента.

Большее значение может быть направленным. По мере того как автономные исследовательские агенты переходят от демонстраций к ежедневному использованию в промышленных лабораториях, дефицитным ресурсом становятся уже не идеи, а часы работы графического процессора и методы, которые со временем выжимают больший прогресс из фиксированного бюджета вычислений. Ранжирование перед стартом — это простая идея, и цифры AIRS-Bench показывают, что эта идея работает достаточно хорошо, чтобы иметь значение.

Будьте впереди ИИ

Следите за исследованиями, которые формируют модели завтрашнего дня, на [AI Buzz Wire] (https://aibuzzwire.news).

Читать больше новостей об искусственном интеллекте →