Meta, University of Oxford 및 University College London의 FAIR 연구팀은 자율 연구 에이전트가 실제로 실행해야 할 기계 학습 실험을 결정하는 방법인 AI 연구 선호 모델(RPM)을 도입했습니다. RPM은 실험의 점수를 예측하는 대신 실행되지 않은 후보의 순위를 매기고 가장 유망한 후보를 선택합니다. MarkTechPost의 작업 보고서에 따르면 팀은 AI 기반 연구의 실제 병목 현상인 검증 컴퓨팅을 해결한다고 말합니다.

이 아이디어는 연구 대리인이 이미 자체 실험을 제안, 구현 및 점수를 매길 수 있는 순간에 시작됩니다. 아이디어 창출은 저렴합니다. 실행은 그렇지 않습니다. 단일 후보를 훈련하는 데는 몇 시간에서 며칠까지의 GPU 시간이 소요될 수 있으므로 에이전트는 필연적으로 실행할 수 있는 것보다 훨씬 더 많은 실험을 제안합니다. 어떤 후보자가 처형되는지는 팀이 프레임을 정함에 따라 연구 진행에 대한 실제 지렛대입니다. 컴퓨팅 비용이 증가하는 것을 지켜보는 실험실의 경우, 이러한 프레이밍이 바로 이 연구가 연구 자동화의 최신 AI 개발 전반에 걸쳐 주목을 받는 이유입니다.

실험 선택이 병목 현상을 일으키는 이유

팀은 절대 측정항목이나 실행 결과를 예측하는 데 언어 모델이 신뢰할 수 없다는 사실을 발견했습니다. 모델은 후보 실험을 보고 달성할 점수를 정확하게 예측할 수 없습니다. 연구자들은 두 후보 중 어느 것이 더 나은지 판단하는 것이 절대적인 예측이 아닌 상대적인 비교임을 발견했습니다. RPM은 전적으로 이러한 차이를 중심으로 구축되었습니다. RPM은 점수를 예측하지 않고 순위만 매깁니다.

시스템은 욕심 많은 부모 선택과 초안, 개선 및 디버그 연산자를 통해 기계 학습 실험을 생성하고 마지막에 가장 높은 검증 점수 노드를 반환하는 오픈 소스 진화 트리 검색 스캐폴드인 AIRA-dojo 내에서 실행됩니다. 벤치마크인 AIRS-Bench도 오픈 소스입니다. 스캐폴드와 선호 모델 모두 Qwen3.6-27B를 백본으로 사용하며, 팀은 이를 오픈 웨이트라고 기록합니다.

녹아웃 토너먼트 진행 방식

하나의 하위 실험을 생성하고 실행하는 대신 에이전트는 연산자를 15번 병렬로 적용하여 실행되지 않은 후보 15개를 생성합니다. 그런 다음 RPM은 녹아웃 토너먼트에서 이들을 쌍으로 비교하고 승자만 실행됩니다. 각 비교는 탐색된 트리의 너비 우선 탐색을 통해 수집된 컨텍스트 노드에 기반을 두고 있으며, 각 후보는 조상의 검증 점수와 함께 표시되므로 판사는 진공 상태가 아닌 에이전트의 실제 검색 기록을 기준으로 추론합니다.

이 문서에서는 컴퓨팅 예산이 서로 다른 두 가지 변형에 대해 설명합니다.

  • 추론 전용 RPM — 단일 패스로 후보 계획, 코드 및 검색 기록을 비교하는 판사로서의 LLM입니다. 프롬프트는 DSPy 프레임워크의 MIPROv2로 최적화되었으며 팀이 주요 조사자 루브릭이라고 부르는 것에 수렴되었습니다. 즉, 수정 가능한 버그를 허용하고 확장성을 보상하며 중복된 연구 방향에 불이익을 줍니다. 오프라인 비교 정확도는 57.7~59.0%로 측정됐다.
  • 에이전트 RPM — Python, Bash 및 솔루션 제출 작업으로 제한된 도구를 사용하여 단일 H200 GPU를 포함하여 에이전트 환경을 복제하는 동일한 심사위원과 샌드박스. 소규모 파일럿 실험을 실행한 후 피드백 모델이 가장 유익한 다음 실험을 제안하거나 루프를 종료합니다. 파일럿은 60초 임계값으로 30초로 제한되며, 남은 시간 예산은 의도적으로 과장되어 있습니다(실제 300초에 대해 보고된 2,700초). 따라서 에이전트는 최적화를 일찍 중단하지 않습니다.

수사관처럼 조율된 판사

주 연구자의 프레이밍은 조용히 흥미로운 부분입니다. 최대한 인상적으로 보이는 후보자에게 보상하는 대신 최적화된 루브릭은 숙련된 연구원이 아이디어를 분류하는 방법을 반영합니다. 즉, 수정할 수 있는 버그가 있는 코드가 막다른 골목을 추구하는 세련된 코드보다 뛰어나고 기존 트리를 복제하는 방향은 새로운 것보다 가치가 적습니다. 수동 조정이 아닌 신속한 최적화를 통해 학습된 루브릭이 개선을 가져오는 것이라고 팀의 절제 결과가 시사합니다.

AIRS-Bench의 벤치마크 결과

평가에는 20개의 공개 텍스트 및 표 형식 작업이 포함되었으며 각 작업에는 단일 H200 및 10개의 무작위 시드에 대해 24시간이 주어졌습니다. 결정적으로, 동일한 Qwen3.6-27B 백본이 실험 운영자와 선호 모델 모두를 지원하므로 더 강력한 판단 모델이 아닌 선택 레이어에서 이득을 얻습니다. 평균 정규화 점수:

  • RPM 없음(임의 선택): 0.684
  • 추론 전용 RPM: 0.711
  • 에이전트 RPM: 0.729
  • 검증 오라클(천장): 0.748
  • 테스트 오라클(천장): 0.759

무작위 선택에 대한 개선 확률은 추론 전용 변형의 경우 0.5923, 에이전트 변형의 경우 0.5913이었으며 95% 신뢰 구간 하한은 0.5066 및 0.5018로 통계적 유의성에 대한 임계값 0.5를 초과했지만 팀은 마진이 변형적이라기보다는 적당하다고 솔직하게 말했습니다.

효율성이 더 실용적인 결과입니다. 추론 전용 RPM은 14.88시간 만에 무작위 기준의 최종 점수인 0.684에 도달하여 속도가 1.61배 향상되었으며, 에이전트 변종은 속도가 1.55배인 15.50시간이 필요했습니다. 자체 주최 판사 추론의 오버헤드를 고려하더라도 조정된 수치는 여전히 양호한 수준을 유지했습니다.

공개 가중치와 정직한 경고

팀은 현재 RPM이 부분적으로만 배포 가능하다는 점을 솔직하게 밝혔습니다. 구성 요소는 개방형(미세 조정이 없는 동결된 사전 훈련된 백본, 오픈 소스 스캐폴드 및 벤치마크, 개방형 가중치 백본 모델)이지만 에이전트 변형의 샌드박스 요구 사항과 파일럿 실험 오버헤드로 인해 대부분의 실험실은 추론 전용 버전으로 시작하게 됩니다. 연구원들은 또한 파일럿 시간이 에이전트 자체 시계와 경쟁하기 때문에 디버그 단계가 에이전트 변형에서 무작위 선택으로 되돌아간다는 점에 주목했습니다.

더 큰 의미는 방향성일 수 있습니다. 자율 연구 에이전트가 데모에서 산업 실험실의 일상적인 사용으로 이동함에 따라 부족한 리소스는 더 이상 아이디어가 아니라 GPU 시간과 시간이 지남에 따라 고정된 컴퓨팅 예산에서 더 많은 진전을 짜내는 방법입니다. 달리기 전에 순위를 매기는 것은 간단한 아이디어이며, AIRS-Bench 수치는 이것이 중요할 만큼 효과적인 아이디어임을 시사합니다.

AI보다 앞서 나가세요

AI Buzz Wire에서 미래의 모델을 형성하는 연구를 계속 확인하세요. AI 뉴스 자세히 보기 →