Výzkumný tým z FAIR v Meta, University of Oxford a University College London představil AI Research Preference Models (RPM), metodu pro rozhodování, které experimenty strojového učení by měl autonomní výzkumný agent skutečně spustit. Místo předpovídání, jak experiment dopadne, RPM seřadí neprovedené kandidáty a vybere toho nejslibnějšího, posun, který tým říká, řeší skutečné úzké hrdlo ve výzkumu řízeném umělou inteligencí: ověřovací výpočet, podle zprávy MarkTechPost o práci.

Myšlenka přichází ve chvíli, kdy výzkumní agenti již mohou navrhovat, implementovat a hodnotit své vlastní experimenty. Generování nápadů je levné; provedení není. Školení jednoho kandidáta může zabrat hodiny až dny GPU času, takže agent nevyhnutelně navrhuje mnohem více experimentů, než si může dovolit spustit. Kteří kandidáti budou popraveni, to je, jak to tým rámuje, skutečnou pákou na pokrok ve výzkumu. Pro laboratoře, které sledují, jak jejich výpočetní účty stoupají, je toto uspořádání přesně tím, proč tato práce přitahuje pozornost napříč nejnovějším vývojem umělé inteligence v oblasti automatizace výzkumu.

Proč je výběr experimentu úzkým hrdlem

Tým zjistil, že jazykové modely jsou nespolehlivé při předpovídání absolutních metrik nebo výsledků provádění. Model se nemůže podívat na kandidátský experiment a přesně předpovědět skóre, kterého dosáhne. Co to může udělat, zjistili vědci, je posoudit, který ze dvou kandidátů je lepší sázkou – spíše relativní srovnání než absolutní předpověď. RPM jsou postaveny výhradně na tomto rozdílu: nikdy nepředpovídají skóre, pouze hodnotí.

Systém běží uvnitř AIRA-dojo, open-source evolučního stromového vyhledávacího lešení, které generuje experimenty se strojovým učením prostřednictvím chamtivého výběru rodičů a operátorů Draft, Improve a Debug, přičemž na konci vrací uzel s nejvyšším ověřovacím skóre. Benchmark, AIRS-Bench, je také open source. Jak lešení, tak preferenční model používají jako páteř Qwen3.6-27B, což tým poznamenává, že jsou otevřené váhy.

Jak funguje vyřazovací turnaj

Namísto generování jednoho podřízeného experimentu a jeho provádění agent použije operátora 15krát paralelně, aby vytvořil 15 neprovedených kandidátů. RPM je pak porovná po párech ve vyřazovacím turnaji a provede se pouze vítěz. Každé srovnání je založeno na kontextových uzlech shromážděných při první procházce prozkoumaným stromem, přičemž každý kandidát je zobrazen vedle ověřovacího skóre jeho předků, takže soudce argumentuje na základě skutečné historie hledání agenta spíše než ve vzduchoprázdnu.

Článek popisuje dvě varianty s různými výpočetními rozpočty:

  • Inference-only RPM – LLM jako soudce, který porovnává kandidátské plány, kód a historii vyhledávání v jediném průchodu. Jeho prompt byl optimalizován pomocí MIPROv2 z rámce DSPy a konvergoval k tomu, co tým nazývá rubrikou hlavního výzkumníka: toleruje opravitelné chyby, odměňuje rozšiřitelnost a penalizuje nadbytečné směry výzkumu. Přesnost offline srovnání byla naměřena 57,7 až 59,0 procent.
  • Agentic RPM — stejný soudce plus karanténa, která klonuje prostředí agenta, včetně jediného GPU H200, s nástroji omezenými na Python, Bash a akci předložit řešení. Provádí pilotní experimenty v malém měřítku, poté model zpětné vazby buď navrhne nejinformativnější další experiment, nebo ukončí cyklus. Piloti jsou omezeni na 30 s prahem 60 sekund a rozpočet zbývajícího času je záměrně nadsazený – 2 700 sekund hlášených oproti skutečným 300 – takže agent nepřestane optimalizovat předčasně.

Soudce naladěný jako hlavní vyšetřovatel

Rámování hlavního vyšetřovatele je tiše zajímavá část. Spíše než odměňování kandidátů, kteří vypadají maximálně působivě, optimalizovaná rubrika odráží to, jak zkušený výzkumník třídí nápady: chybný kód, který lze opravit, překonává vyleštěný kód ve slepé uličce a pokyny, které duplikují stávající strom, mají nižší cenu než ty nové. Ablace týmu naznačují, že tato rubrika, naučená rychlou optimalizací spíše než ručním laděním, přináší zlepšení.

Srovnávací výsledky na AIRS-Bench

Hodnocení zahrnovalo 20 veřejných textových a tabulkových úloh, přičemž každá úloha byla zadána 24 hodin na jeden H200 a 10 náhodných semen. Zásadní je, že stejná páteř Qwen3.6-27B poháněla jak operátory experimentu, tak model preferencí, takže zisky pocházejí spíše z výběrové vrstvy než ze silnějšího modelu soudců. Průměrné normalizované skóre:

  • Žádné otáčky za minutu (náhodný výběr): 0,684
  • RPM pouze pro odvození: 0,711
  • Agent RPM: 0,729
  • Ověřovací orákulum (strop): 0,748
  • Testovací orákulum (strop): 0,759

Pravděpodobnost zlepšení oproti náhodnému výběru byla 0,5923 pro variantu pouze inference a 0,5913 pro agentní variantu, s 95procentním intervalem spolehlivosti 0,5066 a 0,5018 – nad prahem statistické významnosti 0,5, ačkoli tým je upřímný, že okraje jsou spíše skromné než transformativní.

Praktičtějším výsledkem je efektivita. Pouze inference RPM dosáhla konečného skóre náhodného výchozího stavu 0,684 za 14,88 hodin, což je 1,61x zrychlení, zatímco agentní varianta potřebovala 15,50 hodiny, 1,55x zrychlení. I při zohlednění režijních nákladů vyplývajících ze samoobslužného soudce zůstala upravená čísla příznivá.

Otevřené váhy a upřímná upozornění

Tým si předem uvědomuje, že RPM jsou dnes nasaditelné pouze částečně. Komponenty jsou otevřené – zmrazené předtrénované páteře bez jemného doladění, open source lešení a benchmark a modely páteřní sítě s otevřenými váhami – ale požadavek na sandbox varianty agenta a její režie pilotního experimentu znamenají, že většina laboratoří začne s verzí pouze pro odvození. Výzkumníci také poznamenávají, že kroky ladění se v agentní variantě vracejí k náhodnému výběru, protože pilotní čas soutěží s vlastními hodinami agenta.

Větší význam může být směrový. Jak autonomní výzkumní agenti přecházejí od ukázek ke každodennímu použití v průmyslových laboratořích, vzácným zdrojem již nejsou nápady, ale hodiny GPU a metody, které časem vytlačí větší pokrok z pevně stanoveného výpočetního rozpočtu. Hodnocení před spuštěním je jednoduchý nápad a čísla AIRS-Bench naznačují, že je to nápad, který funguje dostatečně dobře, aby na něm záleželo.

Stay Ahead of AI

Držte krok s výzkumem, který utváří modely zítřka na AI Buzz Wire.

Přečtěte si další zprávy o AI →