Timu ya watafiti kutoka FAIR katika Meta, Chuo Kikuu cha Oxford na Chuo Kikuu cha London kimeanzisha Miundo ya Upendeleo ya Utafiti wa AI (RPMs), mbinu ya kuamua ni majaribio gani ya kujifunza kwa mashine ambayo wakala wa utafiti anayejitegemea anapaswa kufanya. Badala ya kutabiri jinsi jaribio litakavyopata alama, RPM huweka alama za watahiniwa ambao hawajatekelezwa na kuchagua anayeahidi zaidi, zamu ambayo timu inasema inashughulikia shida halisi katika utafiti unaoendeshwa na AI: hesabu ya uthibitishaji, kulingana na ripoti ya MarkTechPost juu ya kazi hiyo.

Wazo hilo linatua wakati ambapo mawakala wa utafiti wanaweza tayari kupendekeza, kutekeleza na kupata matokeo ya majaribio yao wenyewe. Uzalishaji wa mawazo ni nafuu; utekelezaji sio. Kufunza mgombea mmoja kunaweza kutumia saa hadi siku za muda wa GPU, kwa hivyo wakala bila shaka anapendekeza majaribio mengi zaidi ya anayoweza kumudu kufanya. Ambayo watahiniwa hutekelezwa ni, kama timu inavyoiweka, kigezo halisi cha maendeleo ya utafiti. Kwa maabara zinazotazama bili zao za kukokotoa zikipanda, uundaji huo ndio sababu hasa kazi hii inavuta uangalizi katika maendeleo ya hivi punde ya AI katika uhandisi otomatiki wa utafiti.

Kwa nini uteuzi wa majaribio ndio kikwazo

Timu iligundua kuwa miundo ya lugha haiwezi kutegemewa katika kutabiri metriki kamili au matokeo ya utekelezaji. Muundo hauwezi kuangalia jaribio la mtahiniwa na kutabiri kwa usahihi alama atakayopata. Kinachoweza kufanya, watafiti waligundua, ni hakimu ni yupi kati ya watahiniwa wawili ndiye dau bora - kulinganisha jamaa badala ya utabiri kamili. RPM zimejengwa kuzunguka tofauti hiyo: kamwe hazitabiri alama, zinaweka tu.

Mfumo huu unaendeshwa ndani ya AIRA-dojo, kiunzi cha utafutaji wa miti kwa njia huria ambacho huzalisha majaribio ya kujifunza kwa mashine kupitia uteuzi wa wazazi wenye uchu na Rasimu, Boresha na Utatuzi waendeshaji, na kurudisha nodi ya juu zaidi ya uthibitisho mwishoni. Benchmark, AIRS-Bench, pia ni chanzo wazi. Kiunzi na muundo wa upendeleo hutumia Qwen3.6-27B kama uti wa mgongo wao, ambao timu inabaini kuwa ni uzani wazi.

Jinsi mashindano ya mtoano yanavyofanya kazi

Badala ya kutoa jaribio la mtoto mmoja na kulitekeleza, wakala hutuma opereta mara 15 sambamba na kutoa watahiniwa 15 ambao hawajatekelezwa. Kisha RPM inawalinganisha kwa pande mbili katika mashindano ya mtoano, na mshindi pekee ndiye atauawa. Kila ulinganisho unategemea nodi za muktadha zilizokusanywa kwa upana-kwanza wa mti uliogunduliwa, na kila mgombea akionyeshwa pamoja na alama za uthibitishaji za mababu zake, kwa hivyo hakimu anasababu kutokana na historia halisi ya utafutaji ya wakala badala ya ombwe.

Karatasi inaelezea lahaja mbili zilizo na bajeti tofauti za hesabu:

  • Inference-only RPM — LLM-as-a-jaji ambayo inalinganisha mipango ya mgombea, msimbo na historia ya utafutaji katika pasi moja. Kidokezo chake kiliboreshwa na MIPROv2 kutoka kwa mfumo wa DSPy na kuunganishwa kwenye kile timu inachokiita rubriki ya mpelelezi mkuu: inastahimili hitilafu zinazoweza kurekebishwa, hutuza upanuzi na kuadhibu maelekezo yasiyo ya lazima ya utafiti. Usahihi wa kulinganisha nje ya mtandao ulipima asilimia 57.7 hadi 59.0.
  • Agent RPM — hakimu sawa pamoja na sandbox inayoiga mazingira ya wakala, ikiwa ni pamoja na H200 GPU moja, yenye zana pekee za Python, Bash na hatua ya kuwasilisha-suluhisho. Huendesha majaribio ya kiwango kidogo, kisha muundo wa maoni unapendekeza jaribio linalofuata lenye kuelimisha zaidi au kumaliza kitanzi. Marubani wamefikia 30 wakiwa na kizingiti cha sekunde 60, na bajeti ya muda iliyobaki inazidishwa kimakusudi - sekunde 2,700 zimeripotiwa dhidi ya 300 halisi - ili wakala asiache kuboresha mapema.

Jaji aliimba kama mpelelezi mkuu

Uundaji wa mchunguzi mkuu ni sehemu ya kupendeza ya utulivu. Badala ya kuwatuza watahiniwa ambao wanaonekana kuvutia zaidi, rubriki iliyoboreshwa huakisi jinsi mtafiti mwenye uzoefu anavyotumia mawazo: msimbo wa buggy unaoweza kurekebishwa hushinda msimbo uliong'aa unaofuata ncha mbaya, na maelekezo ambayo yanaiga mti uliopo yana thamani ndogo kuliko yale mapya. Rubriki hiyo, iliyojifunza kupitia uboreshaji wa haraka badala ya kurekebisha kwa mikono, ndiyo inayobeba uboreshaji, upunguzaji wa timu unapendekeza.

Matokeo ya kulinganisha kwenye AIRS-Bench

Tathmini ilihusisha kazi 20 za maandishi na jedwali za umma, kila kazi ikipewa saa 24 kwenye H200 moja na mbegu 10 nasibu. Muhimu zaidi, uti wa mgongo sawa wa Qwen3.6-27B uliwawezesha waendeshaji majaribio na modeli ya upendeleo, kwa hivyo faida hutoka kwa safu ya uteuzi badala ya modeli thabiti ya jaji. Alama za wastani za kawaida:

  • Hakuna RPM (chaguo la nasibu): 0.684
  • RPM ya makisio pekee: 0.711
  • RPM ya Kiajenti: 0.729
  • Oracle ya uthibitishaji (dari): 0.748
  • Oracle ya mtihani (dari): 0.759

Uwezekano wa kuboreshwa dhidi ya uteuzi nasibu ulikuwa 0.5923 kwa lahaja ya makisio pekee na 0.5913 kwa ile ya wakala, yenye viwango vya chini vya muda wa kuaminiwa kwa asilimia 95 vya 0.5066 na 0.5018 - juu ya kiwango cha 0.5 kwa umuhimu wa takwimu, ingawa timu ni badilifu kuliko ilivyo kadiri.

Ufanisi ni matokeo ya vitendo zaidi. RPM ya makisio pekee ilifikia alama ya mwisho ya msingi nasibu ya 0.684 katika saa 14.88, kasi ya 1.61x, huku kibadala cha kikali kilihitaji saa 15.50, kasi ya 1.55x. Hata uhasibu kwa uelekezaji wa jaji anayejisimamia mwenyewe, nambari zilizorekebishwa zilibaki kuwa nzuri.

Fungua uzani na tahadhari za uaminifu

Timu iko mbele kwamba RPM zinaweza kutumika kwa sehemu leo. Vipengee vimefunguliwa - migongo iliyogandishwa iliyogandishwa bila mpangilio mzuri, kiunzi cha chanzo huria na kielelezo, na miundo ya uti wa mgongo wa uzani wazi - lakini hitaji la lahaja la kisanduku cha mchanga na majaribio yake ya majaribio yanamaanisha kuwa maabara nyingi zingeanza na toleo la makisio pekee. Watafiti pia wanatambua kuwa hatua za Utatuzi hurudi kwenye uteuzi nasibu katika lahaja ya mawakala kwa sababu muda wa majaribio hushindana na saa ya wakala mwenyewe.

Umuhimu mkubwa zaidi unaweza kuwa wa mwelekeo. Huku mawakala wa utafiti wanaojiendesha wakihama kutoka onyesho hadi matumizi ya kila siku katika maabara za viwandani, rasilimali adimu si mawazo tena bali ni saa za GPU, na mbinu zinazobana maendeleo zaidi kutoka kwa mkusanyiko wa bajeti ya kukokotoa mahususi kwa muda. Kuweka daraja kabla ya kukimbia ni wazo rahisi, na nambari za AIRS-Bench zinapendekeza kuwa ni wazo linalofanya kazi vizuri vya kutosha.

Kaa Mbele ya AI

Endelea na utafiti unaounda miundo ya kesho katika AI Buzz Wire.

Soma habari zaidi za AI →