Sakana AI imechapisha "Zaidi ya Kuiga," karatasi ya utafiti katika jarida la Transactions on Machine Learning Research (TMLR) inayoelezea mfumo wa ukaguzi wa rika unaosaidiwa na LLM uliojengwa karibu na ugunduzi wa makosa badala ya kuiga ukaguzi wa kibinadamu, MarkTechPost iliripoti mnamo Oktoba 10. Swali kuu ambalo maabara ya Tokyo ilijiwekea jibu: badala ya kuweka alama kwenye mtambo wake unaotathminiwa kwa ukaribu, mkaguzi anaweza kupata vipi matokeo ya ukaguzi wa karibu wa AI?

Timu ilisafirisha vizalia vya programu viwili: Alama ya Kinyume cha kupima ugunduzi wa hitilafu, na mfumo wa Ukaguzi wa Tabaka Nyingi (MLR) ambao uliongoza kila jaribio la msingi. Matokeo yanafika huku kukiwa na shauku kubwa ya kutumia AI ili kuboresha ukaguzi wa rika - mchakato unaoletwa na kuongezeka kwa idadi ya uwasilishaji. Kwa zaidi kuhusu jinsi AI inavyounda upya utafiti yenyewe, fuata maendeleo yetu ya hivi punde ya AI.

Kigezo cha Makosa Yanayopandwa

Benchmark Contradiction huweka makosa katika karatasi halisi na kuangalia kama wakaguzi watazipata. Watafiti walikusanya karatasi 257 zenye leseni ya CC kutoka ACL, AISTATS, CVPR, na ICML 2025, pamoja na NeurIPS 2024, kisha wakatumia Gemini 2.5 Pro kuunda grafu ya maarifa ya madai, ushahidi na mbinu za kila karatasi.

Ukali hufafanuliwa kimuundo: umbali wa nodi kutoka kwa "dai kuu" la karatasi huamua jinsi kosa liko katikati. Sufuri ya umbali hugusa dai la msingi; umbali mkubwa hugonga maelezo ya usaidizi. GPT-4.1 kisha huandika upya nodi moja kwa kila umbali kuwa kinzani, na kutoa pointi 1,164 za data kwa jumla. Mwamuzi wa o3 hufunga kila hakiki mara kumi. Kwenye karatasi safi hakimu alifikia usahihi wa 99.9%, na ilionyesha usikivu wa 86.8% kwenye upatikanaji uliothibitishwa kwa mikono - ikimaanisha kuwa alama za ugunduzi zilizoripotiwa zinaweza kuwa za kihafidhina.

Jinsi Uhakiki wa Tabaka Nyingi Hufanya Kazi

MLR ni mfumo wa mawakala ambao huelewa karatasi kabla ya kuikosoa, iliyokusanywa kutoka kwa mawakala watatu maalumu wanaotumia miundo ya Claude ya nje ya rafu - hakuna nguzo ya GPU na urekebishaji mzuri unaohitajika:

  • Wakala wa Kiambatisho (Claude Haiku 3.5): inatoa muhtasari wa majaribio na maelezo ya utekelezaji kutoka kwa kiambatisho.
  • Wakala wa Kuhakiki Fasihi (Claude Sonnet 4, si lazima): hutumia utafutaji wa wavuti kuweka karatasi katika muktadha wa kazi ya awali.
  • Wakala wa Mapitio (Claude Sonnet 4): huendesha msururu wa jibu la pasi tatu uliochochewa na mwanasayansi wa kompyuta S. Keshav "Njia ya Pasi Tatu" - kwanza muhtasari wa hali ya juu, kisha usomaji wa kina kuashiria udhaifu, mawazo, na mapungufu, na hatimaye kuunganishwa, kusuluhisha, kusuluhisha wakala wote, na kupendekeza matokeo. orodha ya mambo ya kufanya.

PDF hupitishwa kwa miundo moja kwa moja, kwa hivyo takwimu na milinganyo huendelea kuchakatwa. Mfumo huo unasoma hadi kurasa 10 za maandishi kuu, na Sakana anakadiria gharama ya takriban $0.47 kwa kila ukaguzi.

Matokeo: Ubunifu na Chaguo la Mfano Vyote Vina umuhimu

MLR iliongoza mifumo yote minne iliyojaribiwa kwenye kigezo. Kwa hakiki nne huru, ilipata 73.43% ya ukinzani wa madai ya msingi (umbali-sifuri) na 40.95% kwa jumla. Msingi bora zaidi, mfumo unaoitwa AgentReview, ulisimamia 14.81% pekee ya madai ya msingi. Hata ukaguzi mmoja wa MLR ulipata 60.79% ya makosa ya msingi ya madai.

Utafiti wa uondoaji hutenganisha mchango wa muundo kutoka kwa uchaguzi wa mfano. Kubadilisha GPT-4.1 kwa Claude Sonnet 4 ndani ya bomba la ukaguzi lililopo kumeondoa ugunduzi wa madai ya msingi kutoka 14.56% hadi 35.40%, huku muundo wa mawakala wengi wa MLR ukiongeza takriban asilimia 25 zaidi juu kwa ukaguzi mmoja. Usahihi wa ugunduzi huanguka kadiri makosa yanavyosonga mbali na dai kuu, ambalo waandishi wanasema linaunga mkono alama za ukali.

Picha hutiwa giza kwenye data ya ulimwengu halisi. Kwenye WithdrarXiv-Check, seti ya karatasi 211 zilibatilisha karatasi za arXiv, MLR ilipata 26.07% kwenye mechi "sawa" na 16.11% kwenye mechi kamili - na mfumo unasalia kuwa hatarini kwa sindano iliyofichwa iliyopandwa katika maandishi ya muswada. Kusoma karatasi halisi zilizofutwa, kwa maneno mengine, ni ngumu zaidi kuliko kupata utata wa syntetisk.

Nini Maana ya Mapitio ya Rika

Utoaji wa vitendo zaidi wa utafiti unaweza kuwa wa kuvutia zaidi: muundo wa mfumo na chaguo la modeli ugunduzi wa hitilafu ya kuhamisha, na wakaguzi wanaosoma kabla ya kuhukumu hupata makosa makubwa zaidi kuliko yale yanayolingana na muundo kwenye maandishi ya ukaguzi wa binadamu. Tofauti hiyo ni muhimu kwa sababu kazi nyingi za awali za ukaguzi unaosaidiwa na AI ziliboreshwa ili kukubaliana na maamuzi ya binadamu - kipimo ambacho hutuza utiifu unaoonyesha kujiamini badala ya uchunguzi wa kweli.

Matokeo ya Sakana hayaonyeshi AI iko tayari kuchukua nafasi ya waamuzi wa kibinadamu - mfumo ambao hukosa makosa mengi kwenye karatasi halisi zilizofutwa na unaweza kubadilishwa kwa vidokezo vilivyopachikwa ni bora kuchukuliwa kama safu ya usaidizi, sio mamlaka. Hitilafu za usanifu za ulinganishaji pia ni safi zaidi kuliko utata wa takwimu na tafsiri zinazopingwa ambazo hutawala kutokubaliana kwa kweli katika ukaguzi wa rika, kwa hivyo utendakazi kwenye ukinzani uliopandwa unapaswa kusomwa kama dari, si ahadi.

Lakini kwa takriban $0.47 kwa kila ukaguzi, kukiwa na kiwango cha juu zaidi cha ugunduzi wa makosa ya mfumo wowote uliojaribiwa, MLR inaelekeza katika muda uliokaribia ambapo wakaguzi wa AI hushughulikia skrini ya pasi ya kwanza kwa ukinzani huku wakaguzi wa kibinadamu wakizingatia wito wa hukumu ambao mashine bado haziwezi kufanya. Majarida na waandaaji wa mkutano wanaojaribu ukaguzi unaosaidiwa na LLM sasa wana alama ya umma na msingi thabiti wa kupima mifumo yao wenyewe dhidi ya - na, ikiwa pengo kati ya 73.43% na 14.81% litasimama, ishara wazi kwamba usanifu wa kusoma ni muhimu zaidi kuliko saizi ghafi ya mfano.

---

Kaa Mbele ya AI

Pata habari za hivi punde za AI, uchanganuzi na mafanikio - yote katika sehemu moja.

Soma habari zaidi za AI →