Watafiti wa Nvidia wameunda mfumo wa wakala ambao ulisukuma Claude Opus 5 ya Anthropic hadi alama kamili ya 100% kwenye ARC-AGI-3, mojawapo ya vigezo vinavyohitaji sana mwingiliano wa hoja katika AI - kwa kutumia modeli ile ile inayopata alama 30% inapojiendesha yenyewe. Matokeo, iliyochapishwa Ijumaa kwenye Blogu ya Kiufundi ya Nvidia, ni ushahidi dhabiti zaidi kwamba programu inayozunguka muundo wa mipaka ni muhimu kama vile mtindo yenyewe. Kwa mtu yeyote anayefuatilia maendeleo ya hivi punde ya AI, inaashiria mabadiliko ambapo faida ya ushindani katika AI ya mawakala huishi.
Mfumo huu unaitwa AVO, kifupi cha Waendeshaji Tofauti za Kiajenti, na ni mtazamo wa Nvidia juu ya usanifu wa madhumuni ya jumla kwa mawakala wanaojiendesha wa upeo wa macho - AI ambayo inaweza kukaa kazini kwa saa au siku badala ya kujibu dodoso moja. Kwenye seti ya umma ya ARC-AGI-3, AVO ilirekodi alama 100.00 RHAE katika mazingira yote 25 ya mchezo, na kukamilisha viwango vyote 183 katika vitendo 6,624 vya mazingira kwa kutumia Claude Opus 5 kama muundo wake wa nyuma.
ARC-AGI-3 Inajaribu Nini Hasa
ARC-AGI-3 ni kigezo shirikishi cha hoja kilichoundwa na msingi wa Tuzo ya ARC. Wakala hutupwa katika mazingira yasiyojulikana, yanayofanana na mchezo bila maagizo, hakuna sheria zilizotajwa, na hakuna lengo lililotajwa. Inabidi ichunguze kupitia majaribio na makosa, kukisia jinsi mazingira yanavyofanya kazi, kubaini maana ya "kushinda", na kisha kuchukua hatua kwa ufanisi ili kuendelea kupitia viwango vigumu zaidi.
Kipimo cha alama cha alama, Ufanisi wa Hatua ya Kibinadamu (RHAE), huchanganya ukamilisho wa kazi na jinsi wakala anavyopoteza vitendo vichache ikilinganishwa na wachezaji wanaocheza mara ya kwanza. Hilo linaifanya kuwa jaribio la kikatili la uhuru endelevu: wakala lazima akumbuke alichojifunza, apone makosa, na kupanga bajeti ya vitendo vyake kwa uangalifu katika kipindi chote.
Nambari ya kichwa cha Nvidia inapata muktadha kutoka kwa kulinganisha. VISTA, uunganisho wa awali wa mwingiliano wa moja kwa moja ambao pia ulitumia Claude Opus 5, ulikamilisha viwango sawa 183 vilivyowekwa na umma katika vitendo 7,542 vya mazingira. AVO ilihitaji takriban 12% hatua chache ili kumaliza kazi, kulingana na chapisho la blogi la Nvidia.
Kuanzia Kernels za GPU hadi Michezo Isiyojulikana
AVO haikuundwa kwa mafumbo. Nvidia alionyesha kwanza usanifu juu ya uboreshaji wa kerneli ya GPU, kikoa ambapo mabadiliko madogo ya nambari yanaweza kuvunja usahihi, tabia ya kumbukumbu, na matokeo kwa njia zisizotabirika. Katika utafiti mmoja wa makinikia, AVO iliendelea kwa siku saba, iligundua zaidi ya maelekezo 500 ya uboreshaji, na kuweka matoleo 40 ya kernel. Kwenye mifumo ya NVIDIA DGX B200, kokwa za usikivu za vichwa vingi zilifanikisha utendakazi wa cuDNN kwa hadi 3.5% na FlashAttention-4 hadi 10.5%. Kisha wakala alibadilisha kerneli yake iliyobadilishwa kwa umakini wa maswali ya vikundi katika takriban dakika 30 za kazi ya ziada ya uhuru.
Kitanzi sawa cha msingi - kagua, panga, tekeleza, jaribu, tathmini - kisha ulielekezwa kwa ARC-AGI-3 na kiolesura cha kazi pekee kilibadilishwa. Taratibu mbili zilipitishwa. Ya kwanza ni kumbukumbu endelevu, ambayo huhifadhi utekelezaji wa awali, matokeo ya tathmini, matokeo ya mkusanyaji na wasifu, na hoja zilizokusanywa, kwa hivyo wakala anaweza kuanza tena kutoka kwa hali yake ya sasa badala ya kuunda tena muktadha kutoka mwanzo. Wa pili ni msimamizi, wakala wa pili ambaye hutazama mwelekeo wa jumla na kuingilia kati wakati maendeleo yanakwama.
Msimamizi Ndiye Mafanikio
TechCrunch, ambayo ilihoji Adel El Hallak wa Nvidia, makamu wa rais wa bidhaa katika kitengo cha AI cha kampuni, ilionyesha msimamizi kama kiungo muhimu zaidi. "Inakaribia kuwa kama Mkurugenzi Mtendaji kumgusa wakala anapoacha mwelekeo au anapoanza kuchunguza njia ambayo inaweza kusababisha mwisho mbaya, au kuchunguza tena njia ambayo alikuwa amepita hapo awali," El Hallak aliambia chapisho.
Pengo la utendaji ni kubwa. Jaribio la Nvidia liligundua kuwa Claude Opus 5 bila kuunganisha kwa hali ya juu alisimamia alama 30% kwenye ARC-AGI-3 - matokeo bora kati ya mifano tupu iliyojaribiwa, lakini hakuna karibu na kukimbia kamili. Mitindo ya OpenAI imepata alama ya chini ya 10% kwenye kiwango, na kampuni ilichapisha utafiti wake mwezi uliopita kuonyesha kuwa kurekebisha mipangilio miwili ya kuunganisha iliongeza alama zake mara tatu. Hakuna usanidi wa modeli pekee ambao umekaribia 100% ambayo AVO ilipata.
Hasa, usanidi wa AVO ulifanya kazi katika muundo wa maandishi pekee: kila uchunguzi ulitolewa kama gridi ya maandishi ya 64x64, bila taswira au tokeni za picha zilizotumwa kwa muundo. Nguvu ya hoja ilitoka kwa kitanzi karibu na mfano, sio kutoka kwa mtazamo wa aina nyingi.
Kwa Nini Tasnia Inaweka Kamari kwenye Harnesses
Ugunduzi huo unafanyika huku kukiwa na wimbi la ushahidi kwamba miundombinu ya wakala, si uwezo wa kielelezo mbichi, ndio kikwazo cha sasa cha AI inayojiendesha. Databricks ilichapisha utafiti wa ulinganishaji mwezi Julai unaoonyesha kuwa unganisho unaathiri pakubwa utendakazi na gharama. "Unaweza kuchagua modeli sawa lakini viunga tofauti, na utapata gharama kubwa zaidi ikiwa utatumia kuunganisha vibaya," Mkurugenzi Mtendaji wa Databricks Ali Ghodsi aliiambia TechCrunch. "Hiyo yenyewe inaweza mara 2 gharama yako."
El Hallak alianzisha hoja pana ya Nvidia katika suala la uwazi. "Tunaamini kuwa na mrundikano wa wakala wazi - ambapo una udhibiti katika kuunganisha, katika miundombinu, katika muda wote wa utekelezaji - ndicho kinachohitajika kwetu kupeleka mfumo wa ikolojia mbele na kwa usalama," alisema. Nvidia ina vipande vya ukubwa wa wazi vya teknolojia ya kuunganisha chini ya chapa yake ya NeMo, na utafiti wa AVO umeandikwa kwenye karatasi kwenye arXiv.
Kigezo chenye Historia
ARC-AGI-3 imekuwa kielelezo katika ushindani wa maabara ya mpaka. Hapo awali OpenAI ilidai matokeo dhabiti kwa muundo wake wa GPT-5.6 Sol kwenye kielelezo, ikitoa uchunguzi juu ya mipangilio ya tathmini iliyotumika. Matokeo ya Nvidia yanapinga mjadala huo kwa maana moja - haidai mtindo mzuri zaidi, ni wakala aliyeboreshwa tu karibu na uliopo.
Ujumbe kwa wasanidi programu na biashara zinazounda bidhaa za mawakala ni wa moja kwa moja: uteuzi wa miundo bado ni muhimu, lakini muundo wa mfumo sasa ndio unaoamua kama muundo wa mipaka utatoa matokeo ya mipaka. Kama Nvidia anavyosema, kutathmini modeli si sawa na kutathmini wakala - na majedwali ya alama za 2026 yanazidi kuwatuza wahandisi wanaounda kiunzi.
Kaa Mbele ya AI
Usanifu wa mawakala unaenda kasi zaidi kuliko hapo awali, na pengo kati ya kuunganisha nzuri na mbaya sasa inapimwa kwa pointi za benchmark na dola halisi. Fuata AI Buzz Wire kwa chanjo ya kila siku, iliyothibitishwa na chanzo ya utafiti wa AI, vigezo na uzinduzi wa bidhaa.
Soma habari zaidi za utafiti wa AI →