Utafiti wa Microsoft umetoa Orchard, mfumo huria wa kujenga, mafunzo, na kutathmini mawakala wa AI wanaojiendesha ambao kampuni inasema huruhusu modeli ndogo za uzani wazi kukaribia utendaji wa mifumo ya mipakani zaidi ya mara kumi ya ukubwa wao. Mradi huo, uliofafanuliwa kwa kina katika chapisho la blogi mnamo Agosti 3, 2026, ni zabuni kubwa zaidi ya kampuni bado kutoa jumuiya ya utafiti mpana aina ya miundombinu ambayo, hadi sasa, kwa kiasi kikubwa imesalia imefungwa ndani ya maabara ya wamiliki.
Toleo hilo linakuja huku tasnia ya AI inapohama kutoka kwa kujibu maswali tuli kuelekea kwa mawakala ambao wanaweza kupanga, kufikiria, na kuchukua hatua katika mazingira ya hatua nyingi. Kwa maelezo zaidi kuhusu jinsi uga unaelekea kwenye mifumo inayojitegemea, angalia habari zetu za hivi punde za tasnia ya AI.
Orchard ni nini hasa
Katikati ya mradi huo ni Orchard Env, huduma ya mazingira nyepesi, yenye msingi wa Kubernetes ambayo hutoa vipengele vinavyoweza kutumika tena, vilivyotengwa kwa mawakala wanaoendesha kwa mizani. Kulingana na Microsoft, huduma hiyo hiyo inaweza kusaidia mawakala wa uhandisi wa programu, mawakala wa kuvinjari wavuti na mawakala wasaidizi wa kibinafsi bila kubadilishwa. Hushughulikia kila kitu kuanzia kukusanya data ya mafunzo hadi utoaji na tathmini ya mafunzo ya kuimarisha.
Uamuzi muhimu wa usanifu ni kwamba mazingira ya wakati wa utekelezaji yanachukuliwa kama huduma ya pekee, inayoweza kutumika tena badala ya miundombinu iliyopachikwa ndani ya mfumo mahususi wa mafunzo. Kwa sababu Orchard Env iko kwenye Kubernetes, inaweza kuunda, kudhibiti na kuondoa maelfu ya vyombo vilivyojitenga kwa sambamba. Timu zinaweza kutambulisha vigezo vipya, mifumo ya mawakala au kanuni za mafunzo bila kujenga upya miundombinu ya msingi kuanzia mwanzo.
Mafunzo ndani ya harnesses halisi
Mojawapo ya vipengele bainifu vya Orchard ni uwezo wake wa kuwafunza mawakala moja kwa moja ndani ya viunga vya kusambaza ambavyo watatumia katika uzalishaji. Mawakala wa leo wenye uwezo zaidi hawafanyi kazi kama kielelezo tupu. Hufanya kazi kupitia viunga vya hali ya juu kama vile Codex, OpenClaw, na ZeroClaw ambazo hudhibiti mawazo ya pande nyingi, matumizi ya zana na miunganisho ya mifumo ya nje.
Zana za mafunzo huria kwa kawaida haziwezi kushughulikia viunganishi hivi vya hali, na vya michakato mingi, na hivyo kuwalazimisha watafiti kutoa mafunzo kwenye hali iliyorahisishwa ya kusimama na kisha kupeleka katika mazingira halisi, ambayo husababisha kutolingana kati ya mafunzo na uwekaji. Orchard hufunga pengo hili: seva mbadala uzani mwepesi hurekodi simu za muundo wa kifaa kama data ya mafunzo huku kila uchapishaji ukiendeshwa katika chombo chake, na hivyo kuruhusu wakala kufunzwa kutoka mwisho hadi mwisho moja kwa moja katika kuunganisha atakayotumia katika uzalishaji.
Mapishi matatu mahususi ya kikoa
Ili kuonyesha mbinu hiyo, Microsoft ilitoa mtiririko wa mafunzo matatu.
Orchard-SWE: uhandisi wa programu
Orchard-SWE inalenga mojawapo ya mipangilio inayohitajika zaidi kwa mawakala wanaojitegemea: hoja za hatua nyingi juu ya misingi halisi ya msimbo. Iliundwa kwa kutumia mfumo wa Mini-SWE-Agent na kutathminiwa kwenye SWE-benchi Imethibitishwa, alama inayopima uwezo wa modeli wa kusogeza, kutambua na kurekebisha misingi ya msimbo ya ulimwengu halisi.
Ili kutoa mafunzo kwa mfumo huu, Microsoft ilitoa mwingiliano wa mawakala 107,000 kutoka kwa miundo miwili ya hali ya juu ya uzani wazi, MiniMax-M2.5 na Qwen3.5-397B, inayoshughulikia masuala mbalimbali ya GitHub. Kwa kutumia mbinu inayoitwa urekebishaji wa ugawaji wa mikopo unaosimamiwa, mfumo hujifunza kutokana na sehemu zinazozalisha za majaribio ya kiasi badala ya kuzitupilia mbali kabisa.
Matokeo huhamisha muundo kutoka msingi wa 61.4% kwenye benchi ya SWE Imethibitishwa hadi 69.1% kwa mafunzo ya uimarishaji, na 69.7% yenye mbinu za zawadi nyingi. Kwa kuweka upya muundo wa thamani, takwimu hufikia 73.0% - hali mpya ya kisasa kati ya mifano ya chanzo huria ya saizi inayolingana, kwa kutumia tu takribani vigezo bilioni 3 amilifu.
Orchard-GUI: urambazaji wa wavuti
Orchard-GUI hufunza kielelezo cha lugha ya maono cha bilioni 4 kama wakala wa kivinjari. Licha ya kutumia kiasi kidogo cha usimamizi - maandamano 400 yaliyochanganywa pamoja na kazi 2,200 za mafunzo ya wazi - modeli hiyo ilifikia 74.1% kwenye WebVoyager, 67.0% kwenye Online-Mind2Web, na 64.0% kwenye DeepShop, kwa wastani wa 68.4%. Microsoft inasema matokeo haya yanaiweka kati ya mawakala hodari wa tovuti huria hadi sasa.
Orchard-Claw: kazi za msaidizi wa kibinafsi
Orchard-Claw inaangazia kazi za kila siku za tija kama vile kusoma na kuandaa barua pepe, kudhibiti kalenda na kutafuta maelezo. Imefunzwa kwa kazi 200 tu za usanifu na kutathminiwa kwa kipimo cha Claw-Eval, ilikamilisha 59.6% ya kazi zilizopewa hadi majaribio matatu, na kupanda hadi 73.9% ilipooanishwa na mfumo thabiti wa wakala wa ZeroClaw.
Kwa nini matokeo ya modeli ndogo ni muhimu
Nambari za ulinganifu zinajulikana kwa sababu zinatoka kwa miundo iliyo na takribani vigezo amilifu bilioni 3 hadi 4 - ndogo sana kuliko mifumo ya mipaka kutoka OpenAI, Anthropic, na Google ambayo inatawala bao za wanaoongoza. Hoja ya Microsoft ni kwamba miundombinu sahihi ya mafunzo na mazingira yanaweza kuziba pengo kubwa, na kufanya mifumo yenye uwezo wa mawakala kufikiwa na watafiti na mashirika ambayo hayawezi kumudu kutoa mafunzo au kuendesha miundo mikubwa zaidi ya wamiliki.
Kando ya modeli na utiririshaji wa kazi, Microsoft ilitoa data ya mafunzo na mbinu za tathmini zilizotumiwa kuziunda, kwa lengo lililowekwa la kusaidia jumuiya pana ya utafiti kujenga na kusoma mifumo wazi ya mawakala. Kazi hiyo iliongozwa na Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, na Jianfeng Gao wa Utafiti wa Microsoft.
Kaa Mbele ya AI
Utoaji wa Orchard wa Microsoft unaashiria kwamba miundombinu nyuma ya AI ya wakala wa mpaka inaanza kupata demokrasia. Soma zaidi habari zinazochipuka za AI na Soma habari zaidi za AI →
