Z.ai, kampuni ya kijasusi ya Beijing yenye makao yake makuu mjini Beijing pia inajulikana kama Zhipu, imetoa GLM-5.3, toleo jipya la mtindo wake mkuu ambao kampuni hiyo inasema ndio mfumo wake wa uzani wazi wenye uwezo zaidi wa uhandisi wa programu - na ambao bila kutarajiwa umekuza ujuzi wa kutisha wa usalama wa mtandao. Iliyotangazwa mnamo Agosti 14 na kuelezewa kwa kina katika chapisho la blogu ya kampuni, GLM-5.3 imeundwa kwa msingi sawa wa kigezo cha takriban bilioni 700 kama mtangulizi wake GLM-5.2, iliyotolewa Juni. Kila uboreshaji, kampuni inasema, unatokana na mafunzo ya baada ya mafunzo badala ya msingi mkubwa. Toleo hili ni la hivi punde zaidi katika wimbi la modeli za Uchina za uzani huria zinazolenga kushinda mifumo iliyofungwa kutoka kwa Anthropic na OpenAI. Kwa kifuatiliaji cha AI Buzz Wire, GLM-5.3 ni ishara tosha kwamba mipaka ya uzani huria inaziba mwango wa usimbaji kwa kasi zaidi kuliko ilivyotarajiwa na wengi.
Faida Zilizojengwa Kabisa kwenye Mafunzo ya Baada ya Mafunzo
Z.ai haina ukweli kuhusu mbinu yake na GLM-5.3: "Kuongeza mafunzo baada ya mafunzo ndiyo tu tulifanya." Kampuni ilibeba rundo la uimarishaji wa mafunzo iliyoletwa na GLM-5.2 - ikijumuisha IndexShare kwa usindikaji bora wa muktadha mrefu, SAO kwa uimarishaji wa ujifunzaji juu ya kazi za upeo wa macho, na mfumo wa chanzo huria unaoitwa slime kwa mafunzo ya kiwango kikubwa cha usawa. Katika mwezi uliopita ilimwaga mazingira zaidi, kazi mbalimbali zaidi, na kukokotoa kwenye mrundikano huo.
Malipo yanaonyeshwa katika viwango vya usimbaji. Kwenye Kituo cha Benchi 3.0, GLM-5.3 inaruka kutoka alama ya GLM-5.2 ya 4.6 hadi 28.3 - uboreshaji zaidi ya mara sita. Inachapisha matokeo ya hali ya juu ya chanzo huria kwenye Kituo cha 3.0 na kwenye Mtihani wa Mwisho wa Mawakala, na inaimarika kutoka 23.8 hadi 28.5 kwenye kipimo cha ALE-CLI cha uwezo wa mawakala. Z.ai inaripoti uboreshaji wa 50% zaidi ya GLM-5.2 kwenye benchi yake ya ndani ya Z.ai Code, alama ya kibinafsi iliyoundwa kutathmini mawakala wa usimbaji katika mazingira halisi ya maendeleo na kupunguza hatari ya kuambukizwa kutoka kwa seti za majaribio za umma.
Muhimu, faida huja na ufanisi bora wa ishara, sio tu matokeo bora. Katika juhudi za Juu, GLM-5.3 inafikia kukamilika kwa 31.4% kwenye alama ya ndani kwa takriban tokeni 50,000 za matokeo kwa kila kazi, ambayo Z.ai inasema inapita Claude Opus 4.8 ya Anthropic kwa 29.5% na tokeni 120,000. GLM-5.3 bado inafuata Claude Fable 5 ya hali ya juu zaidi ya Anthropic, ambayo inafikia 39.5% kwa juhudi nyingi zaidi.
Hatua Isiyotarajiwa katika Uwezo wa Mtandao
Matokeo ya kuvutia zaidi kutoka kwa GLM-5.3 hayako katika usimbaji lakini katika usalama. Z.ai ilipoongeza mafunzo ya baada ya mafunzo na kuanzisha data na mazingira ya ugunduzi hatari katika mchanganyiko wa mafunzo, ilitarajia muundo huo kuboresha katika kutafuta na kufikiria kuhusu dosari. Kilichoshangaza timu ni jinsi uwezo huo ulivyokua haraka.
GLM-5.3 haikuwa bora tu katika kugundua mende zilizotengwa; ilianza kujadiliana katika hatua nyingi za unyonyaji, ikitengeneza mipango madhubuti ya minyororo kamili ya mashambulizi. Kwenye CyberGym, alama inayopima kama modeli inaweza kutambua na kuthibitisha udhaifu kutoka kwa msimbo wa chanzo wa sanduku-nyeupe, GLM-5.3 imepata 84.5%, kutoka 77.2% ya GLM-5.2. Hayo ni matokeo bora zaidi kwenye alama, mbele ya Mythos 5 kwa 83.8% na GPT-5.6 Sol kwa 83.6%. Kwenye ExploitBench, ambayo inadai mawazo ya kina kuhusu udhaifu halisi na unyonyaji wao, GLM-5.3 zaidi ya mara mbili ya alama za GLM-5.2, na kufikia 54.4% - ingawa inasalia nyuma ya Mythos 5 kwa 78.0% na GPT-5.6 Sol kwa 76.5%.
Z.ai anaona muundo thabiti: kadiri mnyororo wa unyonyaji unavyozidi kuongezeka ndivyo alama inavyokaa, ndivyo faida inavyoongezeka zaidi ya GLM-5.2 - na pia ndivyo pengo lililobaki kwenye mipaka iliyofungwa inavyoongezeka. "Uwezo unakua kwa kasi zaidi pale ambapo tuko nyuma kabisa," kampuni hiyo inabainisha.
Ugunduzi wa Athari za Ulimwengu Halisi
Ujuzi wa mtandao hauko kwenye vigezo pekee. Z.ai inaripoti kuwa tangu GLM-5.2, imekuwa ikifanya kazi na timu kadhaa za usalama nchini China ili kujaribu miundo yake dhidi ya misingi ya kanuni za ulimwengu halisi. Baada ya ukaguzi wa kitaalamu, uchunguzi, na upunguzaji wa nakala, muundo ulibainisha udhaifu 2,436 katika miradi 269, ikijumuisha masuala 1,097 ya ukali wa kati hadi juu. Matokeo ya utafiti yanahusu kokwa za mfumo, mifumo ya uendeshaji, injini za kivinjari, miundombinu ya chanzo huria, programu za wavuti, na itifaki za mtandao - ambazo nyingi hazikutambuliwa kwa miaka au hata miongo, na kongwe zaidi ilianza takriban miaka 40.
Matokeo hayo ni mwangwi wa kazi ya Anthropic imeeleza katika utafiti wake wa usalama wa mashirika mengi, ambapo makundi mengi ya mawakala yaliyoratibiwa yalitumiwa kutafuta udhaifu katika programu huria kwa kiwango.
Fungua Uzito — Kwa Kuchelewa
Z.ai inasema itatoa uzani wa GLM-5.3 katika wiki mbili, mara tu tathmini ya usalama na ugumu kukamilika. Ucheleweshaji huo wa kimakusudi unaonyesha mvutano unaoendelea kupitia tangazo: muundo unaokuza uwezo mkubwa wa kukera mtandaoni kwa kasi zaidi kuliko waundaji wake walivyotarajia ndiyo hasa aina ya mfumo unaoibua maswali kuhusu uwasilishaji unaowajibika. Kampuni inasisitiza kwamba uthabiti wake wa utoaji-mafunzo umeboreshwa hadi kiwango cha juu cha usahihi wa nambari, na kwamba ugumu mwingi katika kuongeza umehama kutoka kwa muundo wenyewe hadi uundaji wa mazingira halisi, ya kazi yanayoweza kuthibitishwa.
Picha ya ushindani iko wazi. GLM-5.3 hupunguza umbali hadi mipaka iliyofungwa kwenye usimbaji na kazi za mawakala huku ikidai uongozi wa moja kwa moja kwa angalau alama moja kuu ya ugunduzi wa athari. Inafanya hivyo kama kielelezo cha uzani-wazi - kumaanisha kwamba, mara tu ikitolewa, uzani utapatikana bila malipo kwa mtu yeyote kupakua, kusoma na kujenga juu yake. Ikiwa uwazi huo unaharakisha maendeleo au unaibua maswala mapya ya usalama ni mjadala wa GLM-5.3 umehakikishiwa kutawala.
Kaa Mbele ya AI
Kwa matoleo mapya ya miundo ya AI, vita vya kuigwa, na uchanganuzi wa sekta, alamisho AI Buzz Wire.
Soma habari zaidi za AI →