Kigezo kipya kutoka kwa kampuni ya usalama ya maombi ya Semgrep imetoa matokeo yasiyotarajiwa: mfano wa uzani huria kutoka kwa Zhipu AI ya Uchina ilimshinda Claude wa Anthropic katika kutafuta dosari halisi za usalama katika programu. Ugunduzi huo unaongeza mafuta kwenye mjadala kuhusu kama AI yenye uwezo zaidi lazima iwe ya gharama kubwa zaidi au yenye vikwazo zaidi.
Huku muundo thabiti wa Mythos wa Anthropic ukiwa umefungwa nyuma ya marufuku ya kuuza bidhaa nje ya Marekani, timu za usalama zinazotafuta njia mbadala inayoweza kufikiwa zinageukia chaguo za uzito huria kama vile GLM 5.2 kwa ajili ya huduma ya hivi punde ya tasnia ya AI. Jaribio la Semgrep, lililochapishwa Juni 22, linapendekeza kuwa uwindaji unaweza kulipa mapema kuliko ilivyotarajiwa.
Nini Semgrep Ilijaribiwa
Semgrep alikagua safu ya miundo ya uzani wazi na mipaka kwenye benchi yake ya ndani ya utambuzi wa IDOR. IDOR - Marejeleo ya Kitu cha Moja kwa Moja kisicho salama - ni hitilafu za udhibiti wa ufikiaji ambazo huruhusu mtumiaji mmoja kufikia data ya mtumiaji mwingine. Ni ngumu sana kuzipata na uchanganuzi wa kawaida wa tuli kwa sababu dosari ni ya kimantiki badala ya kisintaksia: msimbo ni halali kitaalam, inakosa ukaguzi wa idhini.
Kampuni imekuwa ikiboresha mtiririko wa kazi kwa kugundua udhaifu huu kwa kuchanganya injini yake inayotegemea sheria na hoja za AI. Ili kutenganisha ni kiasi gani cha utendaji kinatokana na kielelezo chenyewe dhidi ya kiunzi kinachouzunguka, watafiti waliendesha seti ya miundo ya uzani wazi kwa kutumia kifaa kidogo - usanidi rahisi wa Pydantic kwa kutumia maongozi ya IDOR yanayotolewa kwa kila mtindo, bila ugunduzi wa mwisho na hakuna urambazaji ulioongozwa. Kidokezo kilitoa tu mkakati wa msingi wa utafutaji na viashiria vichache kuhusu jinsi IDOR inavyoonekana - zaidi ya "hii ndiyo nambari ya kuthibitisha, tafuta hitilafu," lakini ni ndogo sana kuliko ile ambayo mawakala wa usimbaji wa mipaka hupokea wanapoendesha ndani ya bomba kamili la Semgrep.
IDOR ni maumivu ya kichwa yanayoendelea kwa timu za usalama za maombi kwa sababu hupitia nyufa za vichanganuzi vya kawaida. Zana inayozingatia sheria inaweza kuripoti ukaguzi wa ingizo ambao haupo, lakini kuelewa ikiwa ncha mahususi hufichua data ya mtumiaji mwingine kunahitaji hoja kuhusu mantiki ya biashara ya programu - aina hasa ya uamuzi wa kimuktadha ambao miundo mikubwa ya lugha inazidi kuwa bora.
GLM 5.2 Inaongoza
Kinara zaidi kilikuwa GLM 5.2, mtindo wa uzani wa wazi wa Zhipu AI. Bila kukimbia chochote isipokuwa haraka tu, ilipata 39% F1 kwenye utambuzi wa IDOR - ikishinda 32% ya Claude Code kwa alama saba kamili. Kulingana na Semgrep, modeli ya uzani wa wazi pia ilimzidi Claude Opus 4.8 kwenye kazi, na kuifanya kuwa chaguo kali zaidi lisilo la kikomo lililojaribiwa.
Uchumi pia ulikuwa wa kushangaza. Kwa bei ya GLM 5.2, uendeshaji uligharimu takriban $0.17 kwa kila udhaifu uliopatikana. Kwa mashirika ambayo yanaweza kuchanganua maelfu ya vidokezo, Semgrep alibainisha kuwa gharama ya kila mdudu mara nyingi ndiyo huamua kama mbinu ya kugundua ni ya vitendo kwa kiwango kikubwa.
Wagombea wengine wa uzani wa wazi walifuata nyuma zaidi. MiniMax M3 ilipata 23% F1 na Kimi K2.7 Code ilitua kwa 22%, zote zikikusanyika chini ya Claude Code. Semgrep alibainisha GLM 5.2 kama ubaguzi dhahiri badala ya tokeo wakilishi la kategoria ya uzani huria.
Kuunganisha Bado Ni Mambo
Licha ya ushindi wa uzani wa wazi katika kitengo cha ghafi, bomba la Semgrep mwenyewe lililoundwa na kusudi lilibaki kuwa kiongozi wa jumla. Usanidi wa aina nyingi za kampuni - ambao unachanganya hoja za AI na ugunduzi unaozingatia sheria na uhesabuji wa mwisho wa muundo - ulipata 53% hadi 61% F1, kulingana na usanidi. Pengo hilo linasisitiza swali la asili la watafiti: ni kiasi gani cha utendaji wa ugunduzi wa hatari ni mfano, na ni kiasi gani cha usanifu unaoizunguka?
Jibu linaonekana kuwa "zote mbili, lakini zaidi ya watu kudhani ni kuunganisha." GLM 5.2 ilithibitisha kuwa kielelezo chenye uwezo kinaweza kufanya kazi ya maana kikiwa na usaidizi mdogo, lakini bado hakiwezi kulingana na mfumo ulioundwa mahususi kwa tatizo.
Timu ya Semgrep - ambayo ni pamoja na watafiti Paxton-Fear, Seth Jaksik, Brenden Noblitt, na Erik Buchanan - walisema "walishtushwa sana" kwamba mwanamitindo wa uzani wa wazi anayeendesha haraka haraka alimpita wakala wa kuweka alama kwenye mipaka kwa kazi nzito ya usalama.
Hadithi Nyumbani
Kigezo kinabeba uzito ulioongezwa dhidi ya mandhari ya sasa ya kijiografia. Kichwa cha chapisho la blogu - "Tuna Hadithi Nyumbani" - ni rejeleo moja kwa moja kwa ukweli kwamba muundo wa Mythos unaozingatia usalama wa mtandao wa Anthropic haupatikani kwa sehemu kubwa ya ulimwengu. Baada ya utawala wa Trump kuwazuia watu wasio raia wa Marekani kutumia Mythos na ndugu yake aliyewekewa vikwazo Fable 5, timu za usalama za kimataifa zilipoteza ufikiaji wa kile kilichochukuliwa kuwa AI yenye uwezo zaidi kwa kazi ya kukera na ya ulinzi.
Katika utupu huo, mifano ya uzani wazi inayopatikana inajaza pengo. Ukweli kwamba GLM 5.2 - inaweza kupakuliwa bila malipo na inaweza kutumika popote - tayari inaweza kulinganisha au kushinda miundo ya wamiliki wa mipaka kwenye majukumu mahususi ya usalama unapendekeza athari ya ubaridi ya marufuku ya kuuza nje inaweza kuwa ndogo kuliko ilivyokusudiwa. Iwapo muundo bora zaidi "usio na vikwazo" utaendelea kuboreka, thamani ya kimkakati ya uwezo wa kuweka mipaka itapungua.
Kwa sasa, matokeo ni finyu: alama moja kwenye darasa moja la mazingira magumu. Lakini ni ishara kwamba mipaka ya uzani wazi inafungwa haraka kuliko wengi wanavyodhani, na kwamba ufikiaji - sio uwezo mbichi - unaweza kuwa kigezo bainifu katika mazingira ya usalama ya AI.
Ugunduzi huo pia unazua maswali yasiyofurahisha kwa maabara za mipaka. Iwapo muundo unaopatikana bila malipo unaweza tayari kuendana na mifumo ya wamiliki kwenye kazi za hoja za usalama, mkondo wa ushindani karibu na miundo iliyofungwa hupungua - hasa wakati udhibiti wa usafirishaji unafanya miundo hiyo iliyofungwa kutoweza kufikiwa na maeneo mengi ya soko la kimataifa. Wasanidi wa uzani wazi, bila kuzuiliwa na vizuizi vya matumizi, wanaweza kurudia na kusambaza kila mahali kwa wakati mmoja.
Kaa Mbele ya AI
Pengo kati ya AI ya mipaka na uzani huria inapungua kwenye habari zinazochipuka za AI na utafiti wa kuunda upya usalama, miundombinu na sera.
Soma habari zaidi za AI →


