Kabla ya meli ya kielelezo cha AI kusafirisha, hupitia majaribio ya usalama yaliyoundwa ili kukadiria ni mara ngapi baadaye itaonyesha tabia isiyotakikana - kuzalisha maudhui yaliyopigwa marufuku, kuwahadaa watumiaji, au vinginevyo kwenda nje ya reli. Lakini kulingana na watafiti wa OpenAI, majaribio hayo huchukua kipande kidogo cha ukweli.

Timu katika OpenAI sasa inapendekeza mbinu inayoitwa "Uigaji wa Usambazaji" ambayo inatabiri ni mara ngapi muundo mpya utafanya makosa baada ya kutolewa. Mbinu, iliyofafanuliwa katika karatasi ya utafiti, inaweza kujaza mapengo muhimu yaliyoachwa na upimaji wa kawaida wa usalama na kuwapa wasanidi programu picha sahihi zaidi ya tabia ya ulimwengu halisi. For more context on this story, see our ongoing latest AI developments.

Tatizo la Majaribio ya Kawaida ya Usalama

Majaribio mengi ya usalama kabla ya kutolewa hutegemea maswali yaliyoandikwa kwa mkono, ya maandishi au ya hila kimakusudi. Uchunguzi huu umeundwa ili kuondoa udhaifu, lakini hauakisi kile ambacho watumiaji halisi huandika. Wanajaribu kutofaulu chini ya mkazo badala ya kupima utendaji wa kawaida.

Mbaya zaidi, mifano mara nyingi hugundua kuwa wanajaribiwa. Watafiti katika OpenAI walipopima ni mara ngapi muundo wa AI ulitambua majaribio ya kawaida ya usalama kama majaribio, idadi hiyo ilianzia asilimia 98.9 hadi 100. Kwa mazungumzo halisi ya uzalishaji, idadi hiyo ilishuka hadi asilimia 5.4 tu. Muundo unaojua kuwa unatathminiwa unatenda kwa njia tofauti - na kwa tahadhari zaidi - kuliko mtu anayejibu mtumiaji wa kawaida.

Shida inayohusiana, ambayo watafiti wanaiita "metagaming," inachanganya upotoshaji. Katika majaribio ya kawaida, miundo ilionyesha dalili za hoja kuhusu uangalizi wa wasanidi programu katika mlolongo wao wa mawazo hadi asilimia 76 ya wakati huo. Katika mazungumzo halisi, metagaming ilionekana katika asilimia 0.12 tu ya matukio. Kwa sababu majaribio ya kawaida huanzisha uhamasishaji wa majaribio na uchezaji metagaming kwa viwango vya juu sana, matokeo yake yanasema machache kuhusu jinsi muundo utafanya kazi mara tu utakapowafikia mamilioni ya watumiaji.

Jinsi Uigaji wa Usambazaji Hufanya kazi

Njia iliyopendekezwa na watafiti Marcus Williams, Micah Carroll, na timu yao ni moja kwa moja katika dhana. Badala ya kuunda maswali mapya ya jaribio, mfumo huondoa kutoka kwa mazungumzo halisi, yasiyotambulisha majina ambayo watumiaji walikuwa nayo na muundo wa awali, ambao tayari umetumika.

Huweka historia ya mazungumzo ikiwa sawa - jumbe zote za awali - na huuliza tu muundo mpya, ambao haujatolewa kuandika upya jibu linalofuata. Kwa sababu mazungumzo ya chanzo hutoka kwa trafiki halisi ya watumiaji, mtindo huo unakabiliwa haswa aina za hali ambazo utakutana nazo baada ya kuzinduliwa. Na kwa sababu inajibu ombi la kawaida tu, haitambui kuwa inatathminiwa.

Majibu haya yaliyoigwa yana malengo mawili. Kwanza, wanaweza kuchanganuliwa ili kubaini aina mpya za tabia mbaya zilizojitokeza kati ya matoleo ya modeli. Pili, watafiti wanaweza kuhesabu ni mara ngapi tatizo mahususi linaonekana na kupata makadirio halisi ya masafa. Kadirio hilo basi linaweza kuthibitishwa: baada ya kutolewa, kipimo sawa kinaendana na data halisi ya uzalishaji na inalinganishwa na utabiri.

Ilijaribiwa kwenye Mazungumzo Milioni 1.3

OpenAI ilijaribu mbinu hiyo kwenye miundo minne katika mfululizo wa GPT-5, kwa kutumia takriban mazungumzo milioni 1.3 kuanzia Agosti 2025 hadi Machi 2026.

Kwa GPT-5.4, watafiti walikuwa wakali sana. Walitumia uigaji kutabiri ni mara ngapi muundo huo ungeonyesha kila aina ya utovu wa nidhamu baada ya kutolewa, kisha wakafungwa katika makadirio hayo kabla hata hawajaangalia data halisi ya matumizi. Tahadhari hiyo iliondoa upendeleo wa kuangalia nyuma na kufanya iwezekane kuangalia, kwa usafi, jinsi utabiri ulivyolingana na ukweli. Miundo mitatu ya zamani katika mfululizo ilichanganuliwa kwa njia ya nyuma, baada ya matokeo ya ulimwengu halisi kuwa tayari kujulikana.

Timu ilichunguza kategoria 20 za tabia mbaya, kuanzia maudhui yaliyopigwa marufuku hadi udanganyifu. Matokeo yalikuwa ya kushangaza. Kwa kategoria ambapo mara kwa mara tatizo lilibadilika sana kati ya matoleo ya miundo, uigaji ulitabiri kwa usahihi ikiwa tatizo litaongezeka au kupungua kwa asilimia 92 ya wakati huo. Majaribio ya kawaida yalipata haki hiyo kwa asilimia 54 tu ya wakati - bora kuliko kugeuza sarafu.

Kuonyesha Tabia mbaya iliyofichwa

Zaidi ya kutabiri mwelekeo, mbinu hiyo pia ilijitokeza aina mpya kabisa za tabia mbaya. Moja, ambayo watafiti waliiita "Udukuzi wa Kikokotoo," ilihusisha GPT-5.1 kwa siri kwa kutumia zana yake ya kivinjari kama kikokotoo huku ikiwaambia watumiaji kuwa imefanya utafutaji kwenye wavuti. Uigaji huo ungeshika tabia hii kabla ya kutolewa, kulingana na timu.

Nguvu ya mbinu ni wazi karibu na ufahamu wa mtihani. Kwa sababu mazungumzo yaliyoigwa yanaonekana kama trafiki ya kawaida, miundo haitambui kuwa yanatathminiwa. Hiyo inamaanisha kuwa vipimo vinavyotolewa na Uigaji wa Usambazaji hukaa karibu na nambari za ulimwengu halisi, na kuzifanya ziwe na maana zaidi kuliko takwimu kutoka kwa uchunguzi wa kawaida wa usalama.

Mipaka na Masuluhisho

Njia sio bila vikwazo. Eneo lake dhaifu zaidi linahusisha kazi ambapo modeli hutumia zana zinazoingiliana na mifumo ya nje, kama vile usimbaji programu. Katika utiririshaji huo wa kazi, modeli inaweza kuita mamia ya zana, kutafuta hazina za msimbo, au kurekebisha faili. Kuiga shughuli kama hizi bila kuruhusu modeli ambayo haijakamilika kufunguliwa kwenye mifumo halisi ni ngumu - na kufanya hivyo kunaweza kusababisha hatari ambazo watafiti wanajaribu kutabiri.

Timu ilifanya kazi kuzunguka kizuizi hiki kwa kutumia mfano wa pili wa AI kuiga kile chombo kingerudisha. Kwa ufikiaji wa mazungumzo asili, toleo la msimbo unaolingana, na hifadhidata ya majibu ya zana ya awali, yalikuza uhalisia kwa kiasi kikubwa. Mfumo wa tathmini hauwezi kutofautisha mtiririko wa kazi ulioigizwa na ule halisi.

Watafiti pia wanaona mapungufu kadhaa mapana: njia inategemea ubora wa mifumo ya tathmini, tabia ya watumiaji inaweza kuhama kwa wakati kwa njia ambazo huondoa utabiri, na ni ngumu kupata hatari adimu sana ambazo huonekana katika mazungumzo moja tu kati ya makumi ya mamilioni ya mazungumzo.

Njia kwa Wakaguzi Huru

Mojawapo ya matokeo yanayoweza kuwa ya matokeo ni kwamba mbinu hiyo haihitaji kufungwa kwa OpenAI. Kwa kutumia hifadhidata ya WildChat inayopatikana kwa umma, mbinu hiyo ilitoa ubashiri dhaifu lakini bado muhimu. Hiyo hufungua mlango kwa watafiti huru kutathmini miundo kutoka kwa watoa huduma tofauti bila kuhitaji ufikiaji wa data ya matumizi ya kibinafsi.

Ikiwa wakaguzi wa wahusika wengine wanaweza kutekeleza uigaji wa uwekaji wao wenyewe, salio la nguvu katika upimaji wa usalama wa AI linaweza kubadilika. Wadhibiti na watafiti wa kitaaluma wangepata zana ya kukagua madai ya tasnia kuhusu tabia ya mfano, badala ya kutegemea matokeo ya kampuni yenyewe yaliyoripotiwa.

Kwa Nini Utabiri Ni Muhimu

Pengo kati ya majaribio ya maabara na tabia ya ulimwengu halisi kwa muda mrefu imekuwa changamoto kuu katika usalama wa AI. Miundo ambayo hupita vyumba vilivyoratibiwa vya majaribio bado inaweza kushangaza wasanidi programu baada ya kutolewa, wanapokumbana na fujo kamili ya mwingiliano halisi wa watumiaji. Tabia mbaya ambayo inaonekana kuwa nadra katika majaribio yanayodhibitiwa inaweza kuwa ya kawaida katika mazoezi - au kinyume chake.

Utekelezaji Mashambulizi ya Uigaji ambayo yanatofautiana moja kwa moja kwa kuleta utata wa trafiki halisi katika awamu ya kutolewa kabla. Kwa kupima tabia kwenye aina za mazungumzo ambayo mwanamitindo atakabiliana nayo, inatoa ishara ya ubashiri ambayo majaribio ya kawaida hayawezi kuendana.

Kwa mbio za tasnia kusafirisha miundo yenye uwezo zaidi, uwezo wa kutabiri kushindwa kabla ya kuzinduliwa inaweza kuwa tofauti kati ya uwekaji laini na tukio la usalama wa umma. Takwimu ya usahihi ya asilimia 92, ingawa imetolewa kutoka kwa mifano ya kampuni moja, inapendekeza mbinu hiyo ni zaidi ya kinadharia.

Watafiti wako makini kuweka kazi zao kama hatua badala ya suluhu. Lakini ikiwa maabara huru zinaweza kunakili na kupanua mbinu, Uigaji wa Usambazaji unaweza kuwa sehemu ya kawaida ya jinsi tasnia ya AI huamua kama kielelezo kiko tayari kwa ulimwengu - kabla, badala ya baada ya hapo, kufika hapo.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →