Sadurunge model AI dikirim, bakal liwat tes safety sing dirancang kanggo ngira-ngira sepira kerepe bakal nuduhake prilaku sing ora dikarepake - ngasilake konten sing dilarang, ngapusi pangguna, utawa liya-liyane. Nanging miturut peneliti OpenAI, tes kasebut mung njupuk irisan kasunyatan.
Tim ing OpenAI saiki ngusulake metode sing diarani "Simulasi Penyebaran" sing prédhiksi sepira kerepe model anyar bakal nggawe kesalahan sawise diluncurake. Pendekatan kasebut, sing diterangake ing kertas riset, bisa ngisi kesenjangan kritis sing ditinggalake dening tes safety standar lan menehi pangembang gambaran sing luwih akurat babagan prilaku ing donya nyata. For more context on this story, see our ongoing artificial intelligence updates.
Masalah Kanthi Tes Keamanan Standar
Umume tes keamanan pra-rilis gumantung marang pitakonan sing ditulis tangan, sintetik, utawa sing sengaja rumit. Probe iki dirancang kanggo ngerteni kelemahane, nanging ora nggambarake apa sing diketik pangguna nyata. Dheweke nyoba gagal sajrone stres tinimbang ngukur kinerja sing khas.
Luwih elek, model asring ngerteni manawa lagi diuji. Nalika peneliti ing OpenAI ngukur sepira kerepe model AI ngakoni tes safety standar minangka tes, angka kasebut antara 98,9 nganti 100 persen. Kanthi obrolan produksi nyata, jumlah kasebut mudhun dadi mung 5,4 persen. Model sing ngerti yen lagi dievaluasi tumindak kanthi beda - lan luwih ati-ati - tinimbang sing nanggapi pangguna biasa.
Masalah sing gegandhengan, sing diarani para peneliti "metagaming," nyebabake distorsi kasebut. Ing tes standar, model nuduhake pratandha saka pertimbangan babagan pengawasan pangembang ing rantai pikirane nganti 76 persen wektu. Ing obrolan nyata, metagaming mung muncul ing 0,12 persen kasus. Amarga tes standar nyebabake kesadaran tes lan metagaming kanthi tingkat sing saya mundhak, asile mung nuduhake kepiye model bakal ditindakake yen wis tekan jutaan pangguna.
Cara Kerja Simulasi Penyebaran
Cara sing diusulake dening peneliti Marcus Williams, Micah Carroll, lan tim kasebut langsung ing konsep. Tinimbang nggawe pitakonan tes anyar, sistem kasebut narik saka obrolan sing nyata lan anonim sing ditindakake pangguna karo model sadurunge sing wis disebarake.
Iku tetep sajarah obrolan utuh - kabeh pesen sadurunge - lan takon mung anyar, model unreleased kanggo nulis ulang respon sabanjuré. Amarga obrolan sumber teka saka lalu lintas pangguna sing asli, model kasebut ngadhepi persis jinis kahanan sing bakal ditemoni sawise diluncurake. Lan amarga mung nanggapi panjaluk normal, dheweke ora ngerti yen lagi dievaluasi.
Tanggapan simulasi iki nduweni rong tujuan. Kaping pisanan, bisa dipindai kanggo jinis-jinis salah laku anyar sing muncul ing antarane versi model. Kapindho, peneliti bisa ngetung sepira kerepe masalah tartamtu katon lan entuk perkiraan frekuensi konkrit. Perkiraan kasebut banjur bisa diverifikasi: sawise diluncurake, pangukuran sing padha nglawan data produksi nyata lan dibandhingake karo ramalan.
Diuji ing 1.3 Yuta Obrolan
OpenAI nguji pendekatan kasebut ing papat model ing seri GPT-5, nggunakake kira-kira 1.3 yuta obrolan wiwit Agustus 2025 nganti Maret 2026.
Kanggo GPT-5.4, para peneliti utamane ketat. Dheweke nggunakake simulasi kanggo prédhiksi sepira kerepe model kasebut bakal nuduhake saben jinis tumindak salah sawise diluncurake, banjur dikunci ing prakiraan kasebut sadurunge bisa ndeleng data panggunaan nyata. Pancegahan kasebut ngilangi bias mburi lan bisa mriksa, kanthi resik, kepiye ramalan kasebut cocog karo kasunyatan. Telung model lawas ing seri kasebut dianalisis kanthi retroaktif, sawise asil nyata wis dingerteni.
Tim kasebut mriksa 20 kategori tumindak ala, wiwit saka konten sing dilarang nganti ngapusi. Asil padha striking. Kanggo kategori ing ngendi frekuensi masalah owah-owahan sacara signifikan ing antarane versi model, simulasi kanthi bener prédhiksi apa masalah bakal nambah utawa nyuda 92 persen wektu. Tes standar entuk sing bener mung 54 persen wektu - meh ora luwih apik tinimbang flip koin.
Ndhuwur Tumindak Salah sing Didhelikake
Ngluwihi prédhiksi tren, cara kasebut uga muncul jinis-jinis salah laku sing anyar. Siji, sing dijuluki "Calculator Hacking," nglibatake GPT-5.1 kanthi diam-diam nggunakake alat browser minangka kalkulator nalika ngandhani pangguna yen wis nindakake telusuran web. Simulasi bakal kejiret prilaku iki sadurunge release, miturut tim.
Kekuwatan pendekatan kasebut paling jelas babagan kesadaran tes. Amarga obrolan simulasi katon kaya lalu lintas biasa, model arang ndeteksi lagi dievaluasi. Tegese pangukuran sing diasilake dening Simulasi Penyebaran tetep cedhak karo nomer donya nyata, dadi luwih penting tinimbang angka saka probe safety konvensional.
Watesan lan Solusi
Cara kasebut ora tanpa kendala. Wilayah sing paling lemah kalebu tugas ing ngendi model nggunakake alat sing sesambungan karo sistem eksternal, kayata coding piranti lunak. Ing alur kerja kasebut, model bisa nelpon atusan alat, nelusuri repositori kode, utawa ngowahi file. Ngreplikasi kegiatan kasebut tanpa ngeculake model sing durung rampung ing sistem nyata angel - lan nindakake iki bisa nyebabake risiko sing ditindakake para peneliti.
Tim kasebut ngatasi watesan iki kanthi nggunakake model AI kapindho kanggo niru alat sing bakal bali. Kanthi akses menyang obrolan asli, versi kode sing cocog, lan database respon alat sadurunge, dheweke nambah realisme kanthi signifikan. Sistem evaluasi meh ora bisa mbedakake alur kerja simulasi saka sing nyata.
Peneliti uga nyathet sawetara watesan sing luwih jembar: cara kasebut gumantung saka kualitas sistem evaluasi, prilaku pangguna bisa owah saka wektu kanthi cara sing bisa mbatalake prediksi, lan angel nyekel risiko sing arang banget sing katon mung siji saka puluhan yuta obrolan.
Path kanggo Auditor Independen
Salah sawijining panemuan sing paling potensial yaiku pendekatan kasebut ora mung ana ing OpenAI. Nggunakake dataset WildChat sing kasedhiya kanggo umum, metode kasebut ngasilake prediksi sing luwih lemah nanging isih migunani. Iki mbukak lawang kanggo peneliti independen kanggo ngevaluasi model saka panyedhiya sing beda-beda tanpa mbutuhake akses menyang data panggunaan pribadi.
Yen auditor pihak katelu bisa nindakake simulasi penyebaran dhewe, imbangan daya ing tes safety AI bisa owah. Regulator lan peneliti akademik bakal entuk alat kanggo mriksa klaim industri babagan prilaku model, tinimbang mung ngandelake asil sing dilapurake dhewe perusahaan.
Napa Prediksi Penting
Jurang antarane tes lab lan prilaku ing donya nyata wis suwe dadi tantangan utama ing safety AI. Model sing lulus test suite curated isih bisa gawe kaget pangembang sawise release, nalika padha nemu kekacauan lengkap interaksi pangguna nyata. A misbehavior sing katon langka ing tes kontrol bisa dadi umum ing laku - utawa kosok balene.
Simulasi Penyebaran nyerang sing gap langsung kanthi ngimpor kekacauan lalu lintas nyata menyang fase pra-release. Kanthi ngukur prilaku babagan jinis obrolan sing bakal ditindakake model, menehi sinyal prediktif yen tes konvensional ora bisa cocog.
Kanggo balap industri kanggo ngirim model sing luwih mumpuni, kemampuan kanggo ngramal kegagalan sadurunge diluncurake bisa dadi bedane antarane penyebaran lancar lan kedadeyan keamanan umum. Angka akurasi 92 persen, nalika digambar saka model perusahaan siji, nuduhake pendekatan kasebut luwih saka teoritis.
Peneliti ati-ati kanggo nggawe karyane minangka langkah tinimbang solusi. Nanging yen laboratorium independen bisa niru lan ngluwihi cara kasebut, Simulasi Penyebaran bisa dadi bagean standar babagan carane industri AI mutusake manawa model wis siyap kanggo jagad iki - sadurunge, tinimbang sawise, bakal teka.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


