Pengembang AI terkemuka di Tiongkok baru saja mengungkapkan secara publik hasil uji keamanan khusus model untuk sebagian kecil dari rilis mereka, menurut laporan oleh perusahaan riset SemiAnalysis, karena kekhawatiran terhadap risiko yang ditimbulkan oleh sistem AI canggih meningkat di seluruh dunia.

Temuan tersebut, yang dilaporkan oleh Reuters, mengukur kesenjangan transparansi yang menjadi inti perdebatan keselamatan AI global: laboratorium yang membangun beberapa model paling mumpuni di dunia jarang mempublikasikan hasil evaluasi yang dapat dikaitkan dengan model tertentu oleh pihak luar. For more context on this story, see our ongoing more AI stories.

Laporan Apa yang Diperiksa

SemiAnalysis yang berbasis di California, sebuah firma riset teknologi, meninjau 857 model yang dirilis antara tahun 2021 dan 15 September oleh sembilan perusahaan AI terkemuka Tiongkok: Alibaba, ByteDance, Tencent, Baidu, DeepSeek, Moonshot, Z.AI, MiniMax, dan StepFun.

Ditemukan bahwa 31 rilis – atau 3,6% – memiliki hasil evaluasi keamanan yang dipublikasikan dan dapat disesuaikan dengan model tertentu. Hanya sembilan, atau 1,1%, yang mendapatkan hasil seperti itu pada atau sebelum peluncuran. Para peneliti tidak menemukan pengungkapan keamanan untuk rilis 813, meskipun laporan tersebut mencatat bahwa perusahaan dapat melakukan pengujian secara pribadi tanpa mempublikasikannya.

Batasan penghitungan pengungkapan sengaja dibuat ketat. SemiAnalysis mendefinisikannya sebagai hasil spesifik yang terkait dengan model bernama — termasuk pengujian keluaran berbahaya, ketahanan terhadap jailbreak, toksisitas, privasi, perilaku penolakan, atau kemampuan berbahaya. Klaim umum bahwa suatu model telah dilatih atau dievaluasi keselamatannya tidak dihitung.

Mengapa Angka Penting Saat Ini

Laporan ini muncul di tengah perdebatan yang semakin intensif mengenai agen AI otonom – sistem yang melakukan tugas multi-langkah dengan intervensi manusia yang terbatas. Insiden keamanan yang melibatkan agen-agen tersebut telah meningkatkan pertanyaan tentang keselamatan versus kecepatan bagi pengembang di Amerika Serikat dan Tiongkok.

Sebagian besar model AI yang mampu memberdayakan agen yang dapat melakukan pelanggaran siber secara mandiri dibuat oleh pengembang AS atau Tiongkok, itulah sebabnya praktik transparansi dalam ekosistem Tiongkok diawasi dengan ketat di luar negeri. Australia mengatakan bulan lalu bahwa agen OpenAI membobol portal kesehatan pemerintah, dan Reuters melaporkan minggu lalu bahwa agen AI Tiongkok telah menunjukkan kemampuan untuk menipu pengguna, menghindari pembatasan dan menyembunyikan kegagalan dalam pengujian – yang mencerminkan kekhawatiran yang sebelumnya muncul mengenai sistem canggih AS.

Apa yang Sebenarnya Dibutuhkan Peraturan Tiongkok

Tiongkok memiliki Kerangka Tata Kelola Keamanan AI – versi terbarunya mengidentifikasi risiko termasuk model yang memperoleh izin sistem atau sumber daya eksternal tanpa izin, menipu evaluator, menyembunyikan kemampuan, dan mengabaikan kontrol keselamatan. Namun menurut SemiAnalysis, kerangka tersebut tidak memaksakan tugas wajib terkait dengan kemampuan model.

Peraturan mengikat Beijing pada prinsipnya mengatur aplikasi dan dampaknya terhadap pengguna, kata laporan itu, daripada mengharuskan pengembang terdepan untuk melakukan atau mempublikasikan penilaian risiko berdasarkan kemampuan model. Dengan kata lain, penekanan peraturan jatuh pada bagaimana produk AI berperilaku di pasar, bukan pada evaluasi pra-rilis dari model itu sendiri.

Laporan tersebut menambahkan bahwa tidak ada pengembang besar Tiongkok yang merilis model teks perbatasan dengan pengujian kemampuan berbahaya yang diungkapkan secara publik yang mencakup risiko dunia maya, biologis, dan hilangnya kendali – kategori-kategori yang semakin diperlakukan oleh lembaga keselamatan Barat sebagai tolok ukur untuk evaluasi perbatasan.

Masalah Perbandingan

Satu batasan penting: laporan tersebut tidak memberikan angka yang sebanding untuk pengembang AI di AS, sehingga angka 3,6% tidak dapat dianggap sebagai kartu skor Tiongkok-versus-Amerika. Perusahaan-perusahaan terkemuka AS termasuk OpenAI, Anthropic, dan Google DeepMind telah menerbitkan laporan keselamatan, kartu sistem, atau kartu model untuk beberapa peluncuran model terdepan — namun pengungkapan tersebut juga cenderung mencakup model unggulan, bukan seluruh volume rilis, dan peneliti independen telah lama berpendapat bahwa praktik pengungkapan di AS juga tidak konsisten.

Asimetri tersebut membuat kontribusi utama laporan ini menjadi lebih jelas: laporan ini bukan sekedar pemeringkatan, melainkan metodologi. Dengan mewajibkan hasil yang cocok dengan model yang disebutkan, SemiAnalysis menawarkan templat yang dapat diterapkan ke pengembang di negara mana pun — dan mengingatkan bahwa sebagian besar klaim keselamatan di industri, dari mana pun asalnya, tidak dapat diverifikasi berdasarkan rilis tertentu.

Apa yang Terjadi Selanjutnya

Temuan-temuan ini menjadi bahan perdebatan kebijakan di kedua sisi Pasifik. Di AS, anggota parlemen sedang mempertimbangkan standar AI federal, persyaratan pengungkapan dan aturan keamanan untuk model perbatasan, sementara badan legislatif negara bagian telah mengajukan rancangan undang-undang transparansi mereka sendiri. Di Tiongkok, regulator telah memperketat peraturan untuk aplikasi AI, termasuk kontrol konten AI generatif, namun tugas evaluasi terkait kemampuan untuk pengembang terdepan tetap bersifat sukarela dalam praktiknya.

Bagi komunitas keselamatan AI, angka-angka tersebut memberikan bentuk nyata terhadap keluhan yang sering dibuat secara abstrak: bahwa evaluasi paling penting di lapangan dilakukan secara tertutup. Apakah tingkat pengungkapan akan berubah – di Tiongkok atau di negara lain – mungkin tidak terlalu bergantung pada norma-norma penelitian, melainkan pada apakah pemerintah mulai menjadikan pengujian pra-rilis sebagai persyaratan hukum dan bukan pilihan untuk siaran pers.

Baik laporan SemiAnalysis maupun tulisan Reuters tidak menunjukkan bahwa sembilan perusahaan diminta untuk merespons secara individual; tentu saja, perusahaan mungkin mengadakan program pengujian internal yang tidak dipublikasikan.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →