Penilaian awal bersama oleh institut keselamatan AI kerajaan Amerika Syarikat dan United Kingdom telah menyimpulkan bahawa model Kimi K3 berat terbuka Moonshot AI mengetuai model sempadan AS dengan margin yang luas dalam tugas siber yang menyinggung perasaan. Penemuan itu, yang diterbitkan pada 25 Julai 2026, menambah titik data konkrit kepada perdebatan yang semakin sengit tentang cara sistem AI yang dibangunkan China harus dirawat apabila ia diterima pakai di dalam Amerika Syarikat.
Penilaian itu dikeluarkan oleh institut keselamatan AI AS yang ditempatkan di NIST, dikenali sebagai CAISI, bersama-sama dengan AISI UK. Ia mewakili salah satu penilaian Barat rasmi pertama Kimi K3 yang tertumpu khusus pada domain siber. Bagi pembaca yang mengikuti landskap bergerak pantas berita terbaharu AI, hasilnya adalah kurang ketara untuk mana-mana skor penanda aras tunggal berbanding dengan apa yang ditunjukkannya tentang peranan yang semakin berkembang yang dimainkan oleh makmal kerajaan dalam memeriksa model asing sebelum ia digunakan secara meluas.
Apakah penilaian yang diukur
Kimi K3, dikeluarkan oleh Moonshot AI yang berpangkalan di Beijing, ialah model berat terbuka yang besar yang dengan cepat menarik perhatian global untuk prestasi tujuan am yang kukuh selepas pelancarannya. Pengedaran terbukanya bermakna penyelidik dan pembangun boleh memuat turun dan memeriksa pemberat secara langsung, yang seterusnya menjadikannya calon semula jadi untuk ujian keselamatan luaran.
Laporan awal baharu itu menumpukan pada soalan yang lebih sempit dan sensitif: sejauh manakah kebolehan model dalam operasi siber yang menyinggung perasaan, jenis tugas yang paling penting kepada agensi keselamatan negara? Daripada menilai Kimi K3 berdasarkan pengetahuan atau penaakulan yang luas, institut itu menyiasat sama ada ia boleh membantu melakukan serangan siber, mengeksploitasi kelemahan perisian, atau sebaliknya membantu dalam operasi komputer yang berniat jahat.
Nombor: kira-kira 32% berbanding 76%
Hasil tajuk adalah jurang yang ketara. Mengenai penilaian keupayaan siber, Kimi K3 mendapat kira-kira 32%, manakala model sempadan AS yang terkemuka mencapai sekitar 76%, menurut laporan mengenai penilaian itu. Diterjemah ke dalam istilah mudah, institut AS mendapati bahawa model China boleh menyelesaikan hanya kira-kira satu pertiga daripada tugas siber yang menyinggung perasaan yang dikendalikan oleh model Barat.
Berbilang cawangan yang meliputi keluaran membingkai jurang secara konsisten. South China Morning Post melaporkan bahawa Kimi K3 berada "jauh di belakang pesaing AS dalam keupayaan serangan siber," manakala Kejuruteraan Menarik menyerlahkan penyebaran 76% berbanding 32% pada penanda aras siber. Penilaian itu disifatkan sebagai awal, bermakna institut memberi isyarat bahawa ujian lanjut berkemungkinan sebelum sebarang kesimpulan akhir dibuat.
Mengapa jurang itu mungkin wujud
Model yang berprestasi kukuh pada penanda aras umum tetapi lemah pada kesalahan siber memberikan teka-teki yang menarik, dan penganalisis telah mula mempertimbangkannya. Menulis di The Decoder, pengulas menyatakan bahawa penyulingan mungkin menjelaskan sebahagian daripada percanggahan itu.
Penyulingan ialah teknik latihan di mana model belajar dengan meniru output model "guru" yang lebih berkebolehan daripada membina setiap keupayaan dari awal. Jika Kimi K3 dibangunkan sebahagiannya melalui penyulingan, penganalisis berpendapat, ia boleh mewarisi siling pada kebolehannya yang ditetapkan oleh apa jua model yang berkhidmat sebagai gurunya, yang berpotensi mengehadkan prestasi pada tugas paling sukar seperti operasi siber yang menyinggung perasaan canggih.
Hipotesis itu kekal hanya itu, hipotesis. Laporan awal tidak menjelaskan mengapa jurang itu wujud, cuma ia wujud. Faktor lain yang mungkin termasuk sekatan keupayaan yang disengajakan, perbezaan dalam data latihan atau pertukaran yang dibuat untuk memastikan model cukup cekap untuk dijalankan pada perkakasan yang tersedia secara meluas.
Latar belakang politik yang dikenakan bayaran
Penilaian itu tiba di tengah-tengah dorongan AS yang lebih luas untuk meneliti sistem AI China. Terdahulu pada bulan Julai, pentadbiran Trump menghidupkan semula usaha untuk menyekat penggunaan model AI yang dibangunkan China di dalam Amerika Syarikat, memetik kebimbangan keselamatan siber, dengan Kimi K3 dinamakan berulang kali dalam perbincangan itu. Penggubal undang-undang AS telah secara berasingan menekan syarikat Amerika mengenai implikasi keselamatan data daripada menyepadukan model asing ke dalam produk mereka.
Berdasarkan latar belakang itu, kerajaan mendapati bahawa model berat terbuka China yang paling menonjol berprestasi rendah pada pemotongan kesalahan dalam dua arah. Bagi mereka yang berhujah untuk sekatan, ia memberikan bukti rasmi bahawa model itu dirawat dengan cukup serius untuk diuji. Bagi mereka yang berhati-hati terhadap jangkauan melampau, skor siber yang agak rendah juga merumitkan naratif bahawa setiap model Cina mewakili ancaman siber serta-merta.
Maksudnya untuk pengambilan berat terbuka
Hasilnya juga menjadi perdebatan berasingan mengenai AI berat terbuka secara lebih meluas. Penyokong model pemberat terbuka berpendapat bahawa pemberat yang boleh dimuat turun secara bebas membolehkan ujian keselamatan bebas sama seperti jenis CAISI dan AISI UK yang dijalankan, menjadikan pengedaran terbuka positif bersih untuk keselamatan. Pengkritik membantah bahawa keterbukaan yang sama merendahkan halangan bagi pelakon yang berniat jahat untuk mengubah suai atau menyalahgunakan sistem yang mampu.
Dalam kes Kimi K3, ketersediaan wajaran terbuka adalah perkara yang menjadikan penilaian kerajaan bebas ini mungkin. Sama ada skor siber yang agak sederhana meyakinkan atau mencemaskan penggubal dasar berkemungkinan kurang bergantung pada bilangan itu sendiri dan lebih kepada cara agensi AS dan UK memilih untuk merangkanya dalam minggu-minggu akan datang.
Buat masa ini, penilaian awal berdiri sebagai titik rujukan: pengukuran Barat rasmi pertama kebolehan siber Kimi K3 yang menyinggung, dan yang meletakkannya jauh di belakang model AS yang sering dibandingkan dengannya.
Kekal Mendahului AI
Skor keupayaan siber hanyalah satu bahagian dalam pertandingan yang lebih besar mengenai keselamatan AI, peraturan dan persaingan global. Landskap dasar berubah setiap minggu, dan tiada penilaian tunggal boleh bermakna tiada konteks di sebalik tajuk seterusnya. Baca lebih banyak berita AI di AI Buzz Wire untuk mengikuti setiap keluaran model, peraturan kerajaan dan penilaian keselamatan yang penting.
Kekal mendahului perlumbaan AI — lawati AI Buzz Wire


