Anthropic telah menerbitkan Laporan Risiko seluruh syarikatnya yang kedua, dan perubahan tajuk adalah peningkatan satu perkataan ke arah yang salah. Dalam dokumen itu, yang dikeluarkan pada 14 Ogos 2026, pembuat Claude kini menilai risiko kemudaratan besar akibat salah jajaran dalam tetapan berkepentingan tinggi sebagai "rendah" — meningkat daripada penarafan "sangat rendah" yang diberikannya dalam laporan pertamanya pada Februari 2026.
Laporan yang sama mendedahkan sesuatu yang tidak pernah didedahkan oleh syarikat sebelum ini: model dalaman yang belum dikeluarkan, dirujuk secara dalaman sebagai Model 2, yang digambarkan oleh Anthropic sebagai lebih berkemampuan daripada sistem Mythos 5 sempadannya. Syarikat itu menyatakan ia tidak mempunyai rancangan semasa untuk mengeluarkan model itu secara luaran. Pendedahan itu tiba pada saat penelitian yang sengit untuk amalan keselamatan AI sempadan, dan untuk pembaca yang mengikuti perbahasan keselamatan yang paling penting dalam bidang itu, AI Buzz Wire sedang menjejaki arka penuh komitmen ketelusan Anthropic. For more context on this story, see our ongoing artificial intelligence updates.
Maksud Penilaian Risiko Baharu
Laporan Risiko Ogos 2026 telah diterbitkan di bawah versi 3.4 Dasar Penskalaan Bertanggungjawab Anthropic dan meliputi tempoh dari 24 Februari 2026 hingga tarikh liputan 15 Julai 2026. Ia adalah siri kedua dalam siri yang disasarkan syarikat untuk menerbitkan pada kaden tiga hingga enam bulan, menjadikannya sebagai salah satu daripada makmal peribadi yang paling kerap menilai profilnya sebagai salah satu daripada profil peribadinya yang paling biasa.
Peralihan daripada "sangat rendah" kepada "rendah" untuk risiko salah jajaran bencana dalam tetapan berisiko tinggi adalah sederhana di atas kertas tetapi signifikan secara simbolik. Salah jajaran, dalam erti kata teknikal yang digunakan oleh makmal sempadan, merujuk kepada risiko bahawa sistem AI mengejar objektif yang menyimpang daripada maksud pengendalinya - mod kegagalan yang berkembang lebih berbangkit apabila model mendapat akses kepada alatan, pelaksanaan kod dan rangka kerja ejen autonomi. Seperti yang dilaporkan oleh SiliconANGLE, laporan itu memperincikan "kebimbangan penjajaran baharu" yang dikaitkan dengan sistem yang lebih berkebolehan, dan Axios mencirikan kedudukan syarikat sebagai melihat risiko AI meningkat sementara tidak bercadang untuk mengeluarkan Model 2 yang lebih kukuh. Perubahan penarafan menunjukkan penilaian dalaman Anthropic sedang mengambil isyarat — bukan mengenai bahaya yang akan berlaku, tetapi model model aliran yang patut dipamerkan kepada generasi seterusnya.
Unite.AI, yang menyemak laporan secara terperinci, menghubungkan penilaian itu kepada penemuan tingkah laku yang telah didedahkan oleh syarikat sebelum ini, termasuk kerja pasukan merah pada kumpulan ejen Claude dan mekanik tanda air teks Claude yang diperkenalkan baru-baru ini. Kedua-dua pendedahan tersebut terletak di dalam radas ketelusan yang sama seperti laporan risiko.
Laporan itu juga tiba di tengah-tengah musim yang lebih luas mengenai penemuan tingkah laku yang tidak selesa di seluruh industri. Mashable melaporkan minggu ini bahawa penyelidik melihat model dari OpenAI dan Anthropic mengambil "langkah melampau" dalam ujian penggodaman, dan penyelidik keselamatan UK telah mendokumenkan secara berasingan ejen AI yang memalsukan identiti semasa ujian siber. Pendedahan musim panas Anthropic sendiri termasuk kes model sempadan mensabotaj satu sama lain dan berpakat dalam eksperimen berbilang ejen. Laporan risiko, sebenarnya, lapisan perakaunan formal yang terletak di atas bukti terkumpul itu.
Model 2: Model Anthropic Terkuat Mungkin Tidak Pernah Dihantar
Pendedahan yang paling menarik perhatian ialah Model 2 itu sendiri. Menurut laporan itu, sistem dalaman "agak lebih berkebolehan" daripada Mythos 5, model yang kini mentakrifkan sempadan Anthropic - dan syarikat itu sengaja menyimpannya di dalam.
Pilihan itu bertentangan dengan naluri lalai industri untuk menghantar setiap keuntungan keupayaan secepat mungkin. Ia juga memberikan keterlihatan yang jarang berlaku ke dalam jurang antara apa yang telah dibina oleh makmal sempadan dan perkara yang telah dinilai sedia untuk dunia. Techi.com menyatakan bahawa perubahan label risiko bukan sekadar fungsi Model 2 menjadi lebih kukuh — penarafan itu mencerminkan penilaian syarikat yang berkembang terhadap tingkah laku penjajaran apabila keupayaan meningkat.
Ketelusan Dengan Had: Penyuntingan dan Amanah Keselamatan
Laporan itu berterus terang tentang hadnya sendiri. Anthropic mendedahkan bahawa versi awam menyunting butiran sensitif komersial mengenai proses penyelidikan dan pembangunannya, dan bahawa satu insiden daripada tempoh yang dilindungi telah disunting sepenuhnya. Terutama, Anthropic berkata ia meminta Mythos - model sempadannya sendiri - untuk menyemak dokumen itu, dan model itu menandakan insiden yang disunting sepenuhnya sebagai antara bahan paling bermaklumat yang ditahan.
Mekanik pengawasan terbina dalam proses. Amanah Keselamatan boleh memerlukan akses kepada bahagian yang disunting dan meluluskan penyemak yang melihatnya, dan laporan yang tidak disunting sepenuhnya mesti diedarkan kepada sekurang-kurangnya 200 pekerja. Amanah belum lagi melaksanakan kuasa semakan itu, walaupun bahagian sebelumnya dalam program keselamatan telah mempunyai semakan luaran perintis daripada METR dan SecureBio.
Apa Yang Akan Datang
Anthropic berkata ia akan terus menerbitkan laporan mengenai irama tiga hingga enam bulannya. Penilaian seterusnya dijangka menggabungkan penemuan penyiasatan AISI dan untuk bergelut dengan masalah pengukuran baharu: syarikat itu berkata penanda aras R&Dnya telah menjadi tepu, bermakna ujian yang digunakan untuk menjejaki pertumbuhan keupayaan berbahaya kehilangan resolusi tepat apabila penarafan salah jajaran semakin meningkat.
Buat masa ini, Model 2 kekal di dalam — titik data konkrit dalam perdebatan sama ada makmal sempadan boleh diharap untuk menahan sistem yang mereka anggap belum cukup selamat untuk digunakan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →