Anthropic mengumumkan pada hari Selasa pengembangan besar usaha capaian model tertumpu keselamatannya, menstruktur semula inisiatif capaian yang disemak menjadi Program Pengesahan Siber (CVP) formal dengan tiga peringkat berbeza untuk profesional keselamatan siber. Langkah itu dibuat apabila syarikat itu mendedahkan bahawa inisiatif Project Glasswingnya telah mendedahkan sekurang-kurangnya 129,000 kelemahan perisian yang disahkan sejak April.

Program yang disusun semula membenarkan pasukan keselamatan yang disemak untuk menjalankan model Anthropic yang paling berkebolehan — termasuk Claude Opus 5.5, Claude Sonnet 5.5 dan Claude Mythos 5.1 — dengan pengurangan perlindungan dan pengelas menyekat, kebenaran yang biasanya tidak tersedia untuk pengguna umum. Menurut Anthropic, matlamatnya adalah untuk meletakkan keupayaan AI sempadan ke tangan pembela sebelum pelakon berniat jahat menggunakan alat yang sama. For more context on this story, see our ongoing more AI stories.

Tiga Peringkat Akses, Tiga Senario Ancaman

Program baharu ini dianjurkan di sekitar tiga tahap akses, setiap satu disesuaikan dengan jenis kerja keselamatan yang berbeza:

  • Akses Pertahanan meliputi operasi pertahanan seperti tindak balas insiden, kejuruteraan terbalik perisian hasad dan analisis dan pengesahan kelemahan.
  • Akses Pasukan Merah menambahkan ujian penembusan yang dibenarkan dan gabungan merah pada kes penggunaan pertahanan, membenarkan serangan simulasi terhadap sistem yang mempunyai kebenaran untuk diuji oleh organisasi.
  • Akses Khusus membawa perlindungan paling sedikit dan dikhaskan untuk set terhad organisasi yang disahkan yang diberi kuasa untuk menguji sendiri sistem keselamatan AI.

Organisasi dan pasukan keselamatan individu memohon untuk peringkat yang sepadan dengan kerja mereka, dan Anthropic menyemak setiap permohonan sebelum memberikan akses. Syarikat itu berkata ketiga-tiga peringkat itu termasuk akses kepada model perdana semasa serta model baharu yang dikeluarkan pada masa hadapan.

Perlindungan Masih Menggigit — Terpilih

Anthropic menggandingkan pengumuman dengan data penilaian yang bertujuan untuk menunjukkan bahawa sistem peringkat memisahkan kerja pertahanan jinak daripada keupayaan yang benar-benar berbahaya. Dalam penilaian CyScenarioBench pada Claude Opus 5.5, syarikat itu melaporkan bahawa perlindungan menyekat 46 daripada 50 tugas dalam peringkat Akses Pertahanan. Dalam peringkat Red Team Access pada model yang sama, tiada satu pun tugasan disekat dan model itu menyelesaikan 34 daripada 50 — kadar penyiapan yang sama direkodkan apabila tiada perlindungan digunakan sama sekali.

Sebaliknya, tanpa akses CVP, setiap tugas telah disekat pada gesaan pertama, menurut Anthropic.

"Penilaian ini memberi kami keyakinan bahawa kami boleh menjadikan keupayaan siber lanjutan tersedia dengan selamat kepada kumpulan pembela yang lebih luas, mengembangkan usaha pertahanan yang kami mulakan dengan Project Glasswing," kata syarikat itu dalam pengumumannya, yang dilaporkan secara meluas oleh The Hacker News, Reuters dan SecurityWeek.

Reka bentuk mencerminkan pertaruhan bahawa kebanyakan kerja keselamatan pertahanan — menampal, analisis log, triage perisian hasad — boleh diteruskan di bawah pagar yang ketat, manakala ujian serangan yang sah memerlukan koridor yang lebih luas. Ia juga mencerminkan bagaimana industri keselamatan telah lama mengendalikan alat dwiguna: semak pengamal, bukan hanya alat.

Jejak Mengembang Glasswing

Peluasan program ini digandingkan rapat dengan Project Glasswing, inisiatif Anthropic untuk menggunakan modelnya untuk mengeraskan perisian kritikal. Syarikat itu berkata Glasswing mendedahkan sekurang-kurangnya 129,000 kelemahan perisian yang disahkan antara April dan Julai 2026, dan tambahan 5,500 kelemahan yang disahkan antara April dan Oktober melalui usaha pengimbasan sumber terbuka.

Daripada kelemahan yang disahkan, lebih daripada 33,000 setakat ini telah dinilai sebagai kritikal atau tahap keterukan tinggi — angka yang diterangkan oleh Anthropic sebagai kemungkinan kurang kiraan yang ketara, kerana ia menggunakan data tinjauan daripada hanya subset rakan kongsi Glasswing. Syarikat menganggarkan impak sebenar mungkin sekurang-kurangnya lima kali lebih tinggi.

Pandangan Terukur Penemuan Kerentanan Didorong AI

Analisis bebas mencadangkan banjir kelemahan yang ditemui AI tidak diterjemahkan terus ke dalam gelombang pelanggaran yang dieksploitasi yang sepadan. Dalam analisis yang diterbitkan akhir bulan lalu, penyelidik VulnCheck Patrick Garrity mendapati bahawa hanya 2 daripada 300 kelemahan yang ditemui oleh Anthropic atau Project Glasswing - kira-kira 0.67 peratus - telah dieksploitasi di alam liar.

Dua kelemahan yang dieksploitasi ialah CVE-2026-26980, kelemahan suntikan SQL dalam Ghost CMS dan CVE-2026-61500, kecacatan pemalsuan sesi dalam Pelayan Fail HTTP Rejetto. Data ini menyokong nuansa yang ditekankan oleh penyelidik keselamatan: AI sedang merendahkan halangan kepada penemuan kerentanan, tetapi kebanyakan kelemahan yang muncul tidak pernah pada radar penyerang.

Pengumuman itu juga berlaku di tengah-tengah perdebatan yang lebih luas tentang kerja keselamatan yang dijana AI. Penyelidikan daripada 1Password dan Veracode telah menunjukkan bahawa tampung kerentanan yang ditulis AI boleh sendiri memperkenalkan kelemahan baharu, menekankan bahawa automasi membantu tetapi tidak menggantikan pengesahan manusia.

Maksudnya untuk Industri Keselamatan

Untuk pasukan keselamatan, CVP merendahkan tenaga pengaktifan untuk menggunakan model sempadan pada kerja pertahanan sebenar. Responden insiden mendapat laluan yang dibenarkan kepada bantuan analisis perisian hasad; penguji penembusan mendapat persekitaran terkawal untuk serangan berbantukan AI; dan kumpulan kecil organisasi yang mengaudit sistem keselamatan AI sendiri menerima akses paling kurang terhad.

Bagi Anthropic, program ini adalah strategi keselamatan dan juga komersial. Ia mengukuhkan kedudukan syarikat bahawa keupayaan siber yang berkuasa harus dikeluarkan secara sengaja, kepada pembela yang disemak, dan bukannya ditindas sepenuhnya — berbeza dengan pesaing yang telah menghadapi penelitian terhadap model dengan kawalan siber yang lebih lemah. Ia juga memperdalam hubungan Anthropic dengan perusahaan yang paling mungkin membayar untuk akses model sempadan: kerajaan, pengendali infrastruktur kritikal dan vendor keselamatan yang besar.

Syarikat itu tidak mengumumkan perubahan harga yang berkaitan dengan program itu, dan permohonan diproses melalui saluran capaian yang disemak Anthropic yang sedia ada. Memandangkan skala perkara yang Glasswing telah muncul - dan pengakuan syarikat sendiri bahawa angka itu mungkin mengecilkan realiti - industri keselamatan akan memerhatikan berapa banyak daripada 129,000 penemuan itu diperbaiki sebelum penyerang menemuinya terlebih dahulu.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →