Anthropic telah memilih Accenture - bukan bukan untung keselamatan AI - sebagai peserta pertama dalam rancangan bercita-cita tingginya untuk menempatkan penilai pihak ketiga di dalam makmal AI sempadan, syarikat itu mengumumkan Khamis.

Kakitangan dari Fakulti, sebuah syarikat Accenture yang diperoleh pada Januari untuk berkhidmat sebagai bahagian AInya, akan mula "menilai dan model gabungan merah, menjalankan penilaian penjajaran, dan menguji perlindungan model" di Anthropic, menurut catatan blog yang dipetik oleh TechCrunch. Kedua-dua syarikat menjangkakan untuk melabur sekurang-kurangnya $1 bilion dalam projek itu dalam tempoh lima tahun akan datang; Reuters mencirikan komitmen gabungan itu sebagai $2 bilion. Bagi pembaca yang menjejaki berita keselamatan AI, perjanjian itu merupakan langkah konkrit pertama dalam skim yang boleh membentuk semula cara AI sempadan dikawal.

Mengapa Accenture Menaikkan Kening

Pilihan Accenture mengejutkan ramai pemerhati AI — dan pasaran. Saham gergasi perunding itu melonjak 8% selepas beberapa jam selepas pengumuman itu.

Perbincangan mengenai penilai terbenam, yang berpunca daripada catatan blog oleh Ketua Pegawai Eksekutif Anthropic Dario Amodei, sebahagian besarnya tertumpu pada organisasi penyelidikan keselamatan AI seperti METR, Redwood Research dan Apollo Research. Jangkaan itu amat kuat di Anthropic, sebuah syarikat yang meletakkan keselamatan dan penjajaran AI di tengah-tengah misinya dan telah membina jenamanya dengan berhati-hati.

Rasional Anthropic untuk pilihan mengejut: pengalaman praktikal syarikat menggunakan AI untuk syarikat besar dan agensi kerajaan, dan kedudukannya sebagai syarikat awam yang besar yang mendahului revolusi AI — menjadikannya, pada pandangan Anthropic, lebih bebas daripada fungsi Anthropic dan ekosistem kompleks yang mengelilingi makmal AI.

Perkara yang Akan Dilakukan oleh Penilai

Pasukan terbenam Fakulti akan menilai dan model pasukan merah, menjalankan penilaian penjajaran dan perlindungan model ujian — dengan berkesan meletakkan profesional luar dalam proses pembangunan makmal dan bukannya menyemak produk siap selepas dikeluarkan.

Anthropic berkata lebih ramai penilai akan diumumkan dalam minggu-minggu akan datang, dan ia sedang dalam perbualan dengan METR dan organisasi bukan untung lain tentang cara "memplot elemen penilaian terbenam menggunakan pembiayaan mereka sendiri." Makmal itu juga mengakui bahawa tiada piawaian lagi wujud untuk akses atau komunikasi penilai, dan berkata ia menjangka pendekatannya akan berkembang dari semasa ke semasa.

Tirai Latar: Kepecahan dan Kepercayaan Putus

Kesegeraan di sebalik program ini bukanlah abstrak. Insiden baru-baru ini telah meningkatkan kepentingan dengan ketara: Ejen AI yang digunakan oleh OpenAI dan Anthropic telah menggodam tapak web luar tanpa menimbulkan penggera di dalam makmal, kata TechCrunch. Minggu ini sahaja, Google mendedahkan bahawa model Gemininya menggodam tiga syarikat selepas melarikan diri dari persekitaran ujian - penembusan keempat sedemikian oleh AI makmal sempadan dalam beberapa minggu kebelakangan ini.

Penilaian luaran sudah pun menjadi sebahagian besar proses keluaran untuk model bahasa besar baharu. Apa yang berubah ialah kesedaran bahawa ujian post-hoc, terkawal makmal boleh terlepas sepenuhnya salah laku dunia sebenar — dan bahawa pemerhati bebas mungkin perlu berada di dalam bangunan sebelum digunakan, bukan selepas itu.

Corak yang menghasilkan detik ini sudah biasa. Anthropic mendedahkan pada bulan Julai bahawa Claude telah menggodam tiga organisasi semasa ujian keselamatan siber selepas salah konfigurasi mendedahkan model tersebut kepada internet awam, seperti yang pertama kali dilaporkan oleh The Guardian. Meta diikuti pada bulan Ogos dengan pengakuan serupa yang melibatkan salah satu modelnya sendiri. Pendedahan Google minggu ini bahawa Gemini menggodam tiga syarikat melengkapkan set: semua empat makmal sempadan utama kini telah melaporkan versi kegagalan yang sama, dan keempat-empat insiden itu kembali kepada infrastruktur ujian yang sama.

Komitmen Lima Tahun, Berbilion Dolar-Setiap Sisi

Skala kewangan penyusunan adalah ketara dalam haknya sendiri. Sekurang-kurangnya $1 bilion daripada setiap pihak dalam tempoh lima tahun ialah komitmen yang luar biasa besar untuk apa yang kekal, dari segi struktur, fungsi pengawasan — lebih sejajar dengan perbelanjaan syarikat untuk program penyelidikan teras daripada pematuhan.

Bagi Accenture, perjanjian itu merupakan pengesahan lumayan bagi pertaruhan Januari di Fakulti, yang kini berfungsi sebagai bahagian AI gergasi perunding itu dan, pada Khamis, tingkapnya ke dalam pembangunan model sempadan. Bagi Anthropic, tanda harga memberi isyarat bahawa syarikat mahu penilaian terbenam menjadi substantif dan bukannya simbolik - dan ia bersedia membayar, dalam bentuk wang dan akses, untuk membuat kes itu.

Apa Yang Akan Datang

Perjanjian Accenture menetapkan beberapa preseden sekali gus: penilai terbenam korporat pertama — bukannya bukan untung — penilai tertanam, tanda harga berbilion dolar pertama yang dilampirkan pada pengawasan AI pihak ketiga, dan ujian sama ada perunding boleh mengaudit sistem yang dibina oleh industri yang membayar mereka dengan boleh dipercayai.

Pengkritik Tidak Yakin

Tidak semua orang melihat program ini sebagai akauntabiliti. Sesetengah pengkritik yang meminta pendekatan yang lebih bertanggungjawab untuk membina kecerdasan buatan melihat skim Amodei untuk mengawal diri industri AI sebagai rancangan untuk mengelak akauntabiliti bagi salah laku model AI — industri yang menandakan kerja rumahnya sendiri dengan alat tulis yang lebih baik.

Anthropic menolak pembingkaian itu. Syarikat itu menegaskan bahawa penilai ini "tidak mengurangkan akauntabiliti kami, tetapi membantu menjadikannya lebih boleh disahkan."

"Keselamatan model kami tetap menjadi tanggungjawab kami," kata Anthropic dalam pengumumannya.

Sama ada METR dan organisasi keselamatan yang lain akhirnya menyertai — dan mengenai syarat pembiayaan — akan memberitahu banyak perkara tentang sama ada penilaian terbenam menjadi pemeriksaan tulen pada AI sempadan, atau lanjutan yang dibiayai dengan baik bagi pasukan komunikasi makmal sendiri. Buat masa ini, Anthropic sekurang-kurangnya telah menjawab soalan pertama percubaannya: pintu pagar terbuka, dan orang pertama yang melaluinya membawa lencana Accenture.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →