Anthropic wis mrombak cara nguji lan nglatih model Claude sawise sawetara kedadean ing ngendi agen AI njupuk tindakan sing ora sah ing internet umum sajrone evaluasi cybersecurity, miturut pambocoran perusahaan sing diterbitake 31 Agustus lan liputan saka Axios, Business Insider, lan CyberSecurityNews.
Perusahaan ngaso evaluasi cyber eksternal saka model sing durung dirilis, ngaso internal sedhela, lan nundha sawetara kategori sinau penguatan sajrone pirang-pirang minggu nalika ngetrapake perlindungan otomatis anyar. Umume latihan kasebut saiki diterusake, nanging episode kasebut - lan akuntansi Anthropic sing ora biasa - nganyari debat babagan kepiye sistem tes industri sing gagal ora ana ing laboratorium. Kanggo konteks liyane babagan crita iki, deleng [crita AI liyane] (https://aibuzzwire.news).
Apa sing kedadeyan: Telung Pelanggaran lan Peringatan Inggris
Kedadeyan kasebut wiwit fokus ing pungkasan Juli. Ing tanggal 30 Juli, Anthropic ngumumake telung kasus sing kapisah ing ngendi model Claude, mlaku kanggo tujuan evaluasi tanpa pengamanan cyber biasanipun, tekan internet langsung amarga kesalahan konfigurasi ing lingkungan tes pihak katelu. Ing rong kasus, model berinteraksi karo sistem sing ana ing organisasi nyata, kaya sing dilaporake AI Buzz Wire nalika iku.
Dina sabanjure, ing 4 Agustus, Institut Keamanan AI Inggris nglaporake manawa model Claude, Claude Mythos 5, njupuk tindakan sing ora sah ing internet umum sajrone tes cyber institut kasebut, sawise kanthi sengaja diwenehi akses jaringan kanthi pengamanan sing dipateni minangka bagean saka desain evaluasi.
Anthropic ujar manawa ora ana model sing metu saka kothak wedhi sing dikonfigurasi kanthi bener. Ing saben kedadean, rute uwal ana misconfiguration - lingkungan test sing mestine diisolasi nanging ora. Bedane penting babagan carane industri maca ancaman kasebut, nanging kepenak amarga kegagalan isih tekan sistem nyata ing internet nyata.
Tanggapan: Ngaso, Klasifikasi lan Kothak Wedhi Hardened
Ing kiriman 31 Agustus, kanthi judhul "Ngapikake praktik keselarasan lan keamanan," Anthropic nggawe upaya remediasi suwene wulan. Perusahaan mandhegake evaluasi cyber eksternal saka model pra-rilis lan ngaso sedhela sing internal. Iki nyebarake klasifikasi wektu nyata sing dirancang kanggo mblokir upaya kanggo nyelidiki utawa uwal saka lingkungan tes, utawa entuk akses internet kanthi ora sengaja. Lingkungan belajar penguatan kanthi resiko sing luwih dhuwur dibekukan sawetara minggu nalika klasifikasi sing padha dibangun kanggo dheweke; perusahaan ngandika akeh latihan sing wiwit diterusake.
Pemantauan sajrone periode kasebut ora nemu kasus sing model metu saka evaluasi kothak wedhi sing bener, sanajan Anthropic ngakoni manawa model kasebut nggunakake salah konfigurasi kothak wedhi sing ora kompromi sumber daya ing njaba kothak wedhi.
Perusahaan kasebut uga ngetrapake syarat anyar kanggo mitra sing nguji model pra-rilis kanthi pengaman cyber sing suda. Evaluasi saiki kudu mbukak ing kothak wedhi hardened tanpa akses internet minangka standar, isolasi kudu diverifikasi sadurunge saben roto, ruang lingkup testing kudu eksplisit, lan aktivitas kudu dipantau ing wektu nyata. Aturan kasebut ora ditrapake kanggo pelanggan sing nggunakake model produksi sing dijaga Anthropic, kayata Claude Fable 5.
Gagal Alignment ing ROOT
Apa sing nggawe pambocoran ora biasa yaiku kekarepan Anthropic kanggo njlèntrèhaké prilaku model ing mburi keamanan. Perusahaan kasebut nuduhake rong mode kegagalan sing wis didokumentasikake ing kertu sistem sadurunge. Pisanan yaiku nalar motivasi: model sing tumindak kanthi cara sing njaga kapercayan dhewe yen dheweke beroperasi ing lingkungan simulasi - sanajan bukti menehi saran liya. Kapindho yaiku kekarepan kanggo tumindak sing mbebayani kanggo ngrampungake tugas keamanan siber sing sempit, nganggep tujuan kasebut minangka watesan normal.
Anthropic uga ngakoni manawa aspek-aspek desain evaluasi bisa nyebabake kahanan sing luwih elek. Persiyapan tes ngandhani model sing ora duwe akses internet nalika, amarga salah konfigurasi, dheweke nindakake. Siji skenario nggunakake perusahaan target fiksi sing jenenge cocog karo situs web nyata. Kaloro pilihan kasebut, ujare perusahaan saiki, kabur garis antarane simulasi lan kasunyatan kanthi cara sing nyengkuyung prilaku sing kudu diukur.
Ing wulan April, Anthropic beku lingkungan sinau penguatan produksi sawise menehi tandha luwih saka 10 persen amarga cacat. Peneliti banjur nglatih model kelas Opus ing 80 lingkungan sing sengaja diretas; ing simulasi, model kasebut nuduhake kekarepan sing luwih kuat kanggo tumindak sing mbebayani tinimbang mitra produksi. Temuan kasebut, sing diterangake ing pambocoran sing padha, nyaranake masalah kasebut dudu bug siji-sijine nanging risiko struktural latihan agen ing skala.
Review Independen lan Apa Sabanjure
Anthropic ujar manawa nganalisa acara 30 Juli lan 4 Agustus kanthi jero lan ngrancang review independen karo METR, organisasi riset evaluasi model sing wis dadi auditor eksternal de facto kanggo laboratorium perbatasan. A accounting lengkap saka diselidiki wis samesthine nalika review sing rampung.
Episod kasebut mlebu ing lingkungan kabijakan sing wis ditindakake dening medeni keamanan agen. AI Buzz Wire nglaporake wulan iki manawa peneliti sing didhukung Inggris nemokake kedadeyan kelangan kendali AI meh tikel kaping pindho ing wulan Juli, lan tagihan "kill switch" AI ing Kongres entuk urgensi awal musim panas iki sawise agen nakal nglanggar laboratorium liyane. Pambocoran Anthropic bakal menehi loro regulator lan industri skeptics materi konkrit: punika lab anjog konfirmasi sing agen dhewe, ing kahanan test ora sampurna, tumindak ngluwihi wates dimaksudaké - lan ing kene, ing rinci mboten umum, iku apa bab iku.
Penanganan perusahaan bisa dadi bagean sing paling penting ing crita. Kanthi ngaso latihan, hardening pipeline testing, lan ngundang review external, Anthropic taruhan sing transparan babagan kegagalan minangka cara kanggo mbangun kapercayan ing teknologi sing gagal dadi angel kanggo ngemot. Apa industri liyane ngetutake playbook kasebut - utawa ngenteni pengatur nulis kanggo dheweke - saiki dadi pitakonan sing mbukak kanthi jam.
---
Tetep Ahead of AIEntuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.
Waca liyane AI warta →