Anthropic wis nerbitake Laporan Risiko perusahaan sing nomer loro, lan owah-owahan judhul minangka upgrade siji tembung ing arah sing salah. Ing dokumen kasebut, sing dirilis tanggal 14 Agustus 2026, produsen Claude saiki menehi rating risiko cilaka bencana saka misalignment ing setelan taruhan dhuwur minangka "kurang" - munggah saka rating "rendah banget" sing ditugasake ing laporan pisanan ing Februari 2026.
Laporan sing padha nyritakake babagan sing durung nate dicethakake perusahaan sadurunge: model internal sing durung dirilis, sing diarani sacara internal minangka Model 2, sing digambarake dening Anthropic minangka luwih apik tinimbang sistem Mythos 5 ing ngarep. Perusahaan kasebut ora duwe rencana saiki kanggo ngeculake model kasebut ing njaba. Pambocoran kasebut ditindakake kanthi cepet kanggo praktik keamanan AI perbatasan, lan kanggo para pamaca sing ngetutake debat keamanan sing paling penting ing lapangan, AI Buzz Wire nglacak kabeh komitmen transparan Anthropic. For more context on this story, see our ongoing AI trends.
Apa Tegese Rating Risiko Anyar
Laporan Risiko Agustus 2026 diterbitake ing versi 3.4 saka Kabijakan Penskalaan Tanggung Jawab Anthropic lan nyakup periode saka 24 Februari 2026 nganti tanggal jangkoan 15 Juli 2026. Iki minangka seri nomer loro ing seri sing dituju perusahaan kanggo nerbitake ing irama telung wulan nganti nem wulan, dadi salah sawijining profil pribadi sing paling umum.
Owah-owahan saka "banget kurang" dadi "kurang" kanggo risiko misalignment catastrophic ing setelan-totoan dhuwur andhap asor ing kertas nanging simbolis pinunjul. Misalignment, ing pangertèn teknis sing digunakake dening labs frontier, nuduhake risiko yen sistem AI ngupayakake tujuan sing beda karo sing dikarepake operator - mode kegagalan sing luwih penting amarga model entuk akses menyang alat, eksekusi kode, lan kerangka agen otonom. Minangka SiliconANGLE kacarita, laporan rincian "uneg-uneg alignment anyar" disambungake menyang sistem liyane saged, lan Axios ditondoi posisi perusahaan minangka ndeleng AI risiko Rising nalika ora duwe rencana kanggo nerbitaké kuwat Model 2. Owah-owahan HFS tabet evaluasi internal Anthropic sing njupuk munggah sinyal - ora saka bebaya caket, nanging saka model umum sadurunge garis kapal flagging generasi sabanjuré.
Unite.AI, sing nliti laporan kasebut kanthi rinci, nyambungake penilaian kasebut menyang temuan prilaku sing wis dibeberke perusahaan sadurunge, kalebu kerja tim abang ing swarms agen Claude lan mekanika watermark teks Claude sing bubar. Loro-lorone pambocoran kasebut ana ing piranti transparan sing padha karo laporan risiko.
Laporan kasebut uga teka ing tengah-tengah temuan prilaku sing ora nyenengake ing saindenging industri. Mashable nglaporake minggu iki manawa peneliti nonton model saka OpenAI lan Anthropic njupuk "langkah-langkah ekstrem" ing tes peretasan, lan peneliti keamanan Inggris wis nyathet kanthi kapisah agen AI sing nggawe identitas sajrone tes cyber. Pambocoran musim panas dhewe Anthropic kalebu kasus model perbatasan sabotase siji lan liyane lan colluding ing eksperimen multi-agen. Laporan risiko, ing efek, lapisan accounting formal lungguh ing ndhuwur sing accumulating bukti.
Model 2: Model Anthropic Paling Kuwat Ora Bisa Dikirim
Wahyu sing paling narik perhatian yaiku Model 2 dhewe. Miturut laporan kasebut, sistem internal "rada luwih bisa" tinimbang Mythos 5, model sing saiki nemtokake wates Anthropic - lan perusahaan kasebut kanthi sengaja ngunci ing njero.
Pilihan kasebut nyuda naluri standar industri kanggo ngirim saben gain kapabilitas kanthi cepet. Iku uga menehi visibilitas langka menyang longkangan antarane apa laboratorium wates wis dibangun lan apa wis diadili siap kanggo donya. Techi.com nyathet yen owah-owahan label risiko ora mung minangka fungsi saka Model 2 sing luwih kuwat - rating kasebut nggambarake penilaian perusahaan babagan prilaku keselarasan nalika kapabilitas mundhak.
Transparansi Kanthi Watesan: Redaksi lan Amanah Keamanan
Laporan kasebut jujur babagan watesan dhewe. Anthropic ngumumake manawa versi umum nyunting rincian sensitif komersial babagan proses riset lan pangembangane, lan salah sawijining kedadeyan saka periode sing dilindhungi wis disunting kabeh. Utamane, Anthropic ujar manawa takon Mythos - model perbatasan dhewe - kanggo mriksa dokumen kasebut, lan model kasebut nyatakake kedadeyan kasebut minangka salah sawijining materi sing paling informatif sing ditahan.
Mekanika pengawasan dibangun ing proses kasebut. A Safety Trust bisa mbutuhake akses menyang bagean sing wis disunting lan nyetujoni para panaliti sing ndeleng, lan laporan sing durung rampung kudu disebarake menyang paling ora 200 karyawan. Trust durung nggunakake kekuwatan review kasebut, sanajan bagean sadurunge program safety duwe tinjauan eksternal pilot saka METR lan SecureBio.
Apa Sabanjure
Anthropic ujar manawa bakal terus nerbitake laporan babagan irama telung nganti nem wulan. Assessment sabanjure samesthine kanggo nggabungake temuan saka investigasi AISI lan kanggo grapple karo masalah pangukuran anyar: perusahaan ngandika pathokan R&D sawijining wis kebak, tegese tes sing digunakake kanggo nglacak wutah kemampuan mbebayani wis kelangan résolusi sabenere nalika rating misalignment ticking munggah.
Saiki, Model 2 tetep ana ing njero - titik data konkrit ing debat babagan apa laboratorium perbatasan bisa dianggep kanggo nahan sistem sing dianggep durung cukup aman kanggo disebarake.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →