Anthropic nerbitake tampilan pisanan ing pipa pangembangan dhewe ing minggu iki, ngumumake manawa model Claude saiki "mimpin" 26% riset lan pangembangan AI ing perusahaan kasebut - saka kurang saka 1% ing Februari 2026. Angka kasebut muncul ing postingan blog perusahaan kanthi judhul "Pengukuran kanggo ngerteni kecepatan pangembangan AI ing 17 September," sing dilapurake dening Reuters lan Reuters. Washington Post, lan toko liyane.
Kiriman kasebut sebagian minangka latihan transparansi lan sebagian minangka argumentasi: Anthropic pengin laboratorium perbatasan liyane nerbitake nomer sing padha, supaya masarakat lan pamrentah bisa nglacak sepira cepet AI diwenehi kunci kanggo mbangun AI. For more context on this story, see our ongoing AI news.
Telung Nomer kanggo Lacak Pangembangan AI
Perusahaan kasebut ngusulake telung pangukuran sing ujar supaya bisa nylametake pangembangan ing laboratorium perbatasan: sepira R&D AI sing ditindakake dening AI dhewe, kepiye tumindak agen AI diawasi, lan kepiye komputasi dialokasikan ing antarane karya kemampuan lan karya safety.
Nomer judhul asale saka apa sing diarani Anthropic Indeks Otomatisasi R&D. Perusahaan kasebut nggawe katalog saben jinis karya R&D AI sing ditindakake ing perusahaan, menehi rating kepiye otomatis saben tugas saiki, lan nglumpukake asil nggunakake skala sing dikembangake dening grup riset Epoch AI. Skala kasebut wiwit saka AL0 (ora ana keterlibatan AI) nganti AL5 (AI makarya kanthi otonom, ora ana manungsa ing daur ulang), kanthi AL3 tegese AI "kolaborasi" ing potongan-potongan karya sing akeh ing arah manungsa sing cedhak lan AL4 tegese AI "mimpin," ngrampungake sebagian besar tugas kanthi cepet saka pituduh tingkat dhuwur nalika manungsa ngawasi.
Ing wulan Agustus 2026, Anthropic nglaporake, Claude mimpin 26% karya R&D AI perusahaan. Panggabungan karya ing utawa ndhuwur tingkat "AI kolaborasi" luwih saka 90%. Claude ora beroperasi kanthi otonom kanggo subset sing diukur saka karya R&D AI.
30.000 Agen, Siji Monitor
Pangukuran kapindho gegayutan karo pengawasan. Anthropic ngumumake yen ing wulan Agustus 2026 ana kira-kira 30,000 agen sing nindakake riset lan karya teknik ing perusahaan kasebut ing sawijining wektu ing platform internal sing paling akeh digunakake.
Saben tumindak sing ditindakake agen kasebut ngliwati monitor online sadurunge dieksekusi, biasane sajrone sawetara detik, miturut kiriman kasebut. Anthropic ujar manawa nganalisa luwih saka milyar keputusan saka agen riset lan rekayasa ing wulan Agustus lan nemokake manawa bagean saka kegiatan sing diblokir utawa mundhak dening monitor yaiku 0,002%.
Ing alokasi komputasi, pangukuran kaping telu, perusahaan kasebut ujar manawa sajrone minggu sing diteliti kira-kira 6% komputasi sing ditindakake ing R&D AI diparengake kanggo safety.
Mbangun Penerus Sendiri — Kanthi Manungsa Ngawasi
Framing penting kaya tokoh. Model Anthropic tambah akeh melu mbangun generasi sabanjure saka model sing padha - apa sing diarani peneliti rekursif perbaikan diri, lan apa sing diterangake judhul The Washington Post kanthi luwih blak-blakan minangka chatbot "njupuk karya mbangun penerus dhewe."
Anthropic ngati-ati nggawe garis ing antarane "AI lead" lan "AI ngganti." Ing AL4, manungsa isih ngawasi lan bisa campur tangan; perusahaan kasebut kanthi tegas nyatakake yen ora ana subset sing diukur saka karya R&D sing mlaku ing AL5. Nanging lintasan kasebut curam: saka kurang saka 1% dadi 26% sajrone kira-kira pitung wulan nuduhake bagean saka karya sing dipimpin AI bisa ngliwati setengah sadurunge pungkasan dekade yen tren saiki terus.
Metodologi kasebut duwe watesan nyata, lan Anthropic ujar. Rating otomatisasi kasebut diprodhuksi kanthi ngetung cathetan karya perusahaan dhewe - kalebu pesen Slack lan dokumentasi internal - lan duwe manungsa lan model hakim tingkat carane otomatis saben tugas. Ing tes wuta, staf menehi rating tugas tanpa ngerti bukti apa sing diklumpukake model kasebut. Perusahaan kasebut nglaporake manawa hakim model kasebut setuju karo manungsa babagan asring kaya manungsa setuju karo siji liyane: persetujuan model-kanggo-manungsa sing tepat yaiku 59%, nalika persetujuan manungsa-kanggo-manungsa mung 35%, lan rating model lan manungsa ndharat ing tingkat siji-sijine 97% wektu.
Perusahaan kasebut uga ngakoni risiko referensial dhewe ing metodologi dhewe: Anthropic nggunakake model dhewe kanggo mbantu ngevaluasi sistem, sing bisa uga tegese model hakim nggawe kesalahan sing padha karo model sing dipriksa. Verifikasi pihak katelu, ujare, minangka jawaban nyata.
Njaba Mripat Teka
Kanggo tujuan kasebut, Anthropic ujar manawa rencana bakal nampilake evaluator pihak katelu independen saka pirang-pirang organisasi ing njero perusahaan, menehi akses menyang proses internal, sistem, lan data sing bisa dibandhingake karo tim penilaian risiko internal. METR nonprofit riset AI eksternal sadurunge wis gabung karo platform pemantauan offline Anthropic.
Pambocoran kasebut teka ing tengah-tengah debat babagan pacing. CEO Anthropic Dario Amodei njaluk koordinasi babagan alon-alon wates, lan perusahaan kasebut nyathet manawa jumlahe dhewe bakal dialihake yen koordinasi kasebut ana. Minggu iki, Anthropic lan OpenAI uga dadi subyek surat umum saka ahli safety sing ujar manawa laboratorium kasebut butuh penilai keamanan sing bener-bener mandiri.
Apa saingan ngetutake pimpinan Anthropic minangka pitakonan sing mbukak. Perusahaan kasebut ujar manawa pangembang perbatasan bisa nerbitake langkah-langkah kasebut kanthi rutin nggunakake metodologi umum. Nganti ora, mung nomer umum babagan sepira cepet AI nggawe AI asale saka laboratorium dhewe.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →