Anthropic nerbitake sakumpulan pangukuran dhiri sing rinci ing dina Sabtu sing dimaksudake supaya masarakat, wartawan lan pamrentah nglacak sepira cepet wates AI sing sejatine dikembangake - kalebu indeks pisanan saka jinis riset perusahaan saiki ditindakake dening AI, lan pambocoran sing kira-kira 30,000 agen AI nindakake riset lan karya teknik ing perusahaan apa wae.
Kiriman kasebut, kanthi irah-irahan "Pengukuran kanggo mangerteni jangkah pangembangan AI ing laboratorium perbatasan," teka ing tengah argumen sing paling penting ing industri: apa pembangunan perbatasan kudu sengaja kalem. Dario Amodei njaluk koordinasi kanggo "nyepetake wates," proposal sing wis goyangake pasar, nggawe tuntutan hukum konsumen sing nyatakake kolusi pacing ing antarane laboratorium utama, lan njaluk Presiden Trump ngumumake "Angkatan AI" sing darmabakti kanggo nyegah kalem. Framing Anthropic jelas babagan konteks kasebut: "Nalika jagad nganggep alon-alon pangembangan AI perbatasan, masarakat butuh informasi luwih akeh."
Telung Pangukuran kanggo Nelusuri Kemajuan AI
Perusahaan kasebut nyedhiyakake telung area pangukuran sing ujar manawa lab perbatasan bisa diterbitake kanthi rutin:
1. Pira jumlah R&D AI sing ditindakake dening AI dhewe. Anthropic nggawe prototipe "Indeks Otomasi R&D Anthropic" kanthi menehi katalog saben jinis riset lan pangembangan AI sing ditindakake ing perusahaan, menehi rating carane otomatis saben tugas saiki, lan nglumpukake asil. Rating kasebut nggunakake skala "Automation Level" umum Epoch AI, sing diwiwiti saka AL0 (ora ana keterlibatan AI) nganti AL5 (AI beroperasi kanthi otonom tanpa manungsa ing daur ulang). Ing skala iki, AL3 tegese AI "kolaborasi" - nindakake potongan gedhe ing arah manungsa sing cedhak - dene AL4 tegese AI "mimpin," ngrampungake sebagian besar tugas kanthi cepet saka pituduh tingkat dhuwur nalika manungsa ngawasi.Titik indeks kasebut yaiku kanggo ngukur sepira cedhake lab apa wae kanggo perbaikan diri rekursif - model kanthi otonom mbangun penerus dhewe. Anthropic nyathet yen model sing nyepetake pangembangan AI "bisa nggawe luwih tantangan kanggo manungsa kanggo mangerteni utawa ngontrol sistem kasebut."
2. Sepira apike tumindak agen AI diawasi. Iki ngendi angka 30.000 katon. Ing wulan Agustus 2026, kira-kira 30,000 agen nindakake riset lan karya teknik ing sawayah-wayah ing platform internal Anthropic sing paling akeh digunakake, delegasi tugas menyang siji liyane lan makarya kanthi semi-otonom kanggo wektu sing suwe. Perusahaan ngukur telung perkara babagan pengawasan agen kasebut: jangkoan (bagean tumindak agen sing ngliwati monitor sadurunge utawa sawise eksekusi), review latency (sepira cepet tumindak sing ditandhani ditinjau, pisanan dening monitor otomatis banjur dening manungsa), lan tingkat eskalasi (bagean aktivitas sing diblokir, dialihake, utawa diwenehi tandha kanggo ditinjau).Data pemantauan Anthropic nganti saiki nuduhake agen individu arang banget tumindak salah - nanging perusahaan ngelingake yen "nalika ana yuta utawa milyaran agen sing beroperasi ing ekonomi, malah acara langka bisa kedadeyan kanthi rutin."
3. Cara ngitung dialokasikan. Pangukuran katelu nglacak cara distribusi sumber daya komputasi lab — input mentah sing ana hubungane karo kapabilitas model. Bebarengan karo rong metrik liyane, Anthropic ujar manawa iki menehi wong njaba cara kanggo nggandhengake input model karo output model, nglengkapi evaluasi kemampuan sing wis diterbitake perusahaan liwat laporan risiko Responsible Scaling Policy.Nomer Bakal Obah Ing Kalem
Garis sing paling politis ing postingan kasebut langsung ditujokake kanggo debat pacing: Anthropic nyatakake yen "bakal nyana angka kasebut bakal owah yen ana koordinasi babagan pacing wates, kaya sing diarani CEO Anthropic Dario Amodei." Ing tembung liya, yen industri kasebut alon-alon, metrik kasebut minangka cara masarakat bisa verifikasi - lan yen perusahaan ngaku maju nalika jumlahe terus mundhak, pangukuran kasebut uga bakal mbukak.
Verifikasi Independen Iku Piece ilang
Anthropic ngakoni kelemahan utama metrik sing dilapurake dhewe: nggunakake model dhewe kanggo ngevaluasi sistem dhewe, tegese model "hakim" bisa nuduhake titik wuta saka model sing dicenthang. Perusahaan uga nyathet kekurangan metodologi umum ing laboratorium, nggawe perbandingan angel.
Obat sing diusulake yaiku nyisipake evaluator pihak katelu independen saka pirang-pirang organisasi ing Anthropic, menehi akses menyang proses internal, sistem lan data sing bisa dibandhingake karo apa sing dideleng tim penilaian risiko internal. Pihak katelu kasebut bakal verifikasi praktik safety, laporan kedadeyan, lan ngawasi metrik anyar. Perusahaan kasebut ujar yen METR, nirlaba evaluasi, sadurunge wis gabung karo platform pemantauan offline kanthi mandiri, lan rencana nerbitake pangukuran kasebut kanthi rutin ing wangun sing bisa diverifikasi dening wong liya.
Pangukuran kasebut ana gandhengane karo proposal Advanced AI Framework Anthropic sing luwih jembar, sing nyedhiyakake "aturan dalan" kanggo rilis model perbatasan, kalebu kewajiban transparansi sing bisa dibutuhake pemerintah - kayata laporan risiko standar.
Tes kanggo Industri Kabèh
Pentinge postingan sing luwih jero bisa uga kompetitif. Anthropic kanthi efektif nantang saben lab perbatasan kanggo nerbitake nomer sing padha, kanthi alesan manawa "pangembang perbatasan bisa nerbitake langkah kasebut kanthi rutin, nggunakake metodologi umum." Yen saingan nolak, kontras dadi titik data dhewe ing debat safety; yen padha setuju, industri entuk yardstick umum pisanan carane cepet AI tenan maju.
Saiki, nomer kasebut dilaporake dhewe dening perusahaan kanthi minat sing jelas babagan obrolan pacing. Nanging dheweke nuduhake apa sing durung ana debat: pangukuran konkrit lan bisa diulang sing bakal nuduhake manawa wates kasebut nyepetake, tetep mantep, utawa bener-bener mudhun.
Tetep Ahead saka AI
Pengungkapan lab Frontier kaya iki saben minggu. Kanggo riset AI lan jangkoan industri liyane, tututi AI Buzz Wire.
Waca warta AI paling anyar →