Anthropic menerbitkan serangkaian pengukuran mandiri yang terperinci pada hari Sabtu yang dimaksudkan agar publik, jurnalis, dan pemerintah dapat melacak seberapa cepat AI frontier sebenarnya sedang dikembangkan – termasuk indeks pertama mengenai seberapa banyak penelitian yang dilakukan perusahaan kini dilakukan oleh AI, dan pengungkapan bahwa sekitar 30.000 agen AI sedang melakukan penelitian dan pekerjaan rekayasa di dalam perusahaan pada saat tertentu.

Postingan tersebut, berjudul "Pengukuran untuk memahami laju pengembangan AI di dalam laboratorium perbatasan," menjadi inti dari argumen paling penting dalam industri ini: apakah pengembangan perbatasan harus sengaja diperlambat. Dario Amodei telah menyerukan koordinasi untuk “pace the frontier,” sebuah proposal yang telah mengguncang pasar, menarik gugatan konsumen yang menuduh adanya kolusi antar laboratorium besar, dan mendorong Presiden Trump untuk mengumumkan “AI Force” yang didedikasikan untuk mencegah perlambatan apa pun. Pembingkaian Anthropic secara eksplisit berkaitan dengan konteks tersebut: "Ketika dunia mempertimbangkan untuk memperlambat laju pengembangan AI, masyarakat memerlukan lebih banyak informasi."

Tiga Pengukuran untuk Melacak Kemajuan AI

Perusahaan menetapkan tiga area pengukuran yang menurut mereka dapat dipublikasikan secara teratur oleh laboratorium perbatasan mana pun:

1. Seberapa banyak penelitian dan pengembangan AI dilakukan oleh AI itu sendiri. Anthropic membuat prototipe "Indeks Otomasi Penelitian dan Pengembangan Anthropic" dengan membuat katalog setiap jenis penelitian dan pengembangan AI yang dilakukan di perusahaan, menilai seberapa otomatis setiap tugas saat ini, dan menggabungkan hasilnya. Pemeringkatan tersebut menggunakan skala "Tingkat Otomatisasi" publik Epoch AI, yang dimulai dari AL0 (tidak ada keterlibatan AI) hingga AL5 (AI beroperasi sepenuhnya secara mandiri tanpa ada manusia yang terlibat). Pada skala ini, AL3 berarti AI "berkolaborasi" - melakukan sebagian besar pekerjaan di bawah arahan manusia - sedangkan AL4 berarti AI "memimpin", menyelesaikan sebagian besar tugas secara end-to-end dari perintah tingkat tinggi sementara manusia mengawasi.

Inti dari indeks ini adalah untuk mengukur seberapa dekat laboratorium mana pun dalam melakukan pengembangan mandiri secara rekursif - sebuah model yang secara mandiri membangun penerusnya sendiri. Anthropic mencatat bahwa model yang mempercepat pengembangan AI "dapat mempersulit manusia untuk memahami atau mengendalikan sistem ini."

2. Seberapa baik tindakan agen AI diawasi. Di sinilah angka 30.000 muncul. Pada bulan Agustus 2026, sekitar 30.000 agen melakukan penelitian dan pekerjaan rekayasa pada satu waktu di dalam platform internal Anthropic yang paling banyak digunakan, mendelegasikan tugas satu sama lain dan bekerja secara semi-otonom untuk jangka waktu yang lama. Perusahaan mengukur tiga hal tentang pengawasan terhadap agen-agen tersebut: cakupan (bagian tindakan agen yang melewati monitor sebelum atau setelah eksekusi), latensi peninjauan (seberapa cepat tindakan yang ditandai ditinjau, pertama oleh monitor otomatis dan kemudian oleh manusia), dan tingkat eskalasi (bagian aktivitas yang diblokir, dialihkan, atau ditandai untuk ditinjau).

Data pemantauan Anthropic sejauh ini menunjukkan bahwa agen individu jarang berperilaku buruk – namun perusahaan memperingatkan bahwa “ketika ada jutaan atau milyaran agen yang beroperasi dalam perekonomian, kejadian langka sekalipun dapat terjadi secara teratur.”

3. Cara komputasi dialokasikan. Pengukuran ketiga melacak cara sumber daya komputasi lab didistribusikan — masukan mentah yang berkorelasi dengan kemampuan model. Bersama dengan dua metrik lainnya, Anthropic berpendapat bahwa hal ini memberikan pihak luar cara untuk mengkorelasikan masukan model dengan keluaran model, melengkapi evaluasi kemampuan yang telah dipublikasikan perusahaan melalui laporan risiko Kebijakan Penskalaan yang Bertanggung Jawab.

Angka Akan Bergerak Saat Perlambatan

Kalimat paling politis dalam postingan tersebut ditujukan langsung pada perdebatan mengenai kecepatan: Anthropic menyatakan bahwa mereka "akan memperkirakan angka-angka ini akan berubah jika ada koordinasi dalam menentukan kecepatan, seperti yang diserukan oleh CEO Anthropic Dario Amodei." Dengan kata lain, jika industri benar-benar mengalami perlambatan, metrik inilah yang dapat digunakan oleh publik untuk memverifikasinya — dan jika perusahaan mengklaim bahwa mereka sedang mondar-mandir sementara jumlah mereka terus meningkat, pengukuran tersebut juga akan mengungkap hal tersebut.

Verifikasi Independen Adalah Bagian yang Hilang

Anthropic mengakui kelemahan utama dari metrik yang dilaporkan sendiri: ia menggunakan modelnya sendiri untuk mengevaluasi sistemnya sendiri, yang berarti model "hakim" dapat berbagi titik buta dari model yang sedang diperiksa. Perusahaan juga mencatat kurangnya metodologi umum di seluruh laboratorium, sehingga membuat perbandingan menjadi sulit.

Solusi yang diusulkan adalah dengan memasukkan evaluator pihak ketiga independen dari berbagai organisasi ke dalam Anthropic, sehingga memberi mereka akses ke proses, sistem, dan data internal yang sebanding dengan apa yang dilihat oleh tim penilai risiko internal. Pihak ketiga tersebut akan memverifikasi praktik keselamatan, melaporkan insiden, dan memantau metrik baru. Perusahaan tersebut mengatakan bahwa METR, lembaga nirlaba evaluasi, sebelumnya telah secara independen menyusun kembali platform pemantauan offline-nya, dan berencana untuk mempublikasikan pengukuran ini secara berkala dalam bentuk yang dapat diverifikasi oleh orang lain.

Pengukuran tersebut terkait dengan proposal Kerangka Kerja AI Tingkat Lanjut yang lebih luas dari Anthropic, yang menjabarkan “aturan jalan” untuk peluncuran model terdepan, termasuk kewajiban transparansi yang mungkin diwajibkan oleh pemerintah – seperti laporan risiko yang terstandarisasi.

Ujian untuk Seluruh Industri

Arti penting yang lebih dalam dari postingan tersebut mungkin bersifat kompetitif. Anthropic secara efektif menantang setiap laboratorium terdepan untuk mempublikasikan angka yang sama, dengan alasan bahwa "setiap pengembang terdepan dapat mempublikasikan langkah-langkah ini secara teratur, menggunakan metodologi publik." Jika pesaingnya menolak, perbedaan tersebut akan menjadi data tersendiri dalam perdebatan mengenai keselamatan; jika mereka setuju, maka industri ini akan mendapatkan tolok ukur umum pertama mengenai seberapa cepat kemajuan AI.

Untuk saat ini, angka-angka tersebut dilaporkan sendiri oleh perusahaan yang jelas-jelas tertarik dengan topik ini. Namun hal-hal tersebut mewakili sesuatu yang kurang dalam perdebatan ini: pengukuran yang konkrit dan dapat diulang yang akan menunjukkan apakah garis depan mengalami percepatan, kestabilan, atau justru melambat.

Tetap Terdepan dalam AI

Pengungkapan laboratorium Frontier seperti ini terjadi setiap minggu. Untuk mengetahui lebih banyak penelitian AI dan liputan industri terkini, ikuti AI Buzz Wire.

Baca berita AI terkini →