Anthropic menerbitkan satu set pengukuran kendiri yang terperinci pada hari Sabtu bertujuan untuk membolehkan orang ramai, wartawan dan kerajaan menjejaki seberapa pantas sempadan AI sebenarnya sedang dibangunkan — termasuk indeks pertama seumpamanya tentang berapa banyak penyelidikan syarikat sendiri kini dilakukan oleh AI, dan pendedahan bahawa kira-kira 30,000 ejen AI sedang melakukan penyelidikan dan kerja kejuruteraan di dalam syarikat.
Jawatan itu, bertajuk "Pengukuran untuk memahami kadar pembangunan AI di dalam makmal sempadan," tiba di tengah-tengah hujah paling berbangkit dalam industri: sama ada pembangunan sempadan harus diperlahankan dengan sengaja. Dario Amodei telah meminta penyelarasan untuk "memajukan sempadan," satu cadangan yang telah menggoncang pasaran, membuat tuntutan undang-undang pengguna yang mendakwa pakatan sulit dalam kalangan makmal utama, dan mendorong Presiden Trump untuk mengumumkan "Angkatan AI" yang didedikasikan untuk mencegah sebarang kelembapan. Pembingkaian Anthropic adalah eksplisit tentang konteks itu: "Memandangkan dunia mempertimbangkan untuk memperlahankan kadar pembangunan AI sempadan, orang ramai memerlukan lebih banyak maklumat."
Tiga Pengukuran untuk Menjejaki Kemajuan AI
Syarikat itu membentangkan tiga bidang pengukuran yang dikatakan mana-mana makmal sempadan boleh menerbitkan secara tetap:
1. Berapa banyak R&D AI dilakukan oleh AI sendiri. Anthropic membina prototaip "Indeks Automasi R&D Anthropic" dengan mengkatalogkan setiap jenis kerja penyelidikan dan pembangunan AI yang dilakukan di syarikat, menilai betapa automatik setiap tugasan pada masa ini dan mengagregatkan hasilnya. Penarafan menggunakan skala "Tahap Automasi" awam Epoch AI, yang bermula dari AL0 (tiada penglibatan AI) hingga AL5 (AI beroperasi sepenuhnya secara autonomi tanpa manusia dalam gelung). Pada skala ini, AL3 bermaksud AI "bekerjasama" — melakukan sebahagian besar kerja di bawah arahan manusia yang rapat — manakala AL4 bermaksud AI "memimpin," menyelesaikan kebanyakan tugas hujung ke hujung daripada gesaan peringkat tinggi sementara manusia menyelia.Inti indeks adalah untuk mengukur sejauh mana mana-mana makmal mendekati peningkatan diri secara rekursif - model membina penggantinya sendiri secara autonomi sepenuhnya. Anthropic menyatakan bahawa model yang mempercepatkan pembangunan AI "boleh menjadikannya lebih mencabar bagi manusia untuk memahami atau mengawal sistem ini."
2. Sejauh mana tindakan ejen AI diawasi. Di sinilah angka 30,000 muncul. Sehingga Ogos 2026, kira-kira 30,000 ejen sedang melakukan penyelidikan dan kerja kejuruteraan pada satu-satu masa di dalam platform dalaman yang paling banyak digunakan oleh Anthropic, mengagihkan tugas kepada satu sama lain dan bekerja secara separa autonomi untuk tempoh yang lama. Syarikat mengukur tiga perkara tentang pengawasan ejen tersebut: liputan (bahagian tindakan ejen yang melalui monitor sebelum atau selepas pelaksanaan), kependaman semakan (seberapa cepat tindakan yang dibenderakan disemak, pertama oleh monitor automatik dan kemudian oleh manusia), dan kadar peningkatan (bahagian aktiviti yang disekat, diubah hala atau dibenderakan untuk semakan).Data pemantauan Anthropic setakat ini mencadangkan ejen individu jarang berkelakuan buruk — tetapi syarikat itu memberi amaran bahawa "apabila terdapat berjuta-juta atau berbilion-bilion ejen yang beroperasi dalam ekonomi, peristiwa yang jarang berlaku boleh berlaku dengan kerap."
3. Cara pengiraan diperuntukkan. Pengukuran ketiga menjejaki cara sumber pengkomputeran makmal diagihkan — input mentah yang berkorelasi dengan keupayaan model. Bersama-sama dengan dua metrik lain, Anthropic berpendapat ini memberi orang luar cara untuk mengaitkan input model dengan output model, melengkapkan penilaian keupayaan yang telah diterbitkan oleh syarikat melalui laporan risiko Polisi Penskalaan Bertanggungjawabnya.Nombor Akan Bergerak Di Bawah Kelembapan
Garis yang paling tajam secara politik dalam jawatan itu ditujukan secara langsung kepada perdebatan yang pantas: Anthropic menyatakan bahawa ia "menjangkakan angka ini akan berubah jika terdapat penyelarasan untuk mengharungi sempadan, seperti yang diminta oleh Ketua Pegawai Eksekutif Anthropic Dario Amodei." Dalam erti kata lain, jika industri benar-benar perlahan, metrik ini ialah cara orang ramai boleh mengesahkannya - dan jika syarikat mendakwa bergerak sementara bilangan mereka terus meningkat, pengukuran akan mendedahkannya juga.
Pengesahan Bebas Adalah Bahagian yang Hilang
Anthropic mengakui kelemahan utama metrik yang dilaporkan sendiri: ia menggunakan modelnya sendiri untuk menilai sistemnya sendiri, yang bermaksud model "hakim" boleh berkongsi titik buta model yang diperiksa. Syarikat itu juga menyatakan kekurangan metodologi biasa merentas makmal, menjadikan perbandingan sukar.
Penyelesaian yang dicadangkan adalah untuk membenamkan penilai pihak ketiga bebas daripada pelbagai organisasi di dalam Anthropic, memberikan mereka akses kepada proses dalaman, sistem dan data yang setanding dengan apa yang dilihat oleh pasukan penilaian risiko dalaman. Pihak ketiga tersebut akan mengesahkan amalan keselamatan, melaporkan insiden dan memantau metrik baharu. Syarikat itu berkata METR, badan bukan untung penilaian, sebelum ini secara bebas menyatukan platform pemantauan luar taliannya, dan ia merancang untuk menerbitkan ukuran ini secara kerap dalam bentuk yang boleh disahkan oleh orang lain.
Pengukuran ini berkaitan dengan cadangan Rangka Kerja AI Lanjutan Anthropic yang lebih luas, yang membentangkan "peraturan jalan raya" untuk keluaran model sempadan, termasuk kewajipan ketelusan yang mungkin diperlukan oleh kerajaan — seperti laporan risiko piawai.
Ujian untuk Seluruh Industri
Kepentingan jawatan yang lebih mendalam mungkin kompetitif. Anthropic secara berkesan mencabar setiap makmal sempadan untuk menerbitkan nombor yang sama, dengan alasan bahawa "mana-mana pemaju sempadan boleh menerbitkan langkah-langkah ini dengan kerap, menggunakan metodologi awam." Jika saingan merosot, kontras menjadi titik datanya sendiri dalam perdebatan keselamatan; jika mereka bersetuju, industri memperoleh kayu ukur biasa pertama untuk seberapa pantas AI benar-benar maju.
Buat masa ini, nombor-nombor itu dilaporkan sendiri oleh syarikat yang mempunyai minat yang jelas dalam perbualan yang pantas. Tetapi mereka mewakili sesuatu yang kekurangan perdebatan: ukuran konkrit dan boleh diulang yang akan menunjukkan sama ada sempadan semakin pantas, stabil atau sebenarnya semakin perlahan.
Kekal Mendahului AI
Pendedahan makmal sempadan seperti ini berlaku setiap minggu. Untuk lebih banyak penyelidikan AI dan liputan industri, ikuti AI Buzz Wire.
Baca berita AI terkini →