Anthropic, cumartesi günü kamuoyunun, gazetecilerin ve hükümetlerin yapay zekanın gerçekte ne kadar hızlı geliştirildiğini izlemelerine olanak sağlamayı amaçlayan ayrıntılı bir kişisel ölçüm seti yayınladı; bunlara şirketin kendi araştırmalarının ne kadarının yapay zeka tarafından gerçekleştirildiğine dair türünün ilk örneği olan bir endeks ve yaklaşık 30.000 yapay zeka ajanının herhangi bir anda şirket içinde araştırma ve mühendislik çalışmaları yaptığının açıklanması da dahil.
"Sınır laboratuvarlarında yapay zeka gelişiminin hızını anlamak için ölçümler" başlıklı yazı, sektördeki en önemli tartışmanın merkezine geliyor: Sınır gelişiminin kasıtlı olarak yavaşlatılması gerekip gerekmediği. Dario Amodei'nin "sınırları hızlandırmak" için koordinasyon çağrısında bulunması piyasaları sarstı, büyük laboratuvarlar arasında gizli anlaşma yapıldığı iddiasıyla tüketici davası açtı ve Başkan Trump'ı herhangi bir yavaşlamayı önlemeye adanmış bir "Yapay Zeka Gücü" ilan etmeye sevk etti. Anthropic'in çerçevelemesi bu bağlamla ilgili çok açık: "Dünya yapay zekanın öncü gelişiminin hızını yavaşlatmayı düşünürken, halkın daha fazla bilgiye ihtiyacı var."
Yapay Zeka İlerlemesini Takip Etmek İçin Üç Ölçüm
Şirket, herhangi bir öncü laboratuvarın düzenli olarak yayınlayabileceğini iddia ettiği üç ölçüm alanı belirledi:
1. Yapay Zeka Ar-Ge'sinin ne kadarı yapay zeka tarafından gerçekleştiriliyor. Anthropic, şirkette yapılan her türlü yapay zeka araştırma ve geliştirme çalışmasını kataloglayarak, her görevin şu anda ne kadar otomatik olduğunu derecelendirerek ve sonuçları toplayarak bir "Antropik Ar-Ge Otomasyon Endeksi" prototipi oluşturdu. Derecelendirmeler, Epoch AI'nin AL0'dan (Yapay Zeka katılımı yok) AL5'e (Yapay zeka, döngüde insan olmadan tamamen otonom olarak çalışır) kadar uzanan genel "Otomasyon Düzeyi" ölçeğini kullanıyor. Bu ölçekte, AL3, yapay zekanın "işbirliği yaptığı" (büyük miktarda işi yakın insan yönetimi altında yaptığı) anlamına gelirken AL4, yapay zekanın "liderlik ettiği", bir insan denetlerken bir görevin çoğunu üst düzey bir komuttan uçtan uca tamamladığı anlamına gelir.Endeksin amacı, herhangi bir laboratuvarın yinelenen kişisel gelişime ne kadar yaklaştığını ölçmektir; bu, kendi halefini tamamen özerk bir şekilde inşa eden bir modeldir. Anthropic, yapay zeka gelişimini hızlandıran modellerin "insanların bu sistemleri anlamasını veya kontrol etmesini daha zor hale getirebileceğini" belirtiyor.
2. Yapay zeka ajanlarının eylemleri ne kadar iyi denetleniyor? 30.000 rakamı burada ortaya çıkıyor. Ağustos 2026 itibarıyla yaklaşık 30.000 temsilci, Anthropic'in en çok kullanılan dahili platformunda herhangi bir zamanda araştırma ve mühendislik çalışmaları yapıyor, görevleri birbirlerine devrediyor ve uzun süreler boyunca yarı özerk bir şekilde çalışıyordu. Şirket, bu temsilcilerin gözetimiyle ilgili üç şeyi ölçüyor: kapsam (yürütmeden önce veya sonra bir monitörden geçen aracı eylemlerinin payı), inceleme gecikmesi (işaretlenen eylemlerin önce otomatik bir monitör ve daha sonra bir insan tarafından ne kadar hızlı incelendiği) ve yükseltme oranı (engellenen, yeniden yönlendirilen veya incelenmek üzere işaretlenen etkinliklerin payı).Anthropic'in şu ana kadarki izleme verileri, bireysel temsilcilerin nadiren hatalı davrandığını gösteriyor; ancak şirket, "ekonomide faaliyet gösteren milyonlarca veya milyarlarca temsilci olduğunda, nadir olayların bile düzenli olarak meydana gelebileceği" konusunda uyarıyor.
3. Bilgi işlem nasıl tahsis edilir. Üçüncü ölçüm, laboratuvarın bilgi işlem kaynaklarının, yani model yetenekleriyle ilişkili ham girdinin nasıl dağıtıldığını izler. Diğer iki ölçümle birlikte Anthropic, bunun dışarıdakilere model girdilerini model çıktılarıyla ilişkilendirme yolu sağladığını ve şirketin Sorumlu Ölçeklendirme Politikası risk raporları aracılığıyla halihazırda yayınladığı yetenek değerlendirmelerini tamamladığını savunuyor.Yavaşlama Altında Rakamlar Hareket Edecek
Gönderideki politik açıdan en sivri çizgi doğrudan ilerleme hızı tartışmasını hedef alıyor: Anthropic, "Anthropic CEO'su Dario Amodei'nin çağrısı üzerine, sınırda ilerleme konusunda koordinasyon olması durumunda bu rakamların değişmesini bekleyeceğini" belirtiyor. Başka bir deyişle, eğer endüstri gerçekten yavaşlarsa, bu ölçümler halkın bunu nasıl doğrulayabileceğini gösterir ve eğer şirketler sayıları artmaya devam ederken ilerleme kaydettiklerini iddia ederlerse, ölçümler bunu da ortaya çıkaracaktır.
Bağımsız Doğrulama Eksik Parçadır
Anthropic, kendi bildirdiği ölçümlerin merkezi zayıflığını kabul ediyor: kendi sistemlerini değerlendirmek için kendi modellerini kullanıyor; bu da "yargıç" modelinin, kontrol edilen modelin kör noktalarını paylaşabileceği anlamına geliyor. Şirket ayrıca laboratuvarlar arasında ortak bir metodolojinin bulunmamasının karşılaştırmaları zorlaştırdığını da belirtiyor.
Önerilen çözüm, birden fazla kuruluştan bağımsız üçüncü taraf değerlendiricileri Anthropic'e yerleştirmek ve onlara dahili risk değerlendirme ekiplerinin gördükleriyle karşılaştırılabilir dahili süreçlere, sistemlere ve verilere erişim sağlamaktır. Bu üçüncü taraflar güvenlik uygulamalarını doğrulayacak, olayları raporlayacak ve yeni ölçümleri izleyecek. Şirket, kar amacı gütmeyen değerlendirme kuruluşu METR'nin daha önce bağımsız olarak çevrimdışı izleme platformunu yeniden oluşturduğunu ve bu ölçümleri başkalarının doğrulayabileceği bir biçimde düzenli olarak yayınlamayı planladığını söyledi.
Ölçümler, standartlaştırılmış risk raporları gibi hükümetlerin talep edebileceği şeffaflık yükümlülükleri de dahil olmak üzere, sınır model sürümleri için "yol kurallarını" belirleyen Anthropic'in daha geniş Gelişmiş Yapay Zeka Çerçevesi teklifiyle bağlantılı.
Tüm Sektöre Yönelik Bir Test
Gönderinin daha derin önemi rekabetçi olabilir. Anthropic, "herhangi bir öncü geliştiricinin bu ölçümleri halka açık bir metodoloji kullanarak düzenli olarak yayınlayabileceğini" öne sürerek, her sınır laboratuvarını aynı sayıları yayınlamaya etkili bir şekilde zorluyor. Rakipler gerilerse, güvenlik tartışmasında karşıtlık başlı başına bir veri noktası haline gelir; Eğer aynı fikirde olurlarsa endüstri, yapay zekanın gerçekten ne kadar hızlı ilerlediğini gösteren ilk ortak ölçütü elde etmiş olacak.
Şimdilik rakamlar, ilerleme hızı konuşmasıyla açıkça ilgilenen bir şirket tarafından bizzat raporlanıyor. Ancak bunlar tartışmada eksik olan bir şeyi temsil ediyor: sınırın hızlanıp hızlanmadığını, sabit kalıp kalmadığını veya gerçekten yavaşladığını gösteren somut, tekrarlanabilir ölçümler.
Yapay Zekanın Önünde Olun
Bunun gibi sınır laboratuvarı açıklamaları haftada bir kez yapılıyor. Daha fazla yapay zeka araştırması ve sektör kapsamı için AI Buzz Wire adresini takip edin.
En son yapay zeka haberlerini okuyun →