Anthropic, otomatik yapay zeka sistemlerinin bir modelin hizalama hatalarını güvenilir bir şekilde onarabildiğini gösteren bir araştırma yayınladı; bu sonuç, yapay zeka endüstrisinin merkezindeki güvenlik çalışmalarının nasıl yapıldığını yeniden şekillendirebilir. "Otomatik Araştırmacılar Hizalama Hatalarını Güvenilir Bir Şekilde Azaltabilir" başlıklı makale Cuma günü yayınlandı ve TechCrunch tarafından ayrıntılarıyla anlatıldı.
Araştırma Anthropic'in arkadaş programından çıktı ve Chen Yueh-Han tarafından yönetildi. Temel iddiası çarpıcı: Şirketin otomatik araştırma sistemleri, belirli yanlış hizalanmış davranışları ölçen on kıyaslamaya yönlendirildiğinde, modelin genel yeteneklerini bozmadan her birinde performansı artırdı. Güvenlik çalışmalarını model ölçeğine uygun tutmakta zorlanan bir alan için bu dikkate değer bir sonuçtur. For more context on this story, see our ongoing AI trends.
Hikaye yapay zeka güvenliği kapsamının yoğun olduğu bir dönemde ortaya çıktı. Bu, OpenAI'nin ödül korsanlığı ajanları hakkındaki dahili raporundan Hugging Face ihlaline ilişkin bağımsız soruşturma çağrılarına kadar, ajanların kötü davranışlarının manşetlere hakim olduğu bir yazı takip ediyor. Anthropic'in yeni makalesi soruna ters yönden yaklaşıyor: ajanların nasıl kötü davrandığını sormak yerine, bunları düzeltme konusunda diğer ajanlara güvenilip güvenilemeyeceğini sorguluyor.
Makale Aslında Neyi Bildiriyor
Makalede açıklanan sisteme Otomatik Hizalama Araştırmacısı veya AAR adı verilmektedir. AAR, araştırma sürecini değiştirmek yerine, çoğunu kopyalıyor: her otomatik sistem mevcut literatürü araştırıyor, bir yöntem öneriyor ve modeli bu yöntemi kullanarak yaklaşık 30 dakika boyunca eğitiyor. İşlem daha sonra birkaç yinelemede tekrarlanır.
Seçim mekanizması basittir. Karşılaştırma ölçütünü harekete geçiren yöntemler korunur; atılmayan yöntemler atılır. Bu döngü, sistemin hızlı bir şekilde ve hiçbir insan ekibinin eşleşemeyeceği bir ölçekte çalışmasını, birçok araştırma yönünü paralel olarak test etmesini ve yalnızca işe yarayanları tutmasını sağlar.
Makaleye göre sonuçlar genel olarak tutarlıydı. Belirli yanlış hizalanmış davranışları kapsayan on kıyaslamanın tamamında, otomatik sistemler, genel model performansına zarar vermeden ölçülebilir iyileştirmeler üretti; bu, hizalama işini zorlaştıran olağan bir ödünleşimdir.
Makalede, "Genel olarak bu sonuçlar, eğitim sonrası otomatik hizalamanın yakın vadede pratik hale gelebileceğine dair erken kanıtlar sağlıyor" ifadesine yer veriliyor.
İnsanları Yenmek, Maliyetin 1/37'si
Makalede en çok alıntı yapılan pasajlar, AAR'ı doğrudan insan muadilleriyle karşılaştıran pasajlardır. Antropik karşılaştırmadan kaçınmadı.
Makalede "En iyi AAR yöntemi, deneyimli insanların önerdiği yöntemi ortalama altı saat içinde geride bırakıyor" yazıyor. Ayrıca şunu da ekliyor: "İnsanın yönlendirdiği araştırma talimatları daha güçlü bir performansa yol açmıyor."
Ekonomi de aynı derecede kör. Yazarlar şöyle yazıyor: "İnsan araştırmacılarımıza ödediğimiz saat başına 150 ABD dolarına karşılık, bir AAR'ın API çıkarımı açısından saat başına kabaca 4 ABD doları maliyeti var." Bu neredeyse 40 katlık bir maliyet farkı anlamına geliyor ve laboratuvarların otomatik araştırmayı neden bir meraktan öte ciddiye aldığını açıklıyor.
Maliyet Farkı Neden Önemli?
Hizalama araştırması, hafife alınması kolay bir şekilde pahalıdır. Her aday müdahalesinin uygulanması, eğitilmesi ve kriterlere göre değerlendirilmesi gerekir ve adayların çoğu başarısız olur. Eğer bir sistem API çağrıları karşılığında bu arama döngüsünü sürekli çalıştırabiliyorsa, bir fikir daha denemenin marjinal maliyeti sıfıra yaklaşır. Kısıtlama kişi sayısından hesaplamaya doğru değişiyor.
Sınırlamalar Antropik Kendisi İşaretledi
Makale, sonucun neyi ortaya koymadığı konusunda samimi. Otomatik sistem yalnızca kıyaslamaların gerçekten önemli olan hizalama hedeflerini yansıttığı ölçüde çalışır ve gerçek dünyadaki hatalı davranışları tespit eden kıyaslamaların oluşturulması ve sürdürülmesi bu alanda açık bir sorun olmaya devam etmektedir.
Ayrıca gözden kaçması kolay bir bağımlılık da var: otomatikleştirilmiş araştırmacılar mevcut yöntem literatüründen yararlanıyor. Bu literatürü korumak ve genişletmek başlı başına önemli bir iştir ve yalnızca bilinen teknikleri yeniden karıştıran bir sistem, insan yaratıcılığının ulaşamayacağı bir tavana ulaşabilir.
Bu uyarılar önemlidir çünkü araştırmanın uzun vadeli önemi bunlara bağlıdır. Karşılaştırmalı değerlendirmeler yanlış şeyleri ölçerse, AAR, altta yatan risklere dokunulmadan güçlü rakamlara giden yolu optimize edebilir. Anthropic'in çerçevelemesi (çözüm değil "erken kanıtlar") bu belirsizliği yansıtıyor.
Özyinelemeli Kişisel Gelişime Doğru Bir Adım
Makale aynı zamanda özyinelemeli kişisel gelişim hakkında daha büyük bir tartışmayı da besliyor; yapay zeka sistemlerinin eninde sonunda onları üreten eğitim süreçlerini iyileştirebileceği fikri. Yapay zeka modellerini diğer yapay zeka modelleriyle eğitmek, sınır laboratuvarları için popüler bir hedef haline geldi ve Anthropic'in sonucu, bunun dar bir alanda nasıl göründüğüne erken ve somut bir bakış oldu.
Mantık basittir. Modeller kendi hizalama eğitimlerini güvenilir bir şekilde geliştirebilirse, aynı makine makul bir şekilde yetenek çalışmaları da dahil olmak üzere daha geniş anlamda eğitim uygulamalarına yönlendirilebilir. TechCrunch, insan yapay zeka araştırmacılarının eninde sonunda süreçte daha az merkezi hale gelebileceği imasına dikkat çekiyor; bu, makalenin kendisinin kaçınmak yerine meşgul olduğu bir olasılık.
Sırada Ne İzlemeli?
Bu sonucun genellenip genellenemeyeceğini üç soru belirleyecek. İlk olarak, yaklaşımın Anthropic tarafından test edilen on kriterin dışında olup olmadığı, daha karmaşık ve daha az iyi tanımlanmış başarısızlık modları üzerinde geçerli olup olmadığı. İkincisi, karşılaştırmalı değerlendirme sorununun, otomatik araştırmayı dürüst tutacak kadar hızlı çözülüp çözülemeyeceğidir. Üçüncüsü, diğer laboratuvarların karşılaştırılabilir sonuçlar yayınlayıp yayınlamadığı, bu da tek bir makaleyi endüstri yönüne dönüştürebilir.
Şimdilik, bulgu dar ama gerçek: Antropiklerin test ettiği belirli hizalama görevlerinde, otomatikleştirilmiş araştırmacılar deneyimli insanlardan daha hızlı ve çok daha ucuz bir performans gösterdi. Yapay zeka endüstrisinin güvenlik tarafı, işin çoğunu insanların değil yapay zeka araştırmacılarının yaptığı ilk yer olabilir.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
