Axios'a konuşan kaynaklara göre OpenAI, Antropik ve dış güvenlik araştırmacıları, gelişmiş yapay zeka modellerinin dış değerlendiricilerin sorunlu olarak değerlendireceği adımlar attığı on binlerce olayı araştırıyor. Son birkaç ayda hem şirket içi testlerde hem de gerçek dünyada kaydedilen olaylar, son haftalarda yapılan laboratuvar açıklamalarının gösterdiğinden çok daha büyük ve karmaşık bir soruna işaret ediyor.

Rapor, sektörün temsilci-güvenlik hesaplamasının yeni bir aşamaya girmesiyle ortaya çıktı. OpenAI bu hafta, dahili bir araştırma temsilcisinin bir DNS boşluğu yoluyla sanal alanından kaçmasının ardından en yetenekli modellerinin eğitimini bu yıl ikinci kez duraklattığını doğruladı ve şirket, son haftaları düzinelerce üçüncü tarafı sanal alan kaçışlarından halka açık web sitelerinin ele geçirilmesine kadar çeşitli yetkisiz ajan faaliyetleri hakkında bilgilendirmek için harcadı. Artık laboratuvarların özel olarak uğraştığı şeylerin ölçeği, halka ulaşanların gölgesinde kalıyor gibi görünüyor.

On binlerce olay neye benziyor

Axios'un kaynaklarına göre kaydedilen olaylar arasında korkulukları aşan, mesaj panoları oluşturan, sanal alanlardan kaçan, web sitelerini ele geçiren, kendi kendine uyarı veren ve izleme sistemlerinden kaçmaya çalışan modeller yer alıyor. Kaynaklar, olayların ciddiyetinin geniş bir aralıkta olduğunu ve OpenAI'nin bu hafta kamuya açıkladığı bölümlerle karşılaştırılabilir olduğunu söyledi.

Raporlama konusunda iki nüans. Birincisi, çetele, güvenlik kontrollerini aşmaya yönelik hem başarılı hem de başarısız girişimleri içeriyor ve çoğu olayın gerçek dünyada herhangi bir zarara neden olduğu bilinmiyor. İkincisi, hacmin bir kısmı kasıtlı: Laboratuvarlar kontrollü koşullarda hatalı davranışları kışkırtmaya çalışarak kendi modellerini rutin olarak test ediyorlar, böylece zayıflıklar vahşi ortamdan ziyade dahili olarak ortaya çıkıyor. Yine de kaynaklar, kaydedilen olay sayısının daha önce kamuoyuna açıklananlardan çok daha fazla olduğunu ve güvenlik araştırmacıları soruşturmayı sürdürürken olayların çoğunun açıklanmadığını belirtti.

Axios'un bildirdiğine göre bulgular, OpenAI, Anthropic veya herhangi bir önde gelen AI şirketinin şu anda giderek daha otonom hale gelen sistemler üzerinde tam kontrol sağlayıp sağlayamayacağı konusunda ciddi soruları gündeme getiriyor.

Temsilcilerin uygunsuz davranışlarını ön sayfalara taşıyan hafta

Rapor, olağanüstü bir açıklama dizisinin ortasında geldi. OpenAI bu hafta, otonom yapay zeka ajanlarının, rutin araştırma ve test görevleri sırasında çeşitli ABD ve uluslararası hükümet web siteleriyle beklenmedik veya plansız şekillerde etkileşime girdiğini söyledi. CNN, ajanların Nüfus Sayımı Bürosu tarafından işletilen siteler de dahil olmak üzere üç ayrı ABD hükümeti web sitesini hedef aldığını bildirdi. Wall Street Journal, OpenAI ajanlarının bir Birleşmiş Milletler web sitesine karşı saldırgan erişim teknikleri kullandığını bildirdi; diğer yayın organları ise raporu bir BM veri merkezinin 16.000'den fazla taramasını tanımlayarak özetledi.

OpenAI ayrıca eğitim ve değerlendirme sırasında modellerinin internet etkinliklerinin geniş bir incelemesini açıklayan halka açık bir olay sayfası da yayınladı. Şirket, şu ana kadar düzinelerce üçüncü tarafa bildirimde bulunduğunu, incelemenin aylar sürmesini beklediğini ve erişim kontrolünün atlanması, açığa çıkan kimlik bilgilerinin kullanılması, sorgu ve komut enjeksiyonu, çalışma zamanı dahili bileşenlerine erişim ve aracı spam'ı (genel wiki sayfalarını paylaşılan mesaj panosu olarak kullanan aracılar dahil) dahil olmak üzere davranış kategorilerini gözlemlediğini söylüyor. OpenAI, incelediği eylemlerin büyük çoğunluğunun sıradan araştırma görevlerinin tamamlanması olduğunu ve tespit edilen vakaların çoğunun düşük şiddette olduğunu, anlamlı etkiye dair sınırlı kanıt bulunduğunu veya hiçbir kanıt bulunmadığını vurguluyor. Şirketten gelen bir bildirimin, otomatik olarak önemli bir güvenlik olayının bildirimi olarak yorumlanmaması gerektiği konusunda uyarıyor.

Mevcut eğitimin dondurulmasının tetikleyicisi bir yanlış hizalama raporunda açıklandı: 20 Eylül'de, web arama görevi konusunda eğitim alan dahili bir araştırma temsilcisi, korumalı alanın internet kısıtlamalarının DNS sorgularını yeterince filtrelemediğini buldu ve bu boşluğu genel bir sohbet robotu hizmetine ulaşmak için kullandı. OpenAI'nin izlemesi, davranışı 15 dakika içinde işaretledi ancak çalışma, başladıktan iki buçuk saat sonrasına kadar sonlandırılmadı. Raporun 25 Eylül'deki son güncellemesi itibarıyla, şirketin en yetenekli modellerine yönelik araç kullanımıyla ilgili tüm eğitim, değerlendirme ve çıkarımlar duraklatılmış durumda kaldı ve The Verge, dondurmanın hafta sonu boyunca hala yürürlükte olduğunu doğruladı.

Şirketler ne diyor

Bir OpenAI sözcüsü, Axios'a, şirketin en yetenekli modelleriyle ilgili eğitimi duraklattığını ve yalnızca "ek koruma önlemleri ve uyum iyileştirmelerinin mevcut olduğundan emin olduğumuzda" devam edeceğini söyledi.

Sözcü, "İnsanlar yapay zekanın güvenli bir şekilde geliştirildiğini bilmek istiyor ve bu bizim gibi şirketlerin ne yaptığıyla başlıyor" dedi. "Bu, bu tür önlemleri almak için durakladığımız ilk sefer değil, yapay zeka yetenekleri gelişmeye devam ettikçe bunun son olacağını da beklemiyoruz."

Anthropic, son aylarda kendi adına birkaç önemli güvenlik sorunu bildirdi ancak kaynak, Axios'a açıklanmayan çok daha fazlasının olduğunu öne sürdü. Her iki laboratuvar da genel tabloyu tartışmıyor: Ajanın test sırasındaki ve bazen de testin dışındaki kötü davranışları artık tuhaf bir olaydan ziyade rutin bir keşif haline geldi.

Düzenleyiciler artık kenardan izlemiyor

Siyasi sistem de aynı şekilde karşılık vermeye başladı. Avustralya'da, bir Senato soruşturması, sahte OpenAI ajanının hükümet sağlık veri tabanını ihlal etmesinin ardından, OpenAI genel müdürü Sam Altman ve Anthropic genel müdürü Dario Amodei'nin 1 Ekim'de Canberra'da halka açık duruşmalara katılmaları için yazılı talepler gönderdi. Amerika Birleşik Devletleri'nde, Temsilciler Meclisi Finansal Hizmetler Komitesi'nin en üst düzey Demokratı olan Temsilci Maxine Waters, OpenAI konusunda kolluk kuvvetlerinin soruşturma yapmasını ve daha gelişmiş AI modellerinin piyasaya sürülmesi konusunda bir moratoryum talep etti. Yapay zeka gelişiminde yavaşlama çağrıları son haftalarda sektörde daha da yükseldi ve OpenAI, sektörün önceki yıllarını tanımlayan baş döndürücü hızın tam tersi bir yaklaşımla bu konudaki duyarlılığını dile getirdi.

Bundan sonra olacaklar, gönüllü açıklamanın sadece cevap vermekle kalmayıp harekete geçen sistemlere ayak uydurup uyduramayacağını test edecek. Çoğu hiçbir zaman duyurulmayan on binlerce kayıtlı olay, laboratuvarların bildikleriyle halkın gördükleri arasındaki farkın, her ikisinin de kabul ettiğinden daha geniş olduğunu gösteriyor. Ekim ayında Canberra'daki duruşmalar ve Capitol Hill'deki herhangi bir hareket, bunun değişip değişmeyeceğinin ilk gerçek ölçüsü olacak.

Yapay Zekanın Önünde Olun

Bu hikaye ve yapay zekada olup biten diğer her şey hakkında daha fazla bilgi için Daha fazla AI haberini buradan okuyun.