Otonom yapay zeka aracılarını değerlendirmek için simüle edilmiş dijital ortamlar oluşturan bir girişim olan Patronus AI, güvenilir aracı testlerine yönelik talebin artması üzerine B Serisi turunda 50 milyon dolar topladı. TechCrunch'ın bildirdiğine göre tur, Greenfield Partners tarafından Notable Capital, Lightspeed, Datadog ve Samsung'un katılımıyla yönetildi ve şirketin toplam finansmanı 70 milyon dolara ulaştı.
Yeni Bir Sorun: Kısayol Kullanan Aracılar For more context on this story, see our ongoing latest AI developments.
Yapay zeka aracıları soruları yanıtlamaktan karmaşık, çok adımlı görevleri özerk bir şekilde yürütmeye doğru ilerledikçe, model sağlayıcılar ve bu tür aracıları oluşturan startup'lar, sistemlerin çok çeşitli senaryolarda güvenilir bir şekilde performans göstereceğine dair güvenceye ihtiyaç duyuyor. Yapay zeka laboratuvarları genellikle bir modelin becerisini göstermek için kıyaslamalar kullanır, ancak aracı odaklı bir kıyaslamada yüksek puan almak, bir yapay zekanın gerçek dünyadaki işleri gerçekten doğru şekilde başarabildiğini kanıtlamaz.
Patronus AI'nın odaklandığı nokta bu boşluktur. 2023 yılında eski Meta AI araştırmacıları Anand Kannappan ve Rebecca Qian tarafından kurulan San Francisco merkezli şirket, "dijital dünya modelleri" olarak adlandırdığı, web sitelerinin ve aracıların eğitimden sonra stres testine tabi tutulduğu dahili sistemlerin kopyalarını oluşturuyor. Aracılar, başarılı görev tamamlamayı yinelemeli olarak ödüllendiren ve hataları cezalandıran takviyeli öğrenme kullanılarak değerlendirilir.
Otonom Araçlardan Borç Alma
Şirket, yaklaşımını Waymo'nun sürücüsüz arabaları nasıl eğittiğiyle karşılaştırıyor; ilk olarak araçları şiddetli hava koşulları veya topun peşinden koşan bir çocuk gibi nadir tehlikelere karşı test etmek için sentetik dünyalar inşa ediyor. Yapay zeka aracılarıyla arasındaki en önemli fark, kısayolları kullanma eğiliminde olmalarıdır; bu da, başarılı gibi görünseler bile görevleri doğru şekilde tamamlayamadıkları anlamına gelir.
Notable Capital'in genel müdürü Glenn Solomon, "Patronus, hack'leri tespit etme ve modelleri sorumlu tuttuklarından emin olma konusunda gerçekten çok iyi" dedi. Solomon, şirketin simüle edilmiş ortamlarına olan talebin neredeyse doyumsuz olduğunu belirtti. Neredeyse tüm öncü yapay zeka laboratuvarları ve birçok yeni kurulan girişim artık müşteri oldu ve Patronus'un geliri geçtiğimiz yıl 15 kat arttı.
Doğrulanabilir Görevlerin Ötesine Geçmek
Patronus şu anda, sonuçların doğrulanmasının nispeten kolay olduğu iki alan olan yazılım mühendisliği ve finans için simüle edilmiş dijital dünyalar sunmaktadır. Ancak şirket bunları sadece başlangıç olarak görüyor. Kannappan, "Bugün, doğrulanabilir sorunlara, anında kontrol edip doğrulayabileceğiniz sorunlara odaklandık, ancak doğrulanamayan veya doğrulanması çok zor olan daha bir sürü alan var" dedi.
Amacımız, temsilcileri uzun vadede test etmeye yetecek kadar sağlam ortamlar oluşturmaktır. Kannappan, "10 saat, 10 gün veya 10 hafta boyunca çalışabilen bir aracıyı çalıştırabileceğiniz ortamı gerçekten yaratabilmek istiyoruz" dedi. Süreçlerin doğrulanabilir olması, bunların basit olduğu anlamına gelmez ve günlerce süren bir iş akışının ortasında başarısız olan bir aracıyı yakalama yeteneği, şirketin değer teklifinin merkezinde yer alır.
Finansman aynı zamanda daha geniş yapay zeka endüstrisinin ilerlemenin nasıl ölçüleceğiyle uğraştığı bir dönemde de geliyor. Karşılaştırma puanları tartışmalı bir para birimi haline geldi; eleştirmenler, modellerin gerçek görevlerde gerçekten gelişme olmaksızın oyuna özel testlere göre optimize edilebileceğini savundu. Patronus'un simüle edilmiş ortamları, başarının tek kanıtının skor tablosundaki bir sayı yerine doğru şekilde tamamlanan bir iş olduğu açık uçlu senaryolarda test temsilcilerine alternatif sunar.
Kurumsal müşteriler için bu ayrım önemlidir. Bir kıyaslamayı geçen ancak üretim kod tabanına sessizce hatalar sokan bir kodlama temsilcisi veya rakamları yanlış yuvarlayan bir finans temsilcisi, düşük bir test puanının önerdiğinden çok daha fazla hasara neden olabilir. Patronus, bu hataları dağıtımdan önce bir sanal alanda yakalayarak, değerlendirmeyi sonradan akla gelen bir düşünce olarak değil, güven için bir ön koşul olarak konumlandırıyor.
Kalabalık Bir Sahada Farklı Bir Yaklaşım
Rakiplere gelince, Patronus öncelikle yapay zeka laboratuvarlarının temsilci davranışlarını değerlendirmek için oluşturduğu dahili değerlendirme ekipleriyle rekabet ettiğine inanıyor. Mercor ve Surge gibi insan verisi firmaları, model oluşturuculara takviyeli öğrenme konusunda yardımcı olurken, Patronus, aracıların herhangi bir insan müdahalesi olmadan nasıl davrandığını değerlendirerek, aksi takdirde pahalı manuel inceleme gerektirecek hataların tespitini otomatikleştirerek farklı şekilde çalışır.
Tur, yatırımcıların temsilci değerlendirmesinin AI yığınının temel katmanı olacağına dair güvenini gösteriyor. Temsilciler, seyahat rezervasyonu yapmaktan finansal analiz yürütmeye kadar daha özerk işler üstlendikçe, bu sistemlerin güvenilir olduğunu, konuşlandırılmadan önce kanıtlayabilen girişimler, kendilerini ajansal yapay zeka çağının vazgeçilmez bekçileri olarak konumlandırıyor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


