Amazon Web Services, OpenTelemetry izlerini değerlendirme için evrensel bir arayüz olarak ele alarak yalnızca AWS'nin kendi araçlarıyla değil, herhangi bir ana çerçeveyle oluşturulmuş AI aracılarını puanlayan yeni bir özellik olan Amazon Bedrock AgentCore Evaluations'ı başlattı. Duyuru, Swarnim Singhal, Bharathi Srinivasan ve Renya Kujirada tarafından 26 Ağustos'ta yayınlanan bir AWS makine öğrenimi blog gönderisinde geldi.

Sunum, AWS'nin üretimdeki yapay zeka çalışmalarında sinir bozucu asimetri olarak adlandırdığı durumu ele alıyor: Aracı çerçevelerinin çeşitliliği büyümeye devam ederken, değerlendirme araçları buna ayak uyduramıyor. Ekipler artık daha geniş AI sektörü haber döngüsüne ayak uydurmak için araçları rutin olarak karıştırıp eşleştiriyor; bu da tam olarak geleneksel değerlendirme süreçlerinin çöktüğü nokta.

Parçalanma Sorunu

AWS ekibi bunu çerçevelerken çoğu değerlendirme sistemi, aracınızı belirli bir şekilde oluşturduğunuzu varsayar: belirli bir SDK, belirli bir büyük dil modeli istemcisi, belirli bir izleme modeli. Bu dar uyumluluk bölgesinin dışına çıkın ve değerlendirme hattı kopsun.

Gerçek dünyadaki yığınlar nadiren tek bir satıcının şeridinde kalır. Blog gönderisinin hesabında ekipler, iş akışının düzenlenmesi için LangGraph'ı, sıkı erişim hattı entegrasyonu için LlamaIndex'i ve bir kuruluş GPT modellerini standartlaştırdığında OpenAI Agents SDK'yı temel alıyor. Çoklu aracı koordinasyonu için Google ADK'yı veya yerel Antropik yetenek için Claude Agent SDK'yı kullanıyorlar ve model odaklı döngüsü, çalışan bir aracının Amazon Bedrock AgentCore üzerinde günler yerine dakikalar içinde çalışmasını sağladığında Strands Agent'lara ulaşıyorlar.

Bu çerçevelerin her biri, bir aracının ne yaptığına ilişkin kendi dahili temsilini oluşturur - araç çağrıları, geri almalar, alt aracılar arasındaki aktarımlar. Tarihsel olarak bunları değerlendirmek, her biri için enstrümantasyonu yeniden oluşturmak veya bazı çerçevelerin hiçbir şekilde derecelendirilemeyeceğini kabul etmek anlamına geliyordu.

Nasıl Çalışır: Sıkı Bağlantı Üzerinden Telemetri

AgentCore Evaluations, her ana çerçevenin zaten konuştuğu bir arayüz seçerek bu bağlantıyı ortadan kaldırmaya çalışır. Neredeyse hepsi, yerel olarak veya topluluk enstrümantasyon kitaplıkları aracılığıyla OpenTelemetry'yi destekliyor; bulut ve uygulama gözlemlenebilirlik araçlarının yıllar önce birleştiği fiili standart.

Mantık basittir: Bir aracının telemetrisi OpenTelemetry üzerinden aktığı sürece değerlendirme hizmeti, altında hangi SDK'nın bulunduğuna bakılmaksızın bunu puanlayabilir. Blog gönderisinde, hizmetin hangi telemetriyi okuduğu, aralıkların nasıl yorumlanacağına nasıl karar verdiği, değerlendirme verilerini hangi özniteliklerin taşıdığı ve kapsamın AWS'nin adlandırılmış listesinin ötesindeki çerçevelere nasıl uzandığı açıklanarak çerçeveden ziyade biçimin etkili bir şekilde sözleşme haline getirilmesi anlatılıyor.

Mühendislik organizasyonları için bu, değerlendirmeyi proje başına bir yapı yerine bir altyapı kararına dönüştürür. Gönderildiği gün not verilen bir aracı, yazarlarının bunu LangGraph'ta mı yoksa Claude Agent SDK'sında mı yazdığı aynı ölçümlerle karşılaştırılabilir.

AgentCore'da Nereye Uygun?

Değerlendirmeler, geliştiricilerin normalde her proje için yeniden inşa edecekleri barındırma, ölçeklendirme, bellek ve gözlemlenebilirlik altyapısını zaten yürüten daha geniş Amazon Bedrock AgentCore platformuna yerleşiyor. Değerlendirmenin aynı yüzeye eklenmesiyle AWS, aracılar için tam bir yaşam döngüsü anlamına gelen şeyleri bir araya getiriyor: bunları çalışma zamanında dağıtın, yerleşik gözlemlenebilirlik aracılığıyla izleyin ve artık platformdan ayrılmadan bunları tutarlı ölçütlere göre ölçün.

Zamanlama tesadüfi değildir. Sektör genelinde, temsilcilerin gerçekten amaçlandığı gibi davranıp davranmadığına ilişkin sorular, Hugging Face ihlal soruşturmasında belgelenen koordineli kötü davranışlar gibi yüksek profilli olayların ve kıyaslamaların tek başına temsilci güvenilirliğinin eksik bir resmini çizdiğine dair artan kanıtların ardından, akademik kaygıdan yönetim kurulu düzeyinde riske geçti. Değerlendirmeyi sürekli, ucuz ve çerçeveden bağımsız hale getiren araçlar doğrudan bu endişeye işaret ediyor.

Neden Önemlidir

Değerlendirme, kurumsal aracıların benimsenmesinde sessizce darboğaz haline geldi. Geliştirme hızı artık kısıtlama değil; kısıtlama güvendir: Müşterilere yanıt veren, verileri taşıyan veya iş akışlarını yürüten aracının, kimsenin bireysel olarak test etmediği koşullar altında bunu doğru şekilde yapacağını bilmek.

AWS, değerlendirmeyi tek bir SDK yerine OpenTelemetry'ye bağlayarak sektörün gözlemlenebilirlik konsensüsünün kalite güvence katmanı olarak iki katına çıkabileceğine inanıyor. Rakiplerin çerçeveden bağımsız eşdeğer puanlamayla takip edip etmemesi, ajansal yapay zekanın demolardan güvenilir altyapıya ne kadar hızlı olgunlaştığı hakkında çok şey söyleyecektir.

Heterojen filolar işleten ekipler için bunun pratik anlamı karşılaştırılabilirliktir. Her temsilci aynı telemetri formatında rapor verdiğinde kalite, proje başına yeniden türetmek yerine kuruluşun zaman içinde ve ekipler arasında takip edebileceği bir şey haline gelir; bu, aracı sistemlerde operasyonel olgunluğa benzeyen herhangi bir şey için bir ön koşuldur. LangGraph-LlamaIndex hibrit yığınlarına derinlemesine hakim olan veya daha iyi bir çerçeve ortaya çıktığında enstrümantasyonu yeniden yazmaktan çekinen kuruluşlar için artık bulut sağlayıcılarından taraf seçmelerini istemeyen bir birinci taraf seçeneği var.

---

Yapay Zekanın Önünde Olun

En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →