Amazon Web Services telah meluncurkan Amazon Bedrock AgentCore Evaluations, sebuah kemampuan baru yang menilai agen AI yang dibangun dengan kerangka kerja utama apa pun — bukan hanya peralatan AWS sendiri — dengan memperlakukan jejak OpenTelemetry sebagai antarmuka universal untuk evaluasi. Pengumuman tersebut muncul dalam postingan blog pembelajaran mesin AWS yang diterbitkan 26 Agustus oleh Swarnim Singhal, Bharathi Srinivasan, dan Renya Kujirada.

Presentasi ini membahas apa yang disebut AWS sebagai asimetri yang membuat frustrasi dalam pekerjaan AI produksi: keragaman kerangka kerja agen terus berkembang sementara alat evaluasi tidak dapat mengimbanginya. Untuk mengikuti siklus berita industri AI yang lebih luas, tim kini secara rutin memadupadankan alat — dan hal inilah yang membuat alur evaluasi tradisional menjadi berantakan.

Masalah Fragmentasi

Saat tim AWS membingkainya, sebagian besar sistem evaluasi berasumsi Anda membangun agen dengan satu cara tertentu: SDK tertentu, klien model bahasa besar tertentu, pola penelusuran tertentu. Keluarlah dari zona kompatibilitas yang sempit itu dan jalur evaluasi akan terputus.

Tumpukan dunia nyata jarang berada di dalam jalur satu vendor. Dalam akun postingan blog, tim menggunakan LangGraph untuk orkestrasi alur kerja, LlamaIndex untuk integrasi pipeline pengambilan yang ketat, dan OpenAI Agents SDK saat organisasi melakukan standarisasi pada model GPT. Mereka menggunakan Google ADK untuk koordinasi multi-agen atau Claude Agent SDK untuk kemampuan Anthropic asli, dan mereka menggunakan Strands Agents ketika loop berbasis modelnya dapat membuat agen yang berfungsi berjalan di Amazon Bedrock AgentCore dalam hitungan menit, bukan hari.

Masing-masing kerangka kerja tersebut menghasilkan representasi internalnya sendiri tentang apa yang dilakukan agen — pemanggilan alat, pengambilan, penyerahan antar sub-agen. Secara historis, mengevaluasi kerangka kerja berarti membangun kembali instrumentasi untuk setiap kerangka kerja, atau menerima bahwa beberapa kerangka kerja tidak dapat dinilai sama sekali.

Cara Kerja: Telemetri Melalui Kopling Ketat

AgentCore Evaluations mencoba untuk menghilangkan hubungan tersebut dengan memilih antarmuka yang sudah digunakan oleh setiap kerangka kerja utama. Hampir semuanya mendukung OpenTelemetry, baik secara asli atau melalui perpustakaan instrumentasi komunitas — standar de facto yang disatukan oleh cloud dan alat observabilitas aplikasi beberapa tahun yang lalu.

Logikanya sederhana: selama telemetri agen mengalir melalui OpenTelemetry, layanan evaluasi dapat menilai telemetri tersebut, apa pun SDK yang ada di bawahnya. Entri blog ini membahas telemetri apa yang dibaca oleh layanan, bagaimana layanan memutuskan cara menginterpretasikan rentang, atribut mana yang membawa data evaluasi, dan bagaimana cakupan diperluas ke kerangka kerja di luar daftar nama AWS — yang secara efektif menjadikan format, bukan kerangka kerja, sebagai kontrak.

Bagi organisasi teknik, hal ini mengubah evaluasi menjadi keputusan infrastruktur, bukan pembangunan per proyek. Agen yang dinilai pada hari pengirimannya dapat dibandingkan dengan metrik yang sama baik penulisnya menulisnya di LangGraph atau Claude Agent SDK.

Jika Cocok di AgentCore

Evaluasi dimasukkan ke dalam platform Amazon Bedrock AgentCore yang lebih luas, yang runtime-nya telah menangani infrastruktur hosting, penskalaan, memori, dan observabilitas yang akan dibangun kembali oleh pengembang untuk setiap proyek. Dengan evaluasi yang ditambahkan ke permukaan yang sama, AWS menyusun siklus hidup penuh untuk agen: menerapkannya pada waktu proses, memantaunya melalui kemampuan observasi bawaan, dan sekarang mengukurnya berdasarkan kriteria yang konsisten tanpa meninggalkan platform.

Waktunya tidak bersifat kebetulan. Di seluruh industri, pertanyaan tentang apakah agen benar-benar berperilaku sebagaimana mestinya telah beralih dari kekhawatiran akademis ke risiko di tingkat dewan, menyusul episode-episode penting seperti perilaku buruk terkoordinasi yang didokumentasikan dalam investigasi pelanggaran Hugging Face dan semakin banyak bukti bahwa tolok ukur saja memberikan gambaran yang tidak lengkap mengenai keandalan agen. Perangkat yang menjadikan evaluasi berkelanjutan, murah, dan tidak bergantung pada kerangka kerja mencerminkan kekhawatiran tersebut.

Mengapa Itu Penting

Evaluasi diam-diam menjadi hambatan dalam adopsi agen perusahaan. Kecepatan pengembangan tidak lagi menjadi kendala — kendalanya adalah keyakinan: mengetahui bahwa agen yang menjawab pelanggan, memindahkan data, atau menjalankan alur kerja akan melakukannya dengan benar dalam kondisi yang tidak diuji secara individual.

Dengan mengaitkan evaluasi pada OpenTelemetry dan bukan pada SDK apa pun, AWS yakin bahwa konsensus observabilitas industri dapat berfungsi ganda sebagai lapisan jaminan kualitasnya. Apakah pesaing mengikuti penilaian framework-agnostic yang setara akan menunjukkan seberapa cepat AI agen berkembang dari demo menjadi infrastruktur yang dapat diandalkan.

Untuk tim yang menjalankan armada heterogen, implikasi praktisnya adalah keterbandingan. Ketika setiap agen melaporkan dalam format telemetri yang sama, kualitas menjadi sesuatu yang dapat dilacak oleh organisasi dari waktu ke waktu dan antar tim, alih-alih memperolehnya kembali per proyek — sebuah prasyarat untuk segala sesuatu yang menyerupai kematangan operasional dalam sistem agen. Untuk perusahaan yang mendalami hybrid stack LangGraph-LlamaIndex, atau hanya khawatir untuk menulis ulang instrumentasi setiap kali kerangka kerja yang lebih baik muncul, kini ada opsi pihak pertama dari penyedia cloud mereka yang tidak meminta mereka untuk memilih pihak.

---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →