Amazon Web Services wis ngluncurake Amazon Bedrock AgentCore Evaluations, kemampuan anyar sing menehi skor agen AI sing dibangun kanthi kerangka utama - ora mung alat AWS dhewe - kanthi nganggep jejak OpenTelemetry minangka antarmuka universal kanggo evaluasi. Pengumuman kasebut teka ing postingan blog pembelajaran mesin AWS sing diterbitake 26 Agustus dening Swarnim Singhal, Bharathi Srinivasan lan Renya Kujirada.

Pitch kasebut ngrampungake apa sing diarani AWS minangka asimetri sing frustasi ing produksi AI: keragaman kerangka agen terus berkembang nalika alat evaluasi ora tetep. Kanggo ngetutake [siklus warta industri AI] sing luwih jembar (https://aibuzzwire.news), tim saiki rutin nyampur lan cocog alat - sing persis ing ngendi pipa evaluasi tradisional ambruk.

Masalah Fragmentasi

Nalika tim AWS nggawe pigura, umume sistem evaluasi nganggep sampeyan nggawe agen kanthi cara tartamtu: SDK tartamtu, klien model basa gedhe tartamtu, pola tracing tartamtu. Langkah njaba zona kompatibilitas sing sempit lan pipa evaluasi rusak.

Tumpukan donya nyata arang tetep ing siji jalur vendor. Ing akun kirim blog, tim mbangun LangGraph kanggo orkestrasi alur kerja, ing LlamaIndex kanggo integrasi saluran pipa sing ketat, lan ing OpenAI Agents SDK nalika organisasi nggawe standar model GPT. Dheweke nggunakake Google ADK kanggo koordinasi multi-agen utawa Claude Agent SDK kanggo kemampuan Anthropic asli, lan tekan Agen Strands nalika daur ulang sing didorong model bisa entuk agen kerja ing Amazon Bedrock AgentCore sajrone sawetara menit tinimbang dina.

Saben kerangka kasebut ngasilake perwakilan internal dhewe babagan apa sing ditindakake agen - telpon alat, pengambilan, serah terima antarane sub-agen. Secara historis, ngevaluasi kasebut tegese mbangun maneh instrumentasi kanggo saben wong, utawa nrima yen sawetara kerangka ora bisa dinilai.

Cara Kerja: Telemetri Swara Coupling Nyenyet

Evaluasi AgentCore nyoba kanggo mbubarake kopling kasebut kanthi milih antarmuka saben kerangka utama sing wis diomongake. Saklawasé kabeh ndhukung OpenTelemetry, kanthi asli utawa liwat perpustakaan instrumentasi komunitas - standar de facto sing alat pengamatan awan lan aplikasi gabung ing taun kepungkur.

Logika langsung: anggere telemetri agen mili liwat OpenTelemetry, layanan evaluasi bisa menehi skor, preduli saka apa SDK sing ana ing ngisor iki. Kiriman blog kasebut ngliwati telemetri sing diwaca layanan kasebut, kepiye mutusake cara napsirake span, atribut sing nggawa data evaluasi, lan kepiye jangkoan ngluwihi dhaptar sing dijenengi AWS - kanthi efektif nggawe format kasebut, tinimbang kerangka, kontrak.

Kanggo organisasi teknik, iki ngowahi evaluasi dadi keputusan infrastruktur tinimbang mbangun saben proyek. Agen sing dirating dina sing dikirim bisa dibandhingake karo metrik sing padha, manawa penulise nulis ing LangGraph utawa Claude Agent SDK.

Ngendi Iku Cocog ing AgentCore

Evaluasi slot menyang platform Amazon Bedrock AgentCore sing luwih jembar, sing runtime wis nangani hosting, skala, memori lan pangembang infrastruktur observasi sing bakal dibangun maneh kanggo saben proyek. Kanthi evaluasi ditambahake ing permukaan sing padha, AWS nglumpukake apa sing dadi siklus urip lengkap kanggo agen: nyebarake ing runtime, nonton liwat observasi sing dibangun, lan saiki ngukur karo kritéria sing konsisten tanpa ninggalake platform.

Wektu iku ora insidental. Ing saindhenging industri, pitakonan apa agen bener tumindak minangka dimaksudaké wis dipindhah saka badhan akademisi kanggo resiko tingkat Papan, sawise episode dhuwur-profil kayata misbehavior terkoordinasi nyathet ing investigasi nglanggar Pasuryan Hugging lan akeh bukti sing pathokan piyambak Paint gambar pepak saka linuwih agen. Perkakas sing nggawe evaluasi terus-terusan, murah lan mandiri kerangka langsung ngomongake rasa kuwatir kasebut.

Apa Sing Penting

Evaluasi kanthi tenang dadi bottleneck saka adopsi agen perusahaan. Kecepatan pangembangan ora dadi kendala maneh - kendala yaiku kapercayan: ngerti yen agen njawab pelanggan, mindhah data utawa nglakokake alur kerja bakal nindakake kanthi bener ing kahanan sing ora ana sing diuji kanthi individu.

Miturut anchoring evaluasi kanggo OpenTelemetry tinimbang SDK siji, AWS totoan sing konsensus observability industri bisa tikel kaping pindho minangka lapisan jaminan kualitas. Apa pesaing ngetutake skor kerangka-agnostik sing padha bakal ngandhani babagan sepira cepet AI agenik diwasa saka demo dadi infrastruktur sing bisa dipercaya.

Kanggo tim sing nganggo armada heterogen, implikasi praktis yaiku komparatif. Nalika saben agen nglaporake kanthi format telemetri sing padha, kualitas dadi barang sing bisa dilacak dening organisasi liwat wektu lan ing tim tinimbang ngasilake maneh saben proyek - prasyarat kanggo apa wae sing meh padha karo kedewasaan operasional ing sistem agen. Kanggo perusahaan ing jero tumpukan hibrida LangGraph-LlamaIndex, utawa mung waspada kanggo nulis ulang instrumentasi nalika kerangka kerja sing luwih apik katon, saiki ana pilihan pihak pertama saka panyedhiya awan sing ora njaluk dheweke milih sisih.

---

Tetep Ahead of AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane AI warta →