Perkhidmatan Web Amazon telah melancarkan Amazon Bedrock AgentCore Evaluations, keupayaan baharu yang menjaringkan ejen AI yang dibina dengan mana-mana rangka kerja utama — bukan hanya perkakas AWS sendiri — dengan menganggap jejak OpenTelemetry sebagai antara muka universal untuk penilaian. Pengumuman itu datang dalam catatan blog pembelajaran mesin AWS yang diterbitkan pada 26 Ogos oleh Swarnim Singhal, Bharathi Srinivasan dan Renya Kujirada.

Padang menangani perkara yang disebut AWS sebagai asimetri yang mengecewakan dalam kerja AI pengeluaran: kepelbagaian rangka kerja ejen terus berkembang manakala alatan penilaian tidak seiring. Untuk mengikuti perkembangan kitaran berita industri AI yang lebih luas, pasukan kini secara rutin mencampur dan memadankan alatan — yang mana saluran paip penilaian tradisional berantakan.

Masalah Pecahan

Semasa pasukan AWS merangkanya, kebanyakan sistem penilaian menganggap anda membina ejen anda dengan satu cara khusus: SDK tertentu, klien model bahasa besar tertentu, corak penjejakan tertentu. Melangkah keluar dari zon keserasian sempit itu dan saluran paip penilaian putus.

Tindanan dunia nyata jarang berada di dalam satu lorong vendor. Dalam akaun catatan blog, pasukan membina LangGraph untuk orkestrasi aliran kerja, pada LlamaIndex untuk penyepaduan saluran paip pengambilan yang ketat dan pada OpenAI Agents SDK apabila organisasi menyeragamkan model GPT. Mereka menggunakan Google ADK untuk penyelarasan berbilang ejen atau Claude Agent SDK untuk keupayaan Anthropic asli, dan mereka mencapai Ejen Strands apabila gelung dipacu modelnya boleh mendapatkan ejen yang berfungsi di Amazon Bedrock AgentCore dalam beberapa minit dan bukannya hari.

Setiap rangka kerja tersebut menjana perwakilan dalaman sendiri tentang perkara yang dilakukan oleh ejen — panggilan alat, perolehan semula, serahan antara sub-ejen. Dari segi sejarah, menilai mereka bermakna membina semula instrumentasi untuk setiap satu, atau menerima bahawa sesetengah rangka kerja langsung tidak boleh digredkan.

Cara Ia Berfungsi: Telemetri Lebih Gandingan Ketat

AgentCore Evaluations cuba untuk membubarkan gandingan itu dengan memilih antara muka setiap rangka kerja utama sudah bercakap. Hampir kesemuanya menyokong OpenTelemetry, sama ada secara asli atau melalui perpustakaan instrumentasi komuniti — piawaian de facto yang disatukan oleh alat pemerhatian awan dan aplikasi pada tahun lalu.

Logiknya adalah mudah: selagi telemetri ejen mengalir melalui OpenTelemetry, perkhidmatan penilaian boleh menjaringkannya, tanpa mengira apa SDK berada di bawahnya. Siaran blog menerangkan tentang telemetri yang dibaca oleh perkhidmatan, cara ia memutuskan cara mentafsir rentang, atribut yang membawa data penilaian dan cara liputan meluas ke rangka kerja di luar senarai bernama AWS — menjadikan format, bukannya rangka kerja, kontrak dengan berkesan.

Untuk organisasi kejuruteraan, ini menjadikan penilaian sebagai keputusan infrastruktur dan bukannya binaan setiap projek. Ejen yang dinilai pada hari ia dihantar boleh dibandingkan dengan metrik yang sama sama ada pengarangnya menulisnya dalam LangGraph atau Claude Agent SDK.

Di mana Ia Sesuai dalam AgentCore

Penilaian masuk ke platform Amazon Bedrock AgentCore yang lebih luas, yang masa jalannya sudah mengendalikan pengehosan, penskalaan, memori dan pembangun infrastruktur kebolehmerhatian yang sebaliknya akan membina semula untuk setiap projek. Dengan penilaian yang ditambahkan pada permukaan yang sama, AWS sedang menyusun jumlah kitaran hayat penuh untuk ejen: gunakan mereka pada masa jalan, tonton mereka melalui kebolehmerhatian terbina dalam, dan kini mengukurnya berdasarkan kriteria yang konsisten tanpa meninggalkan platform.

Masanya bukan sampingan. Di seluruh industri, persoalan tentang sama ada ejen benar-benar berkelakuan seperti yang dimaksudkan telah beralih daripada kebimbangan akademik kepada risiko peringkat lembaga, berikutan episod berprofil tinggi seperti salah laku yang diselaraskan yang didokumenkan dalam penyiasatan pelanggaran Hugging Face dan bukti yang semakin meningkat bahawa penanda aras sahaja menggambarkan gambaran yang tidak lengkap tentang kebolehpercayaan ejen. Peralatan yang menjadikan penilaian berterusan, murah dan bebas rangka kerja bercakap terus kepada kebimbangan itu.

Mengapa Ia Penting

Penilaian secara senyap-senyap menjadi hambatan penggunaan ejen perusahaan. Halaju pembangunan bukan lagi kekangan — kekangannya ialah keyakinan: mengetahui bahawa ejen menjawab pelanggan, memindahkan data atau melaksanakan aliran kerja akan melakukannya dengan betul dalam keadaan yang tiada siapa yang diuji secara individu.

Dengan melabuhkan penilaian kepada OpenTelemetry dan bukannya kepada mana-mana SDK tunggal, AWS bertaruh bahawa konsensus pemerhatian industri boleh berganda sebagai lapisan jaminan kualitinya. Sama ada pesaing mengikuti dengan pemarkahan rangka kerja-agnostik yang setara akan menjelaskan betapa cepat AI agenik matang daripada tunjuk cara kepada infrastruktur yang boleh dipercayai.

Bagi pasukan yang menjalankan armada heterogen, implikasi praktikal ialah kebolehbandingan. Apabila setiap ejen melaporkan dalam format telemetri yang sama, kualiti menjadi sesuatu yang boleh dijejaki oleh organisasi dari semasa ke semasa dan merentas pasukan dan bukannya memperoleh semula setiap projek — prasyarat untuk apa-apa yang menyerupai kematangan operasi dalam sistem agen. Untuk perusahaan yang mendalam dalam tindanan hibrid LangGraph-LlamaIndex, atau hanya berhati-hati menulis semula instrumentasi apabila rangka kerja yang lebih baik muncul, kini terdapat pilihan pihak pertama daripada pembekal awan mereka yang tidak meminta mereka memilih pihak.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →