Amazon Web Services spustily Amazon Bedrock AgentCore Evaluations, novou funkci, která hodnotí agenty umělé inteligence vytvořené s jakýmkoliv hlavním rámcem – nejen s vlastními nástroji AWS – tím, že zachází se stopami OpenTelemetry jako s univerzálním rozhraním pro hodnocení. Oznámení přišlo v blogovém příspěvku o strojovém učení AWS, který 26. srpna zveřejnili Swarnim Singhal, Bharathi Srinivasan a Renya Kujirada.
Nabídka se zabývá tím, co AWS nazývá frustrující asymetrií v produkční práci s umělou inteligencí: rozmanitost rámců agentů neustále roste, zatímco nástroje pro hodnocení nedrží krok. Aby týmy držely krok s širším cyklem zpráv z oboru AI, týmy nyní běžně kombinují a spojují nástroje – což je přesně místo, kde se tradiční vyhodnocovací kanály rozpadají.
Problém fragmentace
Když to tým AWS vytváří, většina vyhodnocovacích systémů předpokládá, že jste svého agenta postavili jedním konkrétním způsobem: konkrétním SDK, konkrétním klientem velkého jazykového modelu, konkrétním vzorem sledování. Vyjděte mimo tuto úzkou zónu kompatibility a vyhodnocovací kanál se přeruší.
Skutečné zásobníky jen zřídka zůstávají uvnitř pruhu jednoho prodejce. V účtu blogového příspěvku týmy staví na LangGraph pro orchestraci pracovních toků, na LlamaIndex pro úzkou integraci vyhledávacího kanálu a na OpenAI Agents SDK, když organizace standardizuje modely GPT. Používají Google ADK pro koordinaci více agentů nebo Claude Agent SDK pro nativní schopnosti Anthropic a sáhnou po Strands Agents, když jejich modelem řízená smyčka dokáže spustit fungujícího agenta na Amazon Bedrock AgentCore během několika minut, nikoli dnů.
Každý z těchto rámců generuje svou vlastní interní reprezentaci toho, co agent dělal – volání nástrojů, vyhledávání, předávání mezi podagenty. Historicky jejich vyhodnocování znamenalo přebudování přístrojového vybavení pro každého z nich nebo akceptování toho, že některé rámce prostě nelze vůbec hodnotit.
Jak to funguje: Telemetrie přes těsné spojení
AgentCore Evaluations se pokouší rozpustit toto propojení výběrem rozhraní, které již mluví každý hlavní rámec. Téměř všechny podporují OpenTelemetry, ať už nativně, nebo prostřednictvím komunitních instrumentačních knihoven – de facto standardu, ke kterému se před lety sblížily cloudové nástroje a nástroje pro sledování aplikací.
Logika je přímočará: dokud telemetrie agenta prochází OpenTelemetry, může ji vyhodnocovací služba hodnotit bez ohledu na to, pod kterým SDK je umístěno. Příspěvek na blogu popisuje, jakou telemetrii služba čte, jak rozhoduje o tom, jak interpretovat rozpětí, které atributy nesou data hodnocení a jak se pokrytí rozšiřuje na rámce nad rámec jmenovaného seznamu AWS – což ve skutečnosti dělá smlouvu spíše formát než rámec.
Pro inženýrské organizace to mění hodnocení v rozhodnutí o infrastruktuře namísto sestavení podle projektu. Agent klasifikovaný v den odeslání lze porovnat se stejnými metrikami, ať už jej jeho autoři napsali v LangGraph nebo v Claude Agent SDK.
Kam se hodí v AgentCore
Hodnocení se zasouvá do širší platformy Amazon Bedrock AgentCore, jejíž běhové prostředí již zpracovává infrastrukturu hostingu, škálování, paměti a pozorovatelnosti, kterou by jinak vývojáři přestavěli pro každý projekt. S hodnocením přidaným na stejný povrch AWS sestavuje to, co pro agenty znamená celý životní cyklus: nasazujte je za běhu, sledujte je prostřednictvím vestavěné pozorovatelnosti a nyní je poměřujte podle konzistentních kritérií, aniž byste opustili platformu.
Načasování není náhodné. V celém odvětví se otázky o tom, zda se agenti skutečně chovají tak, jak bylo zamýšleno, přesunuly od akademického zájmu k riziku na úrovni představenstva, po vysoce sledovaných epizodách, jako je koordinované špatné chování zdokumentované při vyšetřování porušení Hugging Face a rostoucí důkazy, že samotné srovnávací testy vykreslují neúplný obraz spolehlivosti agentů. Nástroje, díky nimž je hodnocení nepřetržité, levné a nezávislé na rámci, přímo vypovídá o této úzkosti.
Proč na tom záleží
Hodnocení se v tichosti stalo úzkým hrdlem přijetí podnikových agentů. Rychlost vývoje již není omezením – omezením je důvěra: vědomí, že agent odpovídá zákazníkům, přesouvá data nebo provádí pracovní postupy, to bude dělat správně za podmínek, které nikdo individuálně netestoval.
Ukotvením hodnocení k OpenTelemetry spíše než k jakémukoli jedinému SDK sází AWS na to, že konsenzus pozorovatelnosti v tomto odvětví může sloužit jako jeho vrstva pro zajištění kvality. To, zda konkurenti budou následovat s ekvivalentním rámcovým agnostickým hodnocením, vypoví mnohé o tom, jak rychle agentní umělá inteligence dospěje z ukázek do spolehlivé infrastruktury.
Pro týmy provozující heterogenní flotily je praktickým důsledkem srovnatelnost. Když každý agent podává zprávy ve stejném telemetrickém formátu, kvalita se stává něčím, co může organizace sledovat v průběhu času a napříč týmy, spíše než znovu odvozovat podle projektu – předpoklad pro cokoli, co připomíná provozní vyspělost v agentských systémech. Pro podniky hluboko v hybridních svazcích LangGraph-LlamaIndex nebo jednoduše opatrné přepisování instrumentace, kdykoli se objeví lepší rámec, nyní existuje možnost první strany od jejich poskytovatele cloudu, která po nich nevyžaduje, aby si vybrali strany.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →