Amazon Web Services har lanserat Amazon Bedrock AgentCore Evaluations, en ny funktion som ger poäng för AI-agenter byggda med alla större ramverk – inte bara AWS egna verktyg – genom att behandla OpenTelemetry-spår som ett universellt gränssnitt för utvärdering. Tillkännagivandet kom i ett AWS-maskininlärningsblogginlägg publicerat den 26 augusti av Swarnim Singhal, Bharathi Srinivasan och Renya Kujirada.

Pitch tar upp vad AWS kallar en frustrerande asymmetri i produktion av AI-arbete: mångfalden av agentramverk fortsätter att växa medan utvärderingsverktygen inte har hållit jämna steg. För att hänga med i den bredare AI-branschens nyhetscykel, blandar och matchar team nu rutinmässigt verktyg – det är precis där traditionella utvärderingspipelines faller isär.

Fragmenteringsproblemet

Som AWS-teamet formulerar det, antar de flesta utvärderingssystem att du byggde din agent på ett specifikt sätt: en specifik SDK, en specifik stor språkmodellklient, ett specifikt spårningsmönster. Gå utanför den smala kompatibilitetszonen och utvärderingspipelinen brister.

Verkliga stackar stannar sällan inom en leverantörs körfält. I blogginläggets konto bygger team på LangGraph för orkestrering av arbetsflöden, på LlamaIndex för tight återvinningspipelineintegration och på OpenAI Agents SDK när en organisation standardiserar på GPT-modeller. De använder Google ADK för koordinering av flera agenter eller Claude Agent SDK för infödd antropisk förmåga, och de når Strands Agents när dess modelldrivna loop kan få en fungerande agent att köra på Amazon Bedrock AgentCore på några minuter snarare än dagar.

Var och en av dessa ramverk genererar sin egen interna representation av vad en agent gjorde - verktygsanrop, hämtningar, överlämningar mellan underagenter. Historiskt sett innebar att utvärdera dem att bygga om instrumentering för var och en, eller acceptera att vissa ramverk helt enkelt inte kunde graderas alls.

Hur det fungerar: Telemetri över tät koppling

AgentCore Evaluations försöker lösa den kopplingen genom att välja ett gränssnitt varje större ramverk talar redan. Nästan alla av dem stöder OpenTelemetry, antingen inbyggt eller via bibliotek för community-instrumentering – den de facto-standard som moln- och applikationsobservationsverktyg konvergerade med för flera år sedan.

Logiken är enkel: så länge som en agents telemetri flödar genom OpenTelemetry kan utvärderingstjänsten göra poäng, oavsett vilken SDK som sitter under. Blogginlägget går igenom vilken telemetri tjänsten läser, hur den bestämmer hur spann ska tolkas, vilka attribut som bär utvärderingsdatan och hur täckningen sträcker sig till ramverk bortom AWS namngivna lista – vilket effektivt gör formatet, snarare än ramverket, till kontraktet.

För ingenjörsorganisationer förvandlar detta utvärdering till ett infrastrukturbeslut istället för att bygga per projekt. En agent som betygsatts dagen den skickas kan jämföras med samma mätvärden oavsett om dess författare skrev det i LangGraph eller Claude Agent SDK.

Där det passar i AgentCore

Utvärderingar passar in på den bredare Amazon Bedrock AgentCore-plattformen, vars körtid redan hanterar värd-, skalnings-, minnes- och observerbarhetsinfrastrukturutvecklare som annars skulle bygga om för varje projekt. Med utvärdering lagt till samma yta, sätter AWS ihop vad som motsvarar en hel livscykel för agenter: distribuera dem under körningen, titta på dem genom inbyggd observerbarhet och mät dem nu mot konsekventa kriterier utan att lämna plattformen.

Tidpunkten är inte tillfällig. Över hela branschen har frågor om huruvida agenter faktiskt beter sig som avsett flyttats från akademisk oro till risk på styrelsenivå, efter uppmärksammade episoder som det samordnade felaktiga beteendet som dokumenterats i utredningen om Hugging Face-intrång och växande bevis för att riktmärken ensamma målar upp en ofullständig bild av agenternas tillförlitlighet. Verktyg som gör utvärderingen kontinuerlig, billig och ramoberoende talar direkt till den ångesten.

Varför det är viktigt

Utvärdering har i tysthet blivit flaskhalsen för antagandet av företagsagenter. Utvecklingshastigheten är inte längre begränsningen – begränsningen är förtroende: att veta att agenten som svarar kunder, flyttar data eller kör arbetsflöden kommer att göra det korrekt under förhållanden som ingen testade individuellt.

Genom att förankra utvärdering till OpenTelemetry snarare än till någon enskild SDK, satsar AWS på att branschens observerbarhetskonsensus kan fungera som dess kvalitetssäkringsskikt. Huruvida konkurrenter följer efter med likvärdiga ramagnostiska poäng kommer att säga mycket om hur snabbt agent AI mognar från demos till en pålitlig infrastruktur.

För lag som kör heterogena flottor är den praktiska innebörden jämförbarhet. När varje agent rapporterar i samma telemetriformat, blir kvalitet något som en organisation kan spåra över tid och över team snarare än att härleda om per projekt – en förutsättning för allt som liknar operativ mognad i agentsystem. För företag djupt inne i LangGraph-LlamaIndex hybridstackar, eller helt enkelt försiktiga med att skriva om instrumentering när ett bättre ramverk dyker upp, finns det nu ett förstapartsalternativ från deras molnleverantör som inte ber dem att välja sida.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →