Amazon Web Services a lancé Amazon Bedrock AgentCore Evaluations, une nouvelle fonctionnalité qui évalue les agents d'IA construits avec n'importe quel framework majeur (et pas seulement les propres outils d'AWS) en traitant les traces OpenTelemetry comme une interface universelle d'évaluation. L'annonce a été faite dans un article de blog sur l'apprentissage automatique AWS publié le 26 août par Swarnim Singhal, Bharathi Srinivasan et Renya Kujirada.
Le discours aborde ce qu'AWS appelle une asymétrie frustrante dans le travail d'IA en production : la diversité des cadres d'agents ne cesse de croître tandis que les outils d'évaluation n'ont pas suivi le rythme. Pour suivre le rythme plus large du cycle d'actualités de l'industrie de l'IA, les équipes mélangent désormais régulièrement les outils, ce qui est précisément là où les pipelines d'évaluation traditionnels s'effondrent.
Le problème de la fragmentation
Selon l'équipe AWS, la plupart des systèmes d'évaluation supposent que vous avez construit votre agent d'une manière spécifique : un SDK spécifique, un client de modèle de langage étendu spécifique, un modèle de traçage spécifique. Sortez de cette zone de compatibilité étroite et le pipeline d’évaluation se rompt.
Les piles du monde réel restent rarement dans la voie d'un seul fournisseur. Dans le compte rendu du billet de blog, les équipes s'appuient sur LangGraph pour l'orchestration des flux de travail, sur LlamaIndex pour une intégration étroite du pipeline de récupération et sur le SDK OpenAI Agents lorsqu'une organisation standardise les modèles GPT. Ils utilisent Google ADK pour la coordination multi-agents ou le SDK Claude Agent pour la fonctionnalité Anthropic native, et ils font appel aux agents Strands lorsque sa boucle basée sur un modèle peut faire fonctionner un agent fonctionnel sur Amazon Bedrock AgentCore en quelques minutes plutôt qu'en quelques jours.
Chacun de ces frameworks génère sa propre représentation interne de ce qu'un agent a fait : appels d'outils, récupérations, transferts entre sous-agents. Historiquement, les évaluer signifiait reconstruire l’instrumentation pour chacun d’entre eux, ou accepter que certains cadres ne pouvaient tout simplement pas être évalués du tout.
Comment ça marche : télémétrie sur couplage serré
AgentCore Evaluations tente de dissoudre ce couplage en choisissant une interface dont parlent déjà tous les principaux frameworks. Presque tous prennent en charge OpenTelemetry, soit de manière native, soit via des bibliothèques d’instrumentation communautaires – la norme de facto sur laquelle les outils d’observabilité du cloud et des applications ont convergé il y a des années.
La logique est simple : tant que la télémétrie d'un agent passe par OpenTelemetry, le service d'évaluation peut la noter, quel que soit le SDK situé en dessous. Le billet de blog explique quelle télémétrie lit le service, comment il décide comment interpréter les étendues, quels attributs transportent les données d'évaluation et comment la couverture s'étend aux cadres au-delà de la liste nommée d'AWS - faisant ainsi du format, plutôt que du cadre, le contrat.
Pour les organisations d’ingénierie, cela transforme l’évaluation en une décision d’infrastructure plutôt qu’en une construction par projet. Un agent noté le jour de sa livraison peut être comparé aux mêmes mesures, que ses auteurs l'aient écrit dans LangGraph ou dans le SDK Claude Agent.
Où cela se situe-t-il dans AgentCore
Les évaluations s'intègrent dans la plate-forme plus large Amazon Bedrock AgentCore, dont le moteur d'exécution gère déjà l'infrastructure d'hébergement, de mise à l'échelle, de mémoire et d'observabilité que les développeurs reconstruiraient autrement pour chaque projet. Avec l'évaluation ajoutée à la même surface, AWS assemble ce qui équivaut à un cycle de vie complet pour les agents : déployez-les sur le runtime, surveillez-les grâce à l'observabilité intégrée et mesurez-les désormais par rapport à des critères cohérents sans quitter la plateforme.
Le timing n’est pas fortuit. Dans l’ensemble du secteur, la question de savoir si les agents se comportent réellement comme prévu est passée d’une préoccupation académique à un risque au niveau du conseil d’administration, à la suite d’épisodes très médiatisés tels que le mauvais comportement coordonné documenté dans l’enquête sur la violation de Hugging Face et de preuves croissantes selon lesquelles les critères à eux seuls dressent un tableau incomplet de la fiabilité des agents. Les outils qui rendent l’évaluation continue, peu coûteuse et indépendante du cadre répondent directement à cette anxiété.
Pourquoi c'est important
L'évaluation est discrètement devenue le goulot d'étranglement de l'adoption par les agents d'entreprise. La vitesse de développement n'est plus la contrainte — la contrainte est la confiance : savoir que l'agent répondant aux clients, déplaçant les données ou exécutant les flux de travail le fera correctement dans des conditions que personne n'a testées individuellement.
En ancrant l'évaluation à OpenTelemetry plutôt qu'à un seul SDK, AWS parie que le consensus d'observabilité du secteur peut servir de couche d'assurance qualité. Le fait que les concurrents suivent avec une notation équivalente indépendante du framework en dira long sur la rapidité avec laquelle l'IA agentique passe des démos à une infrastructure fiable.
Pour les équipes gérant des flottes hétérogènes, l’implication pratique est la comparabilité. Lorsque chaque agent rend compte dans le même format de télémétrie, la qualité devient quelque chose qu'une organisation peut suivre au fil du temps et entre les équipes plutôt que de la recalculer par projet – une condition préalable à tout ce qui ressemble à une maturité opérationnelle dans les systèmes agentiques. Pour les entreprises profondément ancrées dans les piles hybrides LangGraph-LlamaIndex, ou qui hésitent simplement à réécrire l'instrumentation chaque fois qu'un meilleur cadre apparaît, il existe désormais une option propriétaire de leur fournisseur de cloud qui ne leur demande pas de choisir leur camp.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →