Amazon Web Services는 OpenTelemetry 추적을 평가용 범용 인터페이스로 처리하여 AWS 자체 도구뿐만 아니라 모든 주요 프레임워크로 구축된 AI 에이전트의 점수를 매기는 새로운 기능인 Amazon Bedrock AgentCore 평가를 출시했습니다. 이 발표는 Swarnim Singhal, Bharathi Srinivasan 및 Renya Kujirada가 8월 26일 게시한 AWS 기계 학습 블로그 게시물에서 나왔습니다.
이 프레젠테이션에서는 AWS가 프로덕션 AI 작업의 실망스러운 비대칭성이라고 부르는 문제를 다룹니다. 즉, 평가 도구가 보조를 맞추지 못하는 동안 에이전트 프레임워크의 다양성은 계속 증가하고 있습니다. 더 광범위한 AI 업계 뉴스 주기에 발맞추기 위해 팀은 이제 정기적으로 도구를 혼합하고 일치시킵니다. 이는 바로 전통적인 평가 파이프라인이 분리되는 지점입니다.
조각화 문제
AWS 팀이 이를 구성할 때 대부분의 평가 시스템은 특정 SDK, 특정 대규모 언어 모델 클라이언트, 특정 추적 패턴 등 특정 방식으로 에이전트를 구축했다고 가정합니다. 좁은 호환성 영역 밖으로 나가면 평가 파이프라인이 중단됩니다.
실제 스택은 한 공급업체의 레인 안에 머무르는 경우가 거의 없습니다. 블로그 게시물 계정에서 팀은 워크플로 조정을 위해 LangGraph, 긴밀한 검색 파이프라인 통합을 위해 LlamaIndex, 조직이 GPT 모델을 표준화할 때 OpenAI Agents SDK를 기반으로 구축합니다. 이들은 다중 에이전트 조정을 위해 Google ADK를 사용하거나 기본 Anthropic 기능을 위해 Claude Agent SDK를 사용하며, 모델 기반 루프가 며칠이 아닌 몇 분 만에 Amazon Bedrock AgentCore에서 작동하는 에이전트를 실행할 수 있을 때 Strands 에이전트에 도달합니다.
각 프레임워크는 에이전트가 수행한 작업(도구 호출, 검색, 하위 에이전트 간 전달)에 대한 자체 내부 표현을 생성합니다. 역사적으로 이를 평가한다는 것은 각 프레임워크에 대한 계측을 다시 구축하거나 일부 프레임워크를 전혀 등급화할 수 없다는 것을 받아들이는 것을 의미했습니다.
작동 방식: 긴밀한 결합을 통한 원격 측정
AgentCore 평가는 모든 주요 프레임워크가 이미 말하는 인터페이스를 선택하여 이러한 결합을 해소하려고 시도합니다. 거의 모든 제품이 기본적으로 또는 커뮤니티 계측 라이브러리를 통해 OpenTelemetry를 지원합니다. 이는 몇 년 전 클라우드 및 애플리케이션 관찰 도구가 통합된 사실상의 표준입니다.
논리는 간단합니다. 에이전트의 원격 분석이 OpenTelemetry를 통해 흐르는 한 평가 서비스는 어떤 SDK가 아래에 있는지에 관계없이 점수를 매길 수 있습니다. 블로그 게시물에서는 서비스가 읽는 원격 측정 방법, 범위를 해석하는 방법을 결정하는 방법, 평가 데이터를 전달하는 속성, 적용 범위가 AWS의 명명된 목록을 넘어 프레임워크로 확장되는 방법을 안내하여 프레임워크가 아닌 형식을 효과적으로 계약으로 만듭니다.
엔지니어링 조직의 경우 이는 평가를 프로젝트별 빌드가 아닌 인프라 결정으로 전환합니다. 배송일에 등급이 매겨진 에이전트는 작성자가 LangGraph에서 작성했든 Claude Agent SDK에서 작성했든 동일한 측정항목과 비교할 수 있습니다.
AgentCore에 적합한 위치
평가는 더 광범위한 Amazon Bedrock AgentCore 플랫폼에 적용됩니다. 이 플랫폼의 런타임은 이미 호스팅, 확장, 메모리 및 관찰 가능성 인프라 개발자가 각 프로젝트에 대해 재구축할 수 있도록 처리합니다. 동일한 표면에 평가를 추가하여 AWS는 에이전트의 전체 수명 주기에 해당하는 요소를 수집합니다. 런타임에 에이전트를 배포하고, 내장된 관찰 기능을 통해 관찰하고, 이제 플랫폼을 떠나지 않고 일관된 기준에 따라 측정합니다.
타이밍은 우연이 아닙니다. Hugging Face 위반 조사에서 기록된 조직적 잘못된 행동과 같은 세간의 이목을 끄는 에피소드와 벤치마크만으로는 상담원 신뢰성에 대한 불완전한 그림을 그리는 증거가 늘어나면서 상담원이 실제로 의도한 대로 행동하는지에 대한 질문이 학문적 관심사에서 이사회 수준의 위험으로 옮겨갔습니다. 평가를 지속적이고 저렴하며 프레임워크 독립적으로 만드는 도구는 이러한 불안을 직접적으로 말해줍니다.
중요한 이유
평가는 조용히 기업 에이전트 채택의 병목 현상이 되었습니다. 개발 속도는 더 이상 제약이 아닙니다. 제약은 자신감입니다. 아무도 개별적으로 테스트하지 않은 조건에서 상담원이 고객에게 응답하고, 데이터를 이동하고, 워크플로를 실행하는 것이 올바르게 수행될 것이라는 점을 아는 것입니다.
단일 SDK가 아닌 OpenTelemetry에 대한 평가를 고정함으로써 AWS는 업계의 관찰 가능성 합의가 품질 보증 계층을 두 배로 늘릴 수 있다고 확신합니다. 경쟁업체가 프레임워크에 구애받지 않는 동등한 점수를 따를지 여부는 에이전트 AI가 데모에서 신뢰할 수 있는 인프라로 얼마나 빨리 성숙하는지에 대해 많은 것을 말해줍니다.
이기종 차량을 운영하는 팀의 경우 실질적인 의미는 비교 가능성입니다. 모든 에이전트가 동일한 원격 측정 형식으로 보고하면 품질은 조직이 프로젝트별로 다시 파생하는 대신 시간이 지남에 따라 팀 전체에 걸쳐 추적할 수 있는 것이 됩니다. 이는 에이전트 시스템의 운영 성숙도와 유사한 모든 것에 대한 전제 조건입니다. LangGraph-LlamaIndex 하이브리드 스택을 깊이 사용하는 기업이나 더 나은 프레임워크가 나타날 때마다 계측을 다시 작성하는 것을 경계하는 기업의 경우 이제 클라우드 제공업체에서 어느 쪽을 선택하라고 요구하지 않는 자사 옵션이 있습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →