アマゾン ウェブ サービスは、Amazon Bedrock AgentCore 評価を開始しました。これは、OpenTelemetry トレースを評価用のユニバーサル インターフェイスとして扱うことで、AWS 独自のツールだけでなく、あらゆる主要なフレームワークで構築された AI エージェントをスコアリングする新機能です。この発表は、Swarnim Singhal、Bharathi Srinivasan、Renya Kujirada によって 8 月 26 日に公開された AWS 機械学習ブログ投稿で行われました。

このピッチでは、AWS が本番 AI 作業におけるもどかしい非対称性と呼んでいる問題、つまり、エージェント フレームワークの多様性が増大し続ける一方で、評価ツールの対応が追いついていないことに対処しています。より広範な AI 業界のニュース サイクル に遅れないようにするために、チームは現在ツールを定期的に組み合わせています。これはまさに従来の評価パイプラインが崩壊している場所です。

断片化の問題

AWS チームがそれを組み立てるとき、ほとんどの評価システムは、特定の SDK、特定の大規模言語モデル クライアント、特定のトレース パターンなど、特定の方法でエージェントを構築したことを前提としています。その狭い互換性ゾーンの外に出ると、評価パイプラインが中断されます。

現実世界のスタックが 1 つのベンダーのレーン内にとどまることはほとんどありません。このブログ投稿のアカウントでは、チームはワークフロー オーケストレーションのために LangGraph を、緊密な取得パイプライン統合のために LlamaIndex を、組織が GPT モデルを標準化する場合には OpenAI Agents SDK を基盤に構築します。彼らは、マルチエージェントの調整に Google ADK を使用するか、ネイティブ Anthropic 機能に Claude Agent SDK を使用し、モデル駆動型ループにより Amazon Bedrock AgentCore 上で動作するエージェントを数日ではなく数分で実行できるようになると、Strands Agent に到達します。

これらの各フレームワークは、ツールの呼び出し、取得、サブエージェント間のハンドオフなど、エージェントが行ったことの独自の内部表現を生成します。歴史的に、それらを評価するということは、それぞれのフレームワークのインストゥルメンテーションを再構築するか、一部のフレームワークは単純にグレーディングできないことを受け入れることを意味していました。

仕組み: 密結合を介したテレメトリ

AgentCore Evaluation は、すべての主要なフレームワークがすでに話しているインターフェイスを選択することで、その結合を解消しようとします。それらのほぼすべてが、ネイティブまたはコミュニティ インストルメンテーション ライブラリを通じて、OpenTelemetry をサポートしています。OpenTelemetry は、数年前にクラウドとアプリケーションの可観測性ツールが統合された事実上の標準です。

ロジックは単純です。エージェントのテレメトリが OpenTelemetry を通過する限り、その下にある SDK に関係なく、評価サービスはテレメトリをスコアリングできます。このブログ投稿では、サービスがどのようなテレメトリを読み取るか、サービスがスパンの解釈方法をどのように決定するか、どの属性が評価データを運ぶか、AWS の名前付きリストを超えてフレームワークに範囲がどのように拡張されるか、つまりフレームワークではなくフォーマットを実質的にコントラクトにする方法について説明しています。

これにより、エンジニアリング組織にとっては、プロジェクトごとの構築ではなく、評価がインフラストラクチャの決定に変わります。出荷日に評価されたエージェントは、作成者が LangGraph で作成したのか、Claude Agent SDK で作成したのかに関係なく、同じ指標と比較できます。

AgentCore に適合する場所

評価は、より広範な Amazon Bedrock AgentCore プラットフォームに組み込まれます。このプラットフォームのランタイムは、開発者がプロジェクトごとに再構築するホスティング、スケーリング、メモリ、可観測性インフラストラクチャをすでに処理しています。同じ表面に評価を追加することで、AWS はエージェントのライフサイクル全体に相当するものを組み立てています。エージェントをランタイムにデプロイし、組み込みの可観測性を通じて監視し、プラットフォームを離れることなく一貫した基準に基づいてエージェントを測定します。

タイミングは偶然ではありません。ハギングフェイス侵害捜査で文書化された組織的な不正行為などの注目を集めたエピソードや、ベンチマークだけではエージェントの信頼性について不完全な全体像を描いているという証拠の増加を受けて、エージェントが実際に意図したとおりに動作するかどうかについての疑問は、業界全体で学術的な懸念から取締役会レベルのリスクへと移りつつある。評価を継続的、安価、フレームワークに依存しないようにするツールは、その不安を直接物語ります。

なぜそれが重要なのか

評価は密かに、エンタープライズ エージェント導入のボトルネックになっています。開発速度はもはや制約ではありません。制約は信頼性です。つまり、エージェントが顧客への応答、データの移動、またはワークフローの実行を、誰も個別にテストしていない条件下で正しく実行できるということを知っているということです。

AWS は、評価を単一の SDK ではなく OpenTelemetry に固定することで、業界の可観測性に関するコンセンサスが品質保証層としても機能することに賭けています。競合他社が同等のフレームワークに依存しないスコアリングで追随するかどうかは、エージェント AI がデモから信頼できるインフラストラクチャにどれだけ早く成熟するかを大きく左右します。

異種フリートを実行しているチームにとって、実質的な意味は比較可能性です。すべてのエージェントが同じテレメトリ形式でレポートを作成すると、組織は品質をプロジェクトごとに再取得するのではなく、時間の経過とともにチーム全体で追跡できるようになります。これは、エージェント システムの運用の成熟度に似たものに対する前提条件です。 LangGraph-LlamaIndex ハイブリッド スタックに深く取り組んでいる企業、またはより優れたフレームワークが登場するたびにインストゥルメンテーションを書き換えることを単に警戒している企業向けに、どちらの側を選択するかを求めないクラウド プロバイダーのファーストパーティ オプションが提供されるようになりました。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→