Amazon Web Services 推出了 Amazon Bedrock AgentCore 评估,这是一项新功能,可通过将 OpenTelemetry 跟踪视为通用评估接口,对使用任何主要框架(而不仅仅是 AWS 自己的工具)构建的 AI 代理进行评分。 Swarnim Singhal、Bharathi Srinivasan 和 Renya Kujirada 在 8 月 26 日发布的 AWS 机器学习博客文章中宣布了这一消息。
此次推介解决了 AWS 所说的生产 AI 工作中令人沮丧的不对称问题:代理框架的多样性不断增长,而评估工具却没有跟上步伐。为了跟上更广泛的人工智能行业新闻周期,团队现在经常混合和匹配工具——这正是传统评估流程失败的地方。
碎片问题
在 AWS 团队的框架中,大多数评估系统都假设您以特定的方式构建代理:特定的 SDK、特定的大型语言模型客户端、特定的跟踪模式。走出狭窄的兼容区域,评估流程就会中断。
现实世界中的堆栈很少停留在一个供应商的车道内。在博客文章的帐户中,团队在 LangGraph 上进行工作流程编排,在 LlamaIndex 上进行紧密的检索管道集成,并在组织对 GPT 模型进行标准化时在 OpenAI Agents SDK 上进行构建。他们使用 Google ADK 进行多代理协调,或使用 Claude Agent SDK 实现原生 Anthropic 功能,并且当其模型驱动循环可以在几分钟而不是几天内让工作代理在 Amazon Bedrock AgentCore 上运行时,他们会选择 Strands Agent。
每个框架都会生成自己的代理行为的内部表示——工具调用、检索、子代理之间的切换。从历史上看,评估它们意味着为每个框架重建工具,或者接受某些框架根本无法评级。
工作原理:紧耦合遥测
AgentCore评估试图通过选择每个主要框架已经使用的接口来消除这种耦合。几乎所有这些都支持 OpenTelemetry,无论是本机还是通过社区仪器库 - 这是云和应用程序可观测性工具多年前融合的事实上的标准。
逻辑很简单:只要代理的遥测流经 OpenTelemetry,评估服务就可以对其进行评分,无论底层使用什么 SDK。这篇博客文章介绍了该服务读取的遥测数据、它如何决定如何解释跨度、哪些属性携带评估数据,以及覆盖范围如何扩展到 AWS 指定列表之外的框架 - 有效地使格式而不是框架成为合同。
对于工程组织来说,这将评估转变为基础设施决策,而不是每个项目的构建。无论其作者是在 LangGraph 还是 Claude Agent SDK 中编写的,在发货当天评分的代理都可以与相同的指标进行比较。
AgentCore 的适用范围
评估被纳入更广泛的 Amazon Bedrock AgentCore 平台,该平台的运行时已经处理托管、扩展、内存和可观察性基础设施,否则开发人员将为每个项目重建。通过将评估添加到同一表面,AWS 正在组装代理的完整生命周期:将它们部署在运行时,通过内置的可观察性观察它们,现在无需离开平台就可以根据一致的标准来衡量它们。
时机并非偶然。在整个行业中,继 Hugging Face 违规调查中记录的协调不当行为等备受瞩目的事件之后,关于代理是否真正按照预期行事的问题已经从学术关注转向董事会层面的风险,并且越来越多的证据表明基准单独描绘了代理可靠性的不完整图景。使评估持续、廉价且独立于框架的工具直接说明了这种焦虑。
为什么它很重要
评估已悄然成为企业代理采用的瓶颈。开发速度不再是约束——约束是信心:知道代理在没有人单独测试的情况下能够正确地回答客户、移动数据或执行工作流程。
通过将评估锚定到 OpenTelemetry 而不是任何单个 SDK,AWS 相信行业的可观察性共识可以兼作其质量保证层。竞争对手是否遵循与框架无关的同等评分将在很大程度上说明代理人工智能从演示成熟到可靠基础设施的速度有多快。
对于运行异构车队的团队来说,实际意义是可比性。当每个代理都以相同的遥测格式进行报告时,质量就成为组织可以随着时间的推移跨团队跟踪的东西,而不是根据每个项目重新推导——这是代理系统中任何类似于操作成熟度的先决条件。对于深陷 LangGraph-LlamaIndex 混合堆栈的企业,或者只是担心每当出现更好的框架时重写工具,现在他们的云提供商提供了一个第一方选项,不要求他们选择立场。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →