Amazon Web Services запустила Amazon Bedrock AgentCore Evaluations — новую возможность, которая оценивает агенты ИИ, созданные с использованием любой основной платформы, а не только собственных инструментов AWS, рассматривая трассировки OpenTelemetry как универсальный интерфейс для оценки. Объявление появилось в блоге AWS по машинному обучению, опубликованном 26 августа Сварнимом Сингхалом, Бхарати Шринивасаном и Ренией Куджирадой.
В докладе рассматривается то, что AWS называет разочаровывающей асимметрией в производственной работе с искусственным интеллектом: разнообразие агентских инфраструктур продолжает расти, а инструменты оценки отстают. Чтобы идти в ногу с более широким циклом новостей индустрии искусственного интеллекта, команды теперь регулярно смешивают и сопоставляют инструменты — именно здесь традиционные конвейеры оценки разваливаются.
Проблема фрагментации
По мнению команды AWS, большинство систем оценки предполагают, что вы создали свой агент одним конкретным способом: конкретный SDK, конкретный клиент большой языковой модели, конкретный шаблон трассировки. Выйдите за пределы этой узкой зоны совместимости, и конвейер оценки сломается.
Реальные стеки редко остаются в пределах линии одного поставщика. В сообщении блога команды используют LangGraph для оркестрации рабочих процессов, LlamaIndex для тесной интеграции конвейера поиска и SDK OpenAI Agents, когда организация стандартизирует модели GPT. Они используют Google ADK для координации нескольких агентов или Claude Agent SDK для собственных возможностей Anthropic, а также обращаются к агентам Strands, когда его цикл, управляемый моделью, может запустить рабочий агент на Amazon Bedrock AgentCore за считанные минуты, а не дни.
Каждая из этих инфраструктур генерирует собственное внутреннее представление о том, что делал агент — вызовы инструментов, извлечение информации, передача данных между субагентами. Исторически их оценка означала перестройку инструментария для каждого из них или признание того, что некоторые фреймворки просто невозможно оценить вообще.
Как это работает: телеметрия с жесткой связью
AgentCore Evaluations пытается устранить эту связь, выбирая интерфейс, который уже поддерживает каждая крупная платформа. Почти все они поддерживают OpenTelemetry либо изначально, либо через библиотеки инструментов сообщества — фактический стандарт, на котором много лет назад объединились инструменты наблюдения за облаками и приложениями.
Логика проста: пока телеметрия агента проходит через OpenTelemetry, служба оценки может ее оценить, независимо от того, какой SDK находится под ней. В сообщении блога рассказывается, какие телеметрические данные считывает сервис, как он решает, как интерпретировать интервалы, какие атрибуты переносят оценочные данные и как покрытие распространяется на платформы, выходящие за пределы именованного списка AWS, — фактически делая формат, а не структуру, контрактом.
Для инженерных организаций это превращает оценку в решение об инфраструктуре, а не в сборку каждого проекта. Агент, оцененный в день его выпуска, можно сравнить с теми же показателями, независимо от того, написали ли его авторы в LangGraph или в Claude Agent SDK.
Где это место в AgentCore
Оценочные работы встраиваются в более широкую платформу Amazon Bedrock AgentCore, среда выполнения которой уже обрабатывает инфраструктуру хостинга, масштабирования, памяти и наблюдения, которую разработчики в противном случае перестраивали бы для каждого проекта. Благодаря добавлению оценки к той же поверхности AWS собирает то, что представляет собой полный жизненный цикл агентов: развертывает их во время выполнения, наблюдает за ними с помощью встроенной возможности наблюдения и теперь измеряет их соответствие согласованным критериям, не покидая платформу.
Время выбрано не случайно. Во всей отрасли вопросы о том, действительно ли агенты ведут себя так, как задумано, перешли из академических кругов в сферу риска на уровне совета директоров после громких эпизодов, таких как скоординированное неправомерное поведение, задокументированное в ходе расследования взлома Hugging Face, и растущих доказательств того, что сами по себе тесты рисуют неполную картину надежности агентов. Инструменты, которые делают оценку непрерывной, дешевой и независимой от структуры, напрямую говорят об этом беспокойстве.
Почему это важно
Оценка незаметно стала узким местом при внедрении корпоративных агентов. Скорость разработки больше не является ограничением — ограничением является уверенность: знание того, что агент, отвечающий клиентам, перемещающий данные или выполняющий рабочие процессы, будет делать это правильно в условиях, которые никто не проверял индивидуально.
Привязывая оценку к OpenTelemetry, а не к какому-то отдельному SDK, AWS делает ставку на то, что отраслевой консенсус по наблюдаемости может удвоиться в качестве уровня обеспечения качества. То, последуют ли конкуренты с эквивалентной независимой от платформы оценкой, многое скажет о том, насколько быстро агентный ИИ превратится из демонстрационных версий в надежную инфраструктуру.
Для команд, управляющих разнородными автопарками, практическим смыслом является сопоставимость. Когда каждый агент отчитывается в одном и том же формате телеметрии, качество становится тем, что организация может отслеживать с течением времени и между командами, а не повторно получать данные для каждого проекта — предварительное условие для чего-то похожего на операционную зрелость в агентских системах. Для предприятий, глубоко использующих гибридные стеки LangGraph-LlamaIndex или просто опасающихся переписывать инструменты всякий раз, когда появляется лучшая платформа, теперь есть собственный вариант от их облачного провайдера, который не просит их выбирать чью-либо сторону.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →