Amazon Web Services запустила Amazon Bedrock AgentCore Evaluations, нову можливість, яка оцінює агенти штучного інтелекту, створені за допомогою будь-якої основної структури, а не лише власного інструментарію AWS, розглядаючи трасування OpenTelemetry як універсальний інтерфейс для оцінювання. Про це повідомили в блозі машинного навчання AWS 26 серпня, опублікованому Swarnim Singhal, Bharathi Srinivasan і Renya Kujirada.

У презентації розглядається те, що AWS називає розчаровуючою асиметрією в роботі виробничого штучного інтелекту: різноманітність фреймворків агентів продовжує зростати, тоді як інструменти оцінювання не встигають. Щоб не відставати від ширшого циклу новин індустрії штучного інтелекту, команди тепер регулярно поєднують і поєднують інструменти — це саме те, де традиційні конвеєри оцінювання розпадаються.

Проблема фрагментації

Згідно з формулюваннями команди AWS, більшість систем оцінки припускають, що ви створили свій агент одним певним способом: конкретним SDK, конкретним клієнтом великої мовної моделі, певним шаблоном трасування. Вийдіть за межі цієї вузької зони сумісності, і конвеєр оцінки зламається.

У реальному світі стеки рідко залишаються в межах одного постачальника. В обліковому записі допису в блозі команди створюють LangGraph для оркестровки робочого процесу, LlamaIndex для тісної інтеграції конвеєра пошуку та OpenAI Agents SDK, коли організація стандартизує моделі GPT. Вони використовують Google ADK для багатоагентної координації або Claude Agent SDK для нативних можливостей Anthropic, і вони прагнуть до Strands Agents, коли його керований моделлю цикл може запустити робочий агент на Amazon Bedrock AgentCore за хвилини, а не за дні.

Кожен із цих фреймворків створює власне внутрішнє представлення того, що робив агент — виклики інструментів, пошуки, передачі між субагентами. Історично їх оцінка означала перебудову інструментів для кожного з них або визнання того, що деякі фреймворки просто неможливо оцінити взагалі.

Як це працює: телеметрія через жорсткий зв’язок

AgentCore Evaluations намагається розірвати цей зв’язок, вибираючи інтерфейс, про який уже говорить кожна основна структура. Майже всі вони підтримують OpenTelemetry, як нативно, так і через бібліотеки інструментів спільноти — де-факто стандарт, на який багато років тому об’єдналися інструменти спостереження в хмарі та додатках.

Логіка проста: поки телеметрія агента проходить через OpenTelemetry, служба оцінки може оцінити її, незалежно від того, який SDK знаходиться під ним. У дописі в блозі розповідається про те, яку телеметрію зчитує служба, як вона вирішує, як інтерпретувати діапазони, які атрибути несуть оціночні дані, і як охоплення поширюється на фреймворки за межами списку AWS, фактично перетворюючи формат, а не фреймворк, на контракт.

Для інженерних організацій це перетворює оцінку на інфраструктурне рішення, а не на створення окремого проекту. Агент, оцінений за день, коли він відправляється, можна порівняти з тими самими показниками, незалежно від того, написали його автори в LangGraph чи Claude Agent SDK.

Де це підходить в AgentCore

Оцінки входять до ширшої платформи Amazon Bedrock AgentCore, середовище виконання якої вже обробляє інфраструктуру хостингу, масштабування, пам’яті та спостережуваності, яку розробники інакше перебудували б для кожного проекту. Завдяки оцінці, доданій до тієї самої поверхні, AWS збирає те, що становить повний життєвий цикл агентів: розгортайте їх у середовищі виконання, спостерігайте за ними за допомогою вбудованих засобів спостереження, а тепер вимірюйте їх за послідовними критеріями, не виходячи з платформи.

Час не випадковий. У всій індустрії питання про те, чи справді агенти поводяться належним чином, перемістилися від академічного занепокоєння до ризику на рівні правління, після резонансних епізодів, таких як скоординована неналежна поведінка, задокументована під час розслідування порушення правил Hugging Face, і все більшої кількості доказів того, що лише контрольні показники малюють неповну картину надійності агента. Інструменти, які роблять оцінювання безперервним, дешевим і незалежним від інфраструктури, прямо говорять про цю тривогу.

Чому це важливо

Оцінювання непомітно стало вузьким місцем впровадження корпоративних агентів. Швидкість розробки більше не є обмеженням — обмеженням є впевненість: знання того, що агент, який відповідає клієнтам, переміщує дані або виконує робочі процеси, зробить це правильно за умов, які ніхто не перевіряв окремо.

Прив’язуючи оцінку до OpenTelemetry, а не до будь-якого окремого SDK, AWS робить ставку на те, що галузевий консенсус спостережуваності може подвоїтися як рівень забезпечення якості. Те, чи будуть конкуренти з еквівалентною оцінкою фреймворків, багато в чому скаже про те, як швидко агентський ШІ розвивається з демонстраційних версій у надійну інфраструктуру.

Для команд, які керують неоднорідними флотами, практичним значенням є порівнянність. Коли кожен агент звітує в одному телеметричному форматі, якість стає тим, що організація може відстежувати з часом і між командами, а не повторно отримувати для кожного проекту — передумова для будь-чого, що нагадує операційну зрілість агентських систем. Для підприємств, які глибоко засвоїли гібридні стеки LangGraph-LlamaIndex або просто бояться переписувати інструментарій щоразу, коли з’являється кращий фреймворк, тепер є опція першої сторони від їх хмарного постачальника, яка не просить їх вибрати сторону.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →