Amazon Web Services השיקה את Amazon Bedrock AgentCore Evaluations, יכולת חדשה שמקבלת ציונים לסוכני AI שנבנו עם כל מסגרת מרכזית - לא רק הכלים של AWS עצמה - על ידי התייחסות לעקבות OpenTelemetry כממשק אוניברסלי להערכה. ההכרזה הגיעה בפוסט בבלוג למידת מכונה של AWS שפורסם ב-26 באוגוסט על ידי Swarnim Singhal, Bharathi Srinivasan ורניה Kujirada.

הפיצ'ר מתייחס למה ש-AWS מכנה אסימטריה מתסכלת בעבודת AI בייצור: המגוון של מסגרות סוכנים ממשיך לגדול בעוד כלי הערכה לא עמדו בקצב. כדי לעמוד בקצב הרחב יותר מחזור החדשות של תעשיית הבינה המלאכותית, כעת צוותים מערבבים ומתואמים כלים באופן שגרתי - וזה בדיוק המקום שבו צינורות ההערכה המסורתיים מתפרקים.

בעיית הפיצול

בזמן שצוות AWS ממסגר את זה, רוב מערכות ההערכה מניחות שבנית את הסוכן שלך בדרך אחת ספציפית: SDK ספציפי, לקוח ספציפי של מודל שפה גדול, דפוס מעקב ספציפי. צא מחוץ לאזור התאימות הצר הזה וצינור ההערכה נשבר.

ערימות בעולם האמיתי כמעט ולא נשארות בנתיב של ספק אחד. בחשבון של הפוסט בבלוג, צוותים בונים על LangGraph לתזמור זרימת עבודה, על LlamaIndex לאינטגרציה הדוקה של צינור אחזור, ועל ה- OpenAI Agents SDK כאשר ארגון מתקין על מודלים של GPT. הם משתמשים ב-Google ADK לתיאום ריבוי סוכנים או ב-Claude Agent SDK ליכולת אנתרופית מקורית, והם מגיעים אל Strands Agents כאשר הלולאה מונעת הדגמים שלו יכולה לגרום לסוכן עובד לרוץ על Amazon Bedrock AgentCore תוך דקות ולא ימים.

כל אחת מהמסגרות הללו מייצרת ייצוג פנימי משלה של מה שסוכן עשה - קריאות לכלים, שליפות, מסירות בין סוכני משנה. מבחינה היסטורית, הערכתם פירושה בנייה מחדש של מכשור עבור כל אחד מהם, או קבלת העובדה שחלק מהמסגרות פשוט לא ניתנות לדירוג כלל.

איך זה עובד: טלמטריה על פני צימוד הדוק

AgentCore Evaluations מנסה לפזר את הצימוד הזה על ידי בחירת ממשק שכל מסגרת מרכזית כבר מדברת. כמעט כולם תומכים ב-OpenTelemetry, בין אם מקורית או באמצעות ספריות מכשור קהילתיות - התקן דה פקטו שכלי צפייה בענן ויישומים התכנסו אליו לפני שנים.

ההיגיון הוא פשוט: כל עוד הטלמטריה של סוכן זורמת דרך OpenTelemetry, שירות ההערכה יכול להבקיע אותה, ללא קשר ל-SDK שמתחתיו. הפוסט בבלוג עובר על איזו טלמטריה השירות קורא, כיצד הוא מחליט כיצד לפרש טווחים, אילו תכונות נושאות את נתוני ההערכה, וכיצד הכיסוי מתרחב למסגרות מעבר לרשימה הרשומה של AWS - למעשה הופך את הפורמט, ולא את המסגרת, לחוזה.

עבור ארגוני הנדסה, זה הופך את ההערכה להחלטת תשתית במקום לבנייה לפי פרויקט. ניתן להשוות סוכן שדורג ביום שבו הוא נשלח לאותם מדדים בין אם מחבריו כתבו אותו ב-LangGraph או ב-Cloud Agent SDK.

איפה זה מתאים ב- AgentCore

הערכות משתלבות בפלטפורמה הרחבה יותר של Amazon Bedrock AgentCore, שזמן הריצה שלה כבר מטפל במפתחי תשתית אירוח, קנה מידה, זיכרון וצפיות שהיו בונים מחדש עבור כל פרויקט. עם הערכה שנוספה לאותו משטח, AWS מרכיבה מה שמסתכם במחזור חיים מלא עבור סוכנים: פרוס אותם בזמן הריצה, צפה בהם באמצעות יכולת צפייה מובנית, ועכשיו למדוד אותם מול קריטריונים עקביים מבלי לעזוב את הפלטפורמה.

העיתוי אינו מקרי. ברחבי התעשייה, השאלות לגבי האם הסוכנים אכן מתנהגים כמתוכנן עברו מדאגה אקדמית לסיכון ברמת הדירקטוריון, בעקבות פרקים בעלי פרופיל גבוה כמו ההתנהגות השגויה המתואמת שתועדה בחקירת הפרת "חיבוק פנים" והולכת וגדלה של עדויות לכך שמדדים נקודתיים לבדם מציירים תמונה לא מלאה של מהימנות הסוכנים. כלי עבודה שהופך את ההערכה לרציפה, זולה ובלתי תלויה במסגרת מדברת ישירות על החרדה הזו.

למה זה חשוב

הערכה הפכה בשקט לצוואר הבקבוק של אימוץ סוכנים ארגוניים. מהירות הפיתוח היא כבר לא המגבלה - האילוץ הוא ביטחון עצמי: הידיעה שהסוכן שעונה ללקוחות, מעביר נתונים או מבצע זרימות עבודה יעשה זאת בצורה נכונה בתנאים שאיש לא נבדק בנפרד.

על ידי עיגון הערכה ל-OpenTelemetry ולא לכל SDK בודד, AWS מהמר שהקונצנזוס הנצפה בתעשייה יכול להכפיל כשכבת אבטחת האיכות שלה. אם המתחרים עוקבים אחריו עם ניקוד אגנוסטי מקביל למסגרת יגיד הרבה על כמה מהר בינה מלאכותית מבשילה מהדגמות לתשתית אמינה.

עבור צוותים המנהלים ציים הטרוגניים, המשמעות המעשית היא השוואה. כאשר כל סוכן מדווח באותו פורמט טלמטריה, האיכות הופכת למשהו שארגון יכול לעקוב לאורך זמן ולרוחב צוותים במקום לגזור מחדש לכל פרויקט - תנאי מוקדם לכל דבר שדומה לבגרות תפעולית במערכות סוכן. עבור ארגונים שנמצאים עמוק בערימות היברידיות של LangGraph-LlamaIndex, או פשוט נזהרים משכתוב מכשור בכל פעם שמופיעה מסגרת טובה יותר, יש כעת אפשרות של צד ראשון מספק הענן שלהם שלא מבקשת מהם לבחור צד.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →