Amazon Web Services ने Amazon Bedrock AgentCore Evaluations लाँच केली आहे, ही एक नवीन क्षमता आहे जी कोणत्याही मोठ्या फ्रेमवर्कसह तयार केलेल्या AI एजंटना गुण मिळवते — केवळ AWS च्या स्वतःच्या टूलींगने नव्हे — OpenTelemetry ट्रेसला मूल्यमापनासाठी सार्वत्रिक इंटरफेस म्हणून हाताळून. स्वर्णिम सिंघल, भारती श्रीनिवासन आणि रेन्या कुजिरडा यांनी 26 ऑगस्ट रोजी प्रकाशित केलेल्या AWS मशीन लर्निंग ब्लॉग पोस्टमध्ये ही घोषणा करण्यात आली.
खेळपट्टी ज्याला AWS उत्पादन AI कार्यामध्ये निराशाजनक असममितता म्हणते ते संबोधित करते: एजंट फ्रेमवर्कची विविधता वाढतच राहते तर मूल्यमापन टूलिंगने गती ठेवली नाही. व्यापक एआय उद्योग बातम्या चक्र सोबत राहण्यासाठी, संघ आता नियमितपणे साधने मिसळतात आणि जुळवतात — जे तंतोतंत पारंपारिक मूल्यमापन पाइपलाइन वेगळे होतात.
विखंडन समस्या
AWS टीमने ते फ्रेम केल्यामुळे, बहुतेक मूल्यमापन प्रणाली असे गृहीत धरतात की तुम्ही तुमचा एजंट एका विशिष्ट मार्गाने तयार केला आहे: एक विशिष्ट SDK, विशिष्ट मोठ्या भाषा मॉडेल क्लायंट, विशिष्ट ट्रेसिंग पॅटर्न. त्या अरुंद सुसंगतता क्षेत्राच्या बाहेर पाऊल टाका आणि मूल्यमापन पाइपलाइन तुटली.
रिअल-वर्ल्ड स्टॅक क्वचितच एका विक्रेत्याच्या लेनमध्ये राहतात. ब्लॉग पोस्टच्या खात्यामध्ये, संघ वर्कफ्लो ऑर्केस्ट्रेशनसाठी LangGraph वर, घट्ट पुनर्प्राप्ती पाइपलाइन एकत्रीकरणासाठी LlamaIndex वर आणि जेव्हा एखादी संस्था GPT मॉडेल्सवर प्रमाणित करते तेव्हा OpenAI एजंट SDK वर तयार करतात. ते मल्टि-एजंट समन्वयासाठी Google ADK किंवा मूळ मानववंशीय क्षमतेसाठी क्लॉड एजंट SDK वापरतात आणि जेव्हा मॉडेल-चालित लूप काही दिवसांपेक्षा मिनिटांत Amazon Bedrock AgentCore वर कार्यरत एजंट मिळवू शकतात तेव्हा ते Strands एजंट्सपर्यंत पोहोचतात.
त्यातील प्रत्येक फ्रेमवर्क एजंटने काय केले याचे स्वतःचे अंतर्गत प्रतिनिधित्व तयार करते — टूल कॉल, पुनर्प्राप्ती, उप-एजंटमधील हँडऑफ. ऐतिहासिकदृष्ट्या, त्यांचे मूल्यमापन करणे म्हणजे प्रत्येकासाठी इन्स्ट्रुमेंटेशनची पुनर्बांधणी करणे, किंवा काही फ्रेमवर्क्सला अजिबात श्रेणीबद्ध केले जाऊ शकत नाही हे स्वीकारणे.
हे कसे कार्य करते: टेलीमेट्री ओव्हर टाइट कपलिंग
AgentCore मूल्यमापन प्रत्येक प्रमुख फ्रेमवर्क आधीपासून बोलत असलेला इंटरफेस निवडून ते कपलिंग विसर्जित करण्याचा प्रयत्न करते. ते जवळजवळ सर्व OpenTelemetry ला समर्थन देतात, एकतर नेटिव्हली किंवा कम्युनिटी इंस्ट्रुमेंटेशन लायब्ररीद्वारे — क्लाउड आणि ॲप्लिकेशन ऑब्झर्बिबिलिटी टूल्स वर्षापूर्वी एकत्रित झाले होते.
तर्क सरळ आहे: जोपर्यंत एजंटची टेलीमेट्री OpenTelemetry मधून वाहते तोपर्यंत, SDK खाली काय आहे याची पर्वा न करता मूल्यमापन सेवा स्कोअर करू शकते. ब्लॉग पोस्ट सेवा कोणती टेलीमेट्री वाचते, स्पॅन्सचा अर्थ कसा लावायचा हे ठरवते, कोणती विशेषता मूल्यमापन डेटा ठेवते आणि AWS च्या नामांकित सूचीच्या पलीकडे फ्रेमवर्कपर्यंत कव्हरेज कसे विस्तारते — फ्रेमवर्क, कॉन्ट्रॅक्ट ऐवजी प्रभावीपणे फॉरमॅट बनवते.
अभियांत्रिकी संस्थांसाठी, हे मूल्यमापन प्रति-प्रकल्प बिल्डऐवजी पायाभूत सुविधांच्या निर्णयात बदलते. एजंटने ज्या दिवशी शिप केले त्या दिवशी त्याची तुलना त्याच मेट्रिक्सशी केली जाऊ शकते की त्याच्या लेखकांनी ते LangGraph किंवा क्लॉड एजंट SDK मध्ये लिहिले आहे.
ते AgentCore मध्ये कुठे बसते
विस्तृत Amazon Bedrock AgentCore प्लॅटफॉर्ममध्ये मूल्यमापन स्लॉट, ज्याचा रनटाइम आधीपासून होस्टिंग, स्केलिंग, मेमरी आणि निरीक्षणक्षमता इन्फ्रास्ट्रक्चर डेव्हलपर हाताळतो अन्यथा प्रत्येक प्रकल्पासाठी पुनर्बांधणी करेल. त्याच पृष्ठभागावर मूल्यमापन जोडल्याने, AWS एजंट्ससाठी पूर्ण जीवनचक्र किती प्रमाणात आहे हे एकत्र करत आहे: त्यांना रनटाइमवर तैनात करा, अंगभूत निरीक्षणाद्वारे त्यांचे निरीक्षण करा आणि आता प्लॅटफॉर्म न सोडता सातत्यपूर्ण निकषांवर त्यांचे मोजमाप करा.
वेळ आनुषंगिक नाही. संपूर्ण उद्योगात, एजंट्स खरोखर हेतूनुसार वागतात की नाही याविषयीचे प्रश्न शैक्षणिक चिंतेपासून बोर्ड-स्तरीय जोखमीकडे गेले आहेत, उच्च-प्रोफाइल भाग जसे की हगिंग फेस उल्लंघन तपासणीमध्ये दस्तऐवजीकरण केलेले समन्वयित गैरवर्तन आणि वाढत्या पुराव्यांमुळे केवळ बेंचमार्क एजंटच्या विश्वासार्हतेचे अपूर्ण चित्र रंगवतात. मूल्यमापन सतत, स्वस्त आणि फ्रेमवर्क-स्वतंत्र बनवणारे टूलिंग त्या चिंतेशी थेट बोलते.
हे महत्त्वाचे का आहे
मूल्यांकन शांतपणे एंटरप्राइझ एजंट दत्तक घेण्याचा अडथळा बनला आहे. विकासाचा वेग यापुढे मर्यादा नाही — मर्यादा म्हणजे आत्मविश्वास: ग्राहकांना उत्तर देणारा एजंट, डेटा हलवणारा किंवा वर्कफ्लो कार्यान्वित करणारा एजंट वैयक्तिकरित्या कोणीही चाचणी न केलेल्या परिस्थितीत योग्यरित्या करेल हे जाणून घेणे.
कोणत्याही एका SDK ऐवजी OpenTelemetry वर मूल्यमापन अँकरिंग करून, AWS हे पैज लावत आहे की उद्योगाची निरीक्षणक्षमता त्याच्या गुणवत्तेची खात्री स्तर म्हणून दुप्पट होऊ शकते. स्पर्धक समतुल्य फ्रेमवर्क-अज्ञेयवादी स्कोअरिंगचे अनुसरण करतात की नाही हे एजंटिक AI डेमोमधून विश्वासार्ह पायाभूत सुविधांमध्ये किती लवकर परिपक्व होते याबद्दल बरेच काही सांगेल.
विषम फ्लीट्स चालवणाऱ्या संघांसाठी, व्यावहारिक अर्थ तुलनात्मकता आहे. जेव्हा प्रत्येक एजंट समान टेलीमेट्री फॉरमॅटमध्ये अहवाल देतो, तेव्हा गुणवत्तेची अशी गोष्ट बनते जी संस्था प्रत्येक प्रकल्पाला पुन्हा मिळवण्याऐवजी कालांतराने आणि संघांमध्ये ट्रॅक करू शकते - एजंटिक सिस्टममध्ये ऑपरेशनल मॅच्युरिटीशी साम्य असलेल्या कोणत्याही गोष्टीसाठी पूर्वअट. LangGraph-LlamaIndex हायब्रीड स्टॅकमध्ये खोलवर असलेल्या उद्योगांसाठी, किंवा जेव्हा जेव्हा चांगले फ्रेमवर्क दिसते तेव्हा इन्स्ट्रुमेंटेशन पुन्हा लिहिण्यापासून सावध राहण्यासाठी, आता त्यांच्या क्लाउड प्रदात्याकडून प्रथम-पक्ष पर्याय आहे जो त्यांना बाजू निवडण्यास सांगत नाही.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →