अमेज़ॅन वेब सर्विसेज ने अमेज़ॅन बेडरॉक एजेंटकोर इवैल्यूएशंस लॉन्च किया है, जो एक नई क्षमता है जो ओपन टेलीमेट्री ट्रेस को मूल्यांकन के लिए एक सार्वभौमिक इंटरफ़ेस के रूप में मानकर किसी भी प्रमुख ढांचे के साथ निर्मित एआई एजेंटों को स्कोर करती है - न कि केवल एडब्ल्यूएस की अपनी टूलींग। यह घोषणा 26 अगस्त को स्वर्णिम सिंघल, भारती श्रीनिवासन और रेन्या कुजिराडा द्वारा प्रकाशित AWS मशीन लर्निंग ब्लॉग पोस्ट में की गई।

पिच उस चीज़ को संबोधित करती है जिसे AWS उत्पादन AI कार्य में निराशाजनक विषमता कहता है: एजेंट ढाँचे की विविधता बढ़ती रहती है जबकि मूल्यांकन टूलींग ने गति नहीं रखी है। व्यापक एआई उद्योग समाचार चक्र के साथ बने रहने के लिए, टीमें अब नियमित रूप से टूल का मिश्रण और मिलान करती हैं - यही वह जगह है जहां पारंपरिक मूल्यांकन पाइपलाइनें टूट जाती हैं।

विखंडन समस्या

जैसा कि AWS टीम इसे तैयार करती है, अधिकांश मूल्यांकन प्रणालियाँ मानती हैं कि आपने अपना एजेंट एक विशिष्ट तरीके से बनाया है: एक विशिष्ट SDK, एक विशिष्ट बड़ी भाषा मॉडल क्लाइंट, एक विशिष्ट ट्रेसिंग पैटर्न। उस संकीर्ण संगतता क्षेत्र से बाहर कदम रखें और मूल्यांकन पाइपलाइन टूट जाए।

वास्तविक दुनिया के ढेर शायद ही कभी एक विक्रेता की लेन के अंदर रहते हैं। ब्लॉग पोस्ट के खाते में, टीमें वर्कफ़्लो ऑर्केस्ट्रेशन के लिए लैंगग्राफ पर, टाइट पुनर्प्राप्ति पाइपलाइन एकीकरण के लिए लामाइंडेक्स पर, और जब कोई संगठन जीपीटी मॉडल पर मानकीकरण करता है तो ओपनएआई एजेंट एसडीके पर निर्माण करता है। वे मल्टी-एजेंट समन्वय के लिए Google ADK या देशी एंथ्रोपिक क्षमता के लिए क्लाउड एजेंट SDK का उपयोग करते हैं, और वे स्ट्रैंड्स एजेंटों तक पहुंचते हैं जब इसके मॉडल-संचालित लूप को अमेज़ॅन बेडरॉक एजेंटकोर पर दिनों के बजाय मिनटों में काम करने वाला एजेंट मिल सकता है।

उनमें से प्रत्येक ढाँचा एक एजेंट ने जो किया उसका अपना आंतरिक प्रतिनिधित्व उत्पन्न करता है - टूल कॉल, पुनर्प्राप्ति, उप-एजेंटों के बीच हैंडऑफ़। ऐतिहासिक रूप से, उनका मूल्यांकन करने का अर्थ है प्रत्येक के लिए उपकरण का पुनर्निर्माण करना, या यह स्वीकार करना कि कुछ रूपरेखाओं को बिल्कुल भी वर्गीकृत नहीं किया जा सकता है।

यह कैसे काम करता है: टाइट कपलिंग पर टेलीमेट्री

एजेंटकोर इवैल्यूएशंस उस इंटरफ़ेस को चुनकर उस युग्मन को भंग करने का प्रयास करता है जो हर प्रमुख ढांचा पहले से ही बोलता है। उनमें से लगभग सभी ओपन टेलीमेट्री का समर्थन करते हैं, या तो मूल रूप से या सामुदायिक उपकरण पुस्तकालयों के माध्यम से - वास्तविक मानक जो कि क्लाउड और एप्लिकेशन अवलोकन उपकरण वर्षों पहले परिवर्तित हुए थे।

तर्क सीधा है: जब तक एक एजेंट की टेलीमेट्री ओपनटेलीमेट्री के माध्यम से बहती है, मूल्यांकन सेवा इसे स्कोर कर सकती है, भले ही एसडीके नीचे बैठता हो। ब्लॉग पोस्ट बताता है कि टेलीमेट्री सेवा क्या पढ़ती है, यह कैसे तय करती है कि स्पैन की व्याख्या कैसे की जाए, कौन सी विशेषताएँ मूल्यांकन डेटा ले जाती हैं, और कवरेज एडब्ल्यूएस की नामित सूची से परे फ्रेमवर्क तक कैसे विस्तारित होती है - प्रभावी रूप से फ्रेमवर्क के बजाय प्रारूप को अनुबंध बनाती है।

इंजीनियरिंग संगठनों के लिए, यह मूल्यांकन को प्रति-प्रोजेक्ट निर्माण के बजाय बुनियादी ढांचे के निर्णय में बदल देता है। जिस दिन यह शिप किया जाता है उस दिन एक एजेंट को ग्रेड किया जाता है, उसकी तुलना उसी मेट्रिक्स से की जा सकती है, चाहे उसके लेखकों ने इसे लैंगग्राफ में लिखा हो या क्लाउड एजेंट एसडीके में।

यह एजेंटकोर में कहां फिट बैठता है

मूल्यांकन व्यापक अमेज़ॅन बेडरॉक एजेंटकोर प्लेटफ़ॉर्म में स्लॉट करता है, जिसका रनटाइम पहले से ही होस्टिंग, स्केलिंग, मेमोरी और ऑब्जर्वेबिलिटी इंफ्रास्ट्रक्चर डेवलपर्स को संभालता है अन्यथा प्रत्येक प्रोजेक्ट के लिए पुनर्निर्माण करेगा। एक ही सतह पर मूल्यांकन जोड़ने के साथ, AWS एजेंटों के लिए एक पूर्ण जीवनचक्र की मात्रा को इकट्ठा कर रहा है: उन्हें रनटाइम पर तैनात करें, उन्हें अंतर्निहित अवलोकन के माध्यम से देखें, और अब उन्हें प्लेटफ़ॉर्म छोड़े बिना लगातार मानदंडों के अनुसार मापें।

समय आकस्मिक नहीं है. हगिंग फेस ब्रीच जांच में दर्ज किए गए समन्वित दुर्व्यवहार जैसे हाई-प्रोफाइल प्रकरणों और बढ़ते सबूतों के बाद कि क्या एजेंट वास्तव में इरादे के अनुसार व्यवहार करते हैं, इस बारे में सवाल अकादमिक चिंता से बोर्ड-स्तरीय जोखिम की ओर बढ़ गए हैं। टूलींग जो मूल्यांकन को निरंतर, सस्ता और ढांचा-स्वतंत्र बनाता है वह सीधे उस चिंता पर बात करता है।

यह क्यों मायने रखता है

मूल्यांकन चुपचाप उद्यम एजेंट को अपनाने में बाधा बन गया है। विकास की गति अब बाधा नहीं है - बाधा आत्मविश्वास है: यह जानना कि एजेंट ग्राहकों को जवाब दे रहा है, डेटा ले जा रहा है या वर्कफ़्लो निष्पादित कर रहा है, ऐसी परिस्थितियों में सही ढंग से काम करेगा, जिनका किसी ने व्यक्तिगत रूप से परीक्षण नहीं किया है।

किसी एकल एसडीके के बजाय ओपनटेलीमेट्री के मूल्यांकन को एंकरिंग करके, एडब्ल्यूएस यह शर्त लगा रहा है कि उद्योग की अवलोकन संबंधी सहमति इसकी गुणवत्ता-आश्वासन परत के रूप में दोगुनी हो सकती है। क्या प्रतिस्पर्धी समतुल्य फ्रेमवर्क-अज्ञेयवादी स्कोरिंग का पालन करते हैं, यह इस बारे में बहुत कुछ बताएगा कि एजेंटिक एआई डेमो से भरोसेमंद बुनियादी ढांचे में कितनी जल्दी परिपक्व होता है।

विषम बेड़े चलाने वाली टीमों के लिए, व्यावहारिक निहितार्थ तुलनीयता है। जब प्रत्येक एजेंट एक ही टेलीमेट्री प्रारूप में रिपोर्ट करता है, तो गुणवत्ता एक ऐसी चीज़ बन जाती है जिसे संगठन प्रति प्रोजेक्ट को पुनः प्राप्त करने के बजाय समय के साथ और टीमों के बीच ट्रैक कर सकता है - एजेंटिक सिस्टम में परिचालन परिपक्वता जैसी किसी भी चीज़ के लिए एक पूर्व शर्त। लैंगग्राफ-लामाइंडेक्स हाइब्रिड स्टैक में गहरे उद्यमों के लिए, या जब भी कोई बेहतर ढांचा दिखाई देता है तो उपकरण को फिर से लिखने से सावधान रहते हैं, अब उनके क्लाउड प्रदाता से एक प्रथम-पक्ष विकल्प है जो उन्हें पक्ष चुनने के लिए नहीं कहता है।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →