Amazon Web Services نے Amazon Bedrock AgentCore Evaluations کا آغاز کیا ہے، ایک نئی صلاحیت جو کسی بھی بڑے فریم ورک کے ساتھ بنائے گئے AI ایجنٹوں کو اسکور کرتی ہے - نہ صرف AWS کی اپنی ٹولنگ - تشخیص کے لیے OpenTelemetry ٹریس کو یونیورسل انٹرفیس کے طور پر دیکھ کر۔ یہ اعلان AWS مشین لرننگ بلاگ پوسٹ میں آیا جو 26 اگست کو سوارنیم سنگھل، بھارتی سری نواسن اور رینیا کجیراڈا کے ذریعہ شائع ہوا۔
پچ اس بات کی نشاندہی کرتی ہے جسے AWS پروڈکشن AI کے کام میں مایوس کن عدم توازن کا نام دیتا ہے: ایجنٹ کے فریم ورک کا تنوع بڑھتا رہتا ہے جبکہ تشخیصی ٹولنگ نے رفتار برقرار نہیں رکھی ہے۔ وسیع تر AI انڈسٹری نیوز سائیکل کو برقرار رکھنے کے لیے، ٹیمیں اب معمول کے مطابق ٹولز کو مکس اور میچ کرتی ہیں — جو بالکل وہی جگہ ہے جہاں روایتی تشخیصی پائپ لائنیں الگ ہوجاتی ہیں۔
ٹکڑے ٹکڑے کرنے کا مسئلہ
جیسا کہ AWS ٹیم اسے فریم کرتی ہے، زیادہ تر تشخیصی نظام فرض کرتے ہیں کہ آپ نے اپنے ایجنٹ کو ایک مخصوص طریقے سے بنایا ہے: ایک مخصوص SDK، ایک مخصوص بڑی زبان کا ماڈل کلائنٹ، ایک مخصوص ٹریسنگ پیٹرن۔ اس تنگ مطابقت والے زون سے باہر نکلیں اور تشخیصی پائپ لائن ٹوٹ جاتی ہے۔
حقیقی دنیا کے اسٹیک شاذ و نادر ہی ایک وینڈر کی لین کے اندر رہتے ہیں۔ بلاگ پوسٹ کے اکاؤنٹ میں، ٹیمیں ورک فلو آرکیسٹریشن کے لیے LangGraph پر، سخت بازیافت پائپ لائن انضمام کے لیے LlamaIndex پر، اور OpenAI ایجنٹس SDK پر جب کوئی تنظیم GPT ماڈلز کو معیاری بناتی ہے۔ وہ ملٹی ایجنٹ کوآرڈینیشن کے لیے Google ADK یا مقامی اینتھروپک صلاحیت کے لیے Claude Agent SDK کا استعمال کرتے ہیں، اور وہ Strands ایجنٹوں تک پہنچ جاتے ہیں جب اس کے ماڈل سے چلنے والے لوپ کو Amazon Bedrock AgentCore پر دنوں کے بجائے منٹوں میں کام کرنے والا ایجنٹ مل سکتا ہے۔
ان میں سے ہر ایک فریم ورک اس کی اپنی اندرونی نمائندگی پیدا کرتا ہے جو ایک ایجنٹ نے کیا — ٹول کالز، بازیافت، ذیلی ایجنٹوں کے درمیان ہینڈ آف۔ تاریخی طور پر، ان کا جائزہ لینے کا مطلب ہے ہر ایک کے لیے آلات کی تعمیر نو، یا یہ قبول کرنا کہ کچھ فریم ورک کو بالکل بھی درجہ بندی نہیں کیا جا سکتا۔
یہ کیسے کام کرتا ہے: ٹیلی میٹری اوور ٹائٹ کپلنگ
AgentCore Evaluations ہر بڑے فریم ورک کے پہلے سے بولتے ہوئے انٹرفیس کا انتخاب کرکے اس جوڑے کو تحلیل کرنے کی کوشش کرتا ہے۔ ان میں سے تقریباً سبھی OpenTelemetry کو سپورٹ کرتے ہیں، یا تو مقامی طور پر یا کمیونٹی انسٹرومینٹیشن لائبریریوں کے ذریعے - ڈی فیکٹو اسٹینڈرڈ جو کہ کلاؤڈ اور ایپلیکیشن آبزرویبلٹی ٹولز برسوں پہلے ایک دوسرے سے مل گئے تھے۔
منطق سیدھی سی ہے: جب تک کسی ایجنٹ کی ٹیلی میٹری OpenTelemetry سے گزرتی ہے، تشخیصی سروس اسے اسکور کر سکتی ہے، قطع نظر اس کے کہ SDK نیچے کیا ہے۔ بلاگ پوسٹ اس بات پر چلتی ہے کہ سروس کس ٹیلی میٹری کو پڑھتی ہے، یہ کیسے فیصلہ کرتی ہے کہ اسپین کی تشریح کیسے کی جائے، کون سے اوصاف تشخیصی ڈیٹا کو لے کر جاتے ہیں، اور کس طرح کوریج AWS کی نامزد فہرست سے باہر فریم ورک تک پھیلتی ہے — مؤثر طریقے سے فارمیٹ بنانے کے بجائے، فریم ورک، معاہدے کی بجائے۔
انجینئرنگ تنظیموں کے لیے، یہ تشخیص کو فی پراجیکٹ کی تعمیر کے بجائے بنیادی ڈھانچے کے فیصلے میں بدل دیتا ہے۔ ایک ایجنٹ جس دن اسے بھیجتا ہے اس کا موازنہ اسی میٹرکس سے کیا جا سکتا ہے چاہے اس کے مصنفین نے اسے LangGraph میں لکھا ہو یا Claude Agent SDK میں۔
جہاں یہ ایجنٹ کور میں فٹ بیٹھتا ہے۔
وسیع تر Amazon Bedrock AgentCore پلیٹ فارم میں تشخیص کی سلاٹ، جس کا رن ٹائم پہلے سے ہی ہوسٹنگ، اسکیلنگ، میموری اور آبزرویبلٹی انفراسٹرکچر ڈویلپرز کو سنبھالتا ہے بصورت دیگر ہر پروجیکٹ کے لیے دوبارہ تعمیر کریں گے۔ اسی سطح پر تشخیص کو شامل کرنے کے ساتھ، AWS ایجنٹوں کے لیے ایک مکمل لائف سائیکل کی مقدار کو جمع کر رہا ہے: انہیں رن ٹائم پر تعینات کریں، انہیں بلٹ ان آبزرویبلٹی کے ذریعے دیکھیں، اور اب پلیٹ فارم کو چھوڑے بغیر مستقل معیار کے مطابق ان کی پیمائش کریں۔
وقت حادثاتی نہیں ہے۔ پوری صنعت میں، اس بارے میں سوالات کہ آیا ایجنٹ حقیقت میں ارادے کے مطابق برتاؤ کرتے ہیں، تعلیمی تشویش سے بورڈ کی سطح کے خطرے کی طرف منتقل ہو گئے ہیں، ہائی پروفائل اقساط جیسے کہ Hugging Face کی خلاف ورزی کی تحقیقات میں دستاویزی مربوط غلط برتاؤ اور بڑھتے ہوئے شواہد کے بعد کہ بینچ مارکس ہی ایجنٹ کی وشوسنییتا کی ایک نامکمل تصویر پینٹ کرتے ہیں۔ ٹولنگ جو تشخیص کو مسلسل، سستا اور فریم ورک سے آزاد بناتی ہے وہ براہ راست اس اضطراب پر بات کرتی ہے۔
یہ کیوں اہمیت رکھتا ہے۔
تشخیص خاموشی سے انٹرپرائز ایجنٹ کو اپنانے کی رکاوٹ بن گیا ہے۔ ترقی کی رفتار اب کوئی رکاوٹ نہیں ہے - رکاوٹ اعتماد ہے: یہ جانتے ہوئے کہ ایجنٹ صارفین کو جواب دینے، ڈیٹا کو منتقل کرنے یا ورک فلو کو انجام دینے والے ایسے حالات میں صحیح طریقے سے کام کرے گا جن کا انفرادی طور پر تجربہ نہیں کیا گیا ہے۔
کسی ایک SDK کے بجائے OpenTelemetry پر تشخیص کو اینکر کرنے سے، AWS شرط لگا رہا ہے کہ صنعت کا مشاہداتی اتفاق رائے اس کی کوالٹی ایشورنس پرت کے طور پر دوگنا ہو سکتا ہے۔ آیا حریف مساوی فریم ورک-ایگنوسٹک اسکورنگ کے ساتھ پیروی کرتے ہیں اس بارے میں بہت کچھ بتائے گا کہ ایجنٹ AI ڈیمو سے قابل اعتماد انفراسٹرکچر میں کتنی جلدی پختہ ہوتا ہے۔
متضاد بیڑے چلانے والی ٹیموں کے لیے، عملی مضمرات موازنہ ہے۔ جب ہر ایجنٹ ایک ہی ٹیلی میٹری فارمیٹ میں رپورٹ کرتا ہے، تو معیار ایک ایسی چیز بن جاتا ہے جو ایک تنظیم وقت کے ساتھ ساتھ اور ٹیموں میں ہر پروجیکٹ کو دوبارہ حاصل کرنے کے بجائے ٹریک کر سکتی ہے - ایجنٹی نظام میں آپریشنل پختگی سے مشابہت رکھنے والی کسی بھی چیز کے لیے پیشگی شرط۔ LangGraph-LlamaIndex ہائبرڈ اسٹیک میں گہرے کاروباری اداروں کے لیے، یا جب بھی کوئی بہتر فریم ورک ظاہر ہوتا ہے تو صرف انسٹرومینٹیشن کو دوبارہ لکھنے سے ہوشیار رہیں، اب ان کے کلاؤڈ فراہم کنندہ کی طرف سے فرسٹ پارٹی آپشن موجود ہے جو ان سے اطراف کا انتخاب کرنے کو نہیں کہتا ہے۔
---
AI سے آگے رہیںتازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →