Amazon Web Services Amazon Bedrock AgentCore Evaluations চালু করেছে, একটি নতুন ক্ষমতা যা যেকোন বড় ফ্রেমওয়ার্কের সাথে তৈরি AI এজেন্টদের স্কোর করে — শুধু AWS-এর নিজস্ব টুলিং নয় — OpenTelemetry ট্রেসকে মূল্যায়নের জন্য একটি সার্বজনীন ইন্টারফেস হিসাবে বিবেচনা করে। ২৬শে আগস্ট স্বর্ণিম সিংগাল, ভারতী শ্রীনিবাসন এবং রেনিয়া কুজিরাদা দ্বারা প্রকাশিত একটি AWS মেশিন লার্নিং ব্লগ পোস্টে এই ঘোষণা এসেছে।

পিচটি অ্যাড্রেস করে যা AWS উত্পাদন এআই কাজের একটি হতাশাজনক অসাম্যতা বলে: এজেন্ট ফ্রেমওয়ার্কের বৈচিত্র্য বাড়তে থাকে যখন মূল্যায়ন টুলিং গতি রাখে না। বৃহত্তর AI ইন্ডাস্ট্রি নিউজ সাইকেল এর সাথে তাল মিলিয়ে চলার জন্য, দলগুলি এখন নিয়মিতভাবে মিশ্রিত এবং মেলে টুলস — যা ঠিক যেখানে ঐতিহ্যগত মূল্যায়ন পাইপলাইনগুলি আলাদা হয়ে যায়।

ফ্র্যাগমেন্টেশন সমস্যা

যেহেতু AWS টিম এটিকে ফ্রেম করে, বেশিরভাগ মূল্যায়ন সিস্টেম অনুমান করে যে আপনি আপনার এজেন্টকে একটি নির্দিষ্ট উপায়ে তৈরি করেছেন: একটি নির্দিষ্ট SDK, একটি নির্দিষ্ট বড় ভাষা মডেল ক্লায়েন্ট, একটি নির্দিষ্ট ট্রেসিং প্যাটার্ন৷ সেই সংকীর্ণ সামঞ্জস্যপূর্ণ অঞ্চলের বাইরে যান এবং মূল্যায়ন পাইপলাইন ভেঙে যায়।

বাস্তব-বিশ্বের স্ট্যাকগুলি খুব কমই এক বিক্রেতার লেনের ভিতরে থাকে। ব্লগ পোস্টের অ্যাকাউন্টে, টিমগুলি ওয়ার্কফ্লো অর্কেস্ট্রেশনের জন্য ল্যাংগ্রাফে, শক্ত পুনরুদ্ধার পাইপলাইন একীকরণের জন্য LlamaIndex-এ এবং যখন একটি সংস্থা GPT মডেলগুলিতে মানসম্মত করে তখন OpenAI এজেন্ট SDK-তে তৈরি করে৷ তারা মাল্টি-এজেন্ট সমন্বয়ের জন্য Google ADK বা স্থানীয় নৃতাত্ত্বিক ক্ষমতার জন্য ক্লদ এজেন্ট SDK ব্যবহার করে এবং তারা স্ট্র্যান্ডস এজেন্টদের কাছে পৌঁছায় যখন এর মডেল-চালিত লুপটি দিনের চেয়ে মিনিটের মধ্যে অ্যামাজন বেডরক এজেন্টকোরে একটি কার্যকরী এজেন্ট পেতে পারে।

এই ফ্রেমওয়ার্কগুলির প্রতিটি একটি এজেন্ট যা করেছে তার নিজস্ব অভ্যন্তরীণ উপস্থাপনা তৈরি করে — টুল কল, পুনরুদ্ধার, সাব-এজেন্টদের মধ্যে হ্যান্ডঅফ। ঐতিহাসিকভাবে, তাদের মূল্যায়ন মানে প্রত্যেকের জন্য যন্ত্রের পুনর্নির্মাণ করা, বা কিছু কাঠামোকে একেবারে গ্রেড করা যায় না তা স্বীকার করা।

এটি কীভাবে কাজ করে: টাইট কাপলিং ওভার টেলিমেট্রি

AgentCore Evaluations একটি ইন্টারফেস নির্বাচন করে যে কাপলিং দ্রবীভূত করার চেষ্টা করে প্রতিটি প্রধান কাঠামো ইতিমধ্যেই কথা বলে। তাদের প্রায় সকলেই OpenTelemetry সমর্থন করে, হয় স্থানীয়ভাবে বা কমিউনিটি ইন্সট্রুমেন্টেশন লাইব্রেরির মাধ্যমে — ডি ফ্যাক্টো স্ট্যান্ডার্ড যে ক্লাউড এবং অ্যাপ্লিকেশন পর্যবেক্ষণ সরঞ্জামগুলি কয়েক বছর আগে একত্রিত হয়েছিল।

যুক্তিটি সোজা: যতক্ষণ পর্যন্ত একজন এজেন্টের টেলিমেট্রি ওপেনটেলিমেট্রির মধ্য দিয়ে প্রবাহিত হয়, ততক্ষণ মূল্যায়ন পরিষেবা স্কোর করতে পারে, SDK এর নীচে যাই থাকুক না কেন। ব্লগ পোস্টটি পরিষেবাটি কী টেলিমেট্রি পড়ে, কীভাবে এটি স্প্যানগুলিকে ব্যাখ্যা করার সিদ্ধান্ত নেয়, কোন বৈশিষ্ট্যগুলি মূল্যায়নের ডেটা বহন করে এবং কীভাবে কভারেজ AWS-এর নাম তালিকার বাইরে ফ্রেমওয়ার্ক পর্যন্ত প্রসারিত হয় — কার্যকরভাবে কাঠামো তৈরি করে, ফ্রেমওয়ার্কের পরিবর্তে চুক্তির মাধ্যমে চলে৷

প্রকৌশল সংস্থাগুলির জন্য, এটি প্রতি-প্রকল্প নির্মাণের পরিবর্তে মূল্যায়নকে একটি পরিকাঠামোগত সিদ্ধান্তে পরিণত করে। একজন এজেন্ট যেদিন জাহাজে পাঠায় তাকে একই মেট্রিক্সের সাথে তুলনা করা যেতে পারে যেটির লেখকরা এটি LangGraph বা Claude Agent SDK-তে লিখেছেন।

যেখানে এটি AgentCore এ ফিট করে

বৃহত্তর অ্যামাজন বেডরক এজেন্টকোর প্ল্যাটফর্মে মূল্যায়ন স্লট, যার রানটাইম ইতিমধ্যে হোস্টিং, স্কেলিং, মেমরি এবং পর্যবেক্ষণযোগ্যতা পরিকাঠামো বিকাশকারীরা পরিচালনা করে অন্যথায় প্রতিটি প্রকল্পের জন্য পুনর্নির্মাণ করবে। একই পৃষ্ঠে মূল্যায়ন যোগ করার সাথে সাথে, AWS এজেন্টদের জন্য একটি সম্পূর্ণ জীবনচক্রের পরিমাণ একত্রিত করছে: রানটাইমে তাদের স্থাপন করুন, অন্তর্নির্মিত পর্যবেক্ষণের মাধ্যমে তাদের দেখুন এবং এখন প্ল্যাটফর্ম ছেড়ে না গিয়ে সামঞ্জস্যপূর্ণ মানদণ্ডের সাথে তাদের পরিমাপ করুন।

টাইমিং আনুষঙ্গিক নয়। শিল্প জুড়ে, এজেন্টরা আসলেই উদ্দেশ্য অনুযায়ী আচরণ করে কিনা সে বিষয়ে প্রশ্নগুলি একাডেমিক উদ্বেগ থেকে বোর্ড-স্তরের ঝুঁকিতে চলে গেছে, হাই-প্রোফাইল পর্বগুলি অনুসরণ করে যেমন Hugging Face লঙ্ঘনের তদন্তে নথিভুক্ত সমন্বিত দুর্ব্যবহার এবং ক্রমবর্ধমান প্রমাণ যে বেঞ্চমার্ক একা এজেন্ট নির্ভরযোগ্যতার একটি অসম্পূর্ণ ছবি আঁকে। টুলিং যা মূল্যায়নকে ক্রমাগত, সস্তা এবং কাঠামো-স্বাধীন করে তোলে সেই উদ্বেগের সাথে সরাসরি কথা বলে।

কেন এটা গুরুত্বপূর্ণ

মূল্যায়ন শান্তভাবে এন্টারপ্রাইজ এজেন্ট গ্রহণের বাধা হয়ে দাঁড়িয়েছে। বিকাশের বেগ আর সীমাবদ্ধতা নয় - সীমাবদ্ধতা হল আত্মবিশ্বাস: জেনে রাখা এজেন্ট গ্রাহকদের উত্তর দিচ্ছে, ডেটা সরানো বা কার্যপ্রবাহ কার্যকর করবে এমন পরিস্থিতিতে কেউই পৃথকভাবে পরীক্ষা করেনি।

কোনো একক SDK-এর পরিবর্তে OpenTelemetry-এ মূল্যায়ন অ্যাঙ্করিং করে, AWS বাজি ধরছে যে শিল্পের পর্যবেক্ষণযোগ্যতা সম্মতি তার গুণমান-নিশ্চয়তার স্তর হিসাবে দ্বিগুণ হতে পারে। প্রতিযোগীরা সমতুল্য কাঠামো-অজ্ঞেয়বাদী স্কোরিং অনুসরণ করে কিনা তা ডেমো থেকে নির্ভরযোগ্য পরিকাঠামোতে কত দ্রুত এজেন্টিক এআই পরিপক্ক হয় সে সম্পর্কে অনেক কিছু বলবে।

ভিন্ন ভিন্ন ফ্লিট চালানো দলগুলির জন্য, ব্যবহারিক প্রভাব হল তুলনাযোগ্যতা। যখন প্রতিটি এজেন্ট একই টেলিমেট্রি ফরম্যাটে রিপোর্ট করে, তখন গুণমান এমন কিছু হয়ে ওঠে যা একটি সংস্থা সময়ের সাথে এবং দলগুলি জুড়ে ট্র্যাক করতে পারে প্রতি প্রকল্প প্রতি পুনঃপ্রাপ্তির পরিবর্তে - এজেন্টিক সিস্টেমে কর্মক্ষম পরিপক্কতার অনুরূপ যেকোনো কিছুর জন্য একটি পূর্বশর্ত। LangGraph-LlamaIndex হাইব্রিড স্ট্যাকের গভীরে থাকা এন্টারপ্রাইজগুলির জন্য, অথবা যখনই একটি ভাল ফ্রেমওয়ার্ক উপস্থিত হয় তখনই কেবল ইন্সট্রুমেন্টেশন পুনর্লিখন থেকে সাবধান, তাদের ক্লাউড প্রদানকারীর কাছ থেকে এখন একটি প্রথম-পক্ষের বিকল্প রয়েছে যা তাদের পক্ষ বেছে নিতে বলে না।

---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →