Nvidia গবেষকরা একটি এজেন্ট সিস্টেম তৈরি করেছেন যা Anthropic-এর Claude Opus 5-কে ARC-AGI-3-এ একটি নিখুঁত 100% স্কোরে ঠেলে দিয়েছে, যা AI-তে সবচেয়ে বেশি চাহিদাপূর্ণ ইন্টারেক্টিভ রিজনিং বেঞ্চমার্কগুলির মধ্যে একটি — একই মডেল ব্যবহার করে যা 30% স্কোর করে যখন এটি নিজে থেকে চলে। এনভিডিয়া টেকনিক্যাল ব্লগে শুক্রবার প্রকাশিত ফলাফলটি এখনও সবচেয়ে শক্তিশালী প্রমাণ যে একটি সীমান্ত মডেলের চারপাশে মোড়ানো সফ্টওয়্যারটি মডেলের মতোই গুরুত্বপূর্ণ। যে কেউ ট্র্যাক করছে সর্বশেষ AI ডেভেলপমেন্ট, এটি একটি পরিবর্তন চিহ্নিত করে যেখানে এজেন্টিক AI-তে প্রতিযোগিতামূলক সুবিধা আসলেই বেঁচে থাকে।

সিস্টেমটিকে AVO বলা হয়, এজেন্টিক ভ্যারিয়েশন অপারেটরদের জন্য সংক্ষিপ্ত, এবং এটি দীর্ঘ-দিগন্তের স্বায়ত্তশাসিত এজেন্টদের জন্য এনভিডিয়ার একটি সাধারণ-উদ্দেশ্যের আর্কিটেকচার - AI যা একটি একক প্রম্পটের উত্তর দেওয়ার পরিবর্তে ঘন্টা বা দিন ধরে কাজ করতে পারে। ARC-AGI-3 পাবলিক সেটে, AVO সমস্ত 25টি গেম পরিবেশে একটি 100.00 RHAE স্কোর রেকর্ড করেছে, ক্লাউড ওপাস 5 এর ব্যাকএন্ড মডেল হিসাবে ব্যবহার করে 6,624 এনভায়রনমেন্ট অ্যাকশনে সমস্ত 183টি স্তর সম্পূর্ণ করেছে।

ARC-AGI-3 আসলে কি পরীক্ষা করে

ARC-AGI-3 হল একটি ইন্টারেক্টিভ রিজনিং বেঞ্চমার্ক যা ARC প্রাইজ ফাউন্ডেশন দ্বারা তৈরি করা হয়েছে। একজন এজেন্টকে অপরিচিত, খেলার মতো পরিবেশে ফেলে দেওয়া হয় যার কোনো নির্দেশনা, কোনো বিবৃত নিয়ম বা কোনো লক্ষ্য নেই। এটিকে ট্রায়াল এবং ত্রুটির মাধ্যমে অন্বেষণ করতে হবে, পরিবেশ কীভাবে কাজ করে তা অনুমান করতে হবে, "জয়" এর অর্থ কী তা নির্ধারণ করতে হবে এবং তারপরে ধীরে ধীরে কঠিন স্তরের মধ্য দিয়ে অগ্রগতির জন্য যথেষ্ট দক্ষতার সাথে কাজ করতে হবে।

বেঞ্চমার্কের স্কোরিং মেট্রিক, রিলেটিভ হিউম্যান অ্যাকশন এফিসিয়েন্সি (RHAE), প্রথমবারের মানব খেলোয়াড়দের তুলনায় এজেন্ট কত কম অ্যাকশন নষ্ট করে তার সাথে টাস্ক কমপ্লিশনকে একত্রিত করে। এটি এটিকে টেকসই স্বায়ত্তশাসনের একটি নৃশংস পরীক্ষা করে তোলে: এজেন্টকে অবশ্যই মনে রাখতে হবে যে এটি কী শিখেছে, ভুলগুলি থেকে পুনরুদ্ধার করতে হবে এবং পুরো রান জুড়ে সতর্কতার সাথে তার ক্রিয়াকলাপগুলিকে বাজেট করতে হবে।

এনভিডিয়ার শিরোনাম নম্বর একটি তুলনা থেকে প্রসঙ্গ লাভ করে। VISTA, একটি পূর্ববর্তী সরাসরি-ইন্টার্যাকশন জোতা যা Claude Opus 5 ব্যবহার করেছিল, 7,542টি পরিবেশ ক্রিয়ায় একই 183টি পাবলিক-সেট স্তর সম্পন্ন করেছে। এনভিডিয়ার ব্লগ পোস্ট অনুসারে কাজটি শেষ করতে AVO-এর প্রায় 12% কম অ্যাকশন প্রয়োজন।

জিপিইউ কার্নেল থেকে অজানা গেম পর্যন্ত

AVO ধাঁধার জন্য নির্মিত হয়নি। এনভিডিয়া প্রথম GPU-কার্নেল অপ্টিমাইজেশানে আর্কিটেকচার প্রদর্শন করেছে, একটি ডোমেন যেখানে ছোট কোড পরিবর্তনগুলি সঠিকতা, মেমরি আচরণ এবং অপ্রত্যাশিত উপায়ে থ্রুপুট ভেঙে দিতে পারে। একটি মনোযোগ-কার্ণেল গবেষণায়, AVO ক্রমাগত সাত দিন ধরে দৌড়েছে, 500 টিরও বেশি অপ্টিমাইজেশান দিকনির্দেশ অন্বেষণ করেছে এবং 40টি কার্নেল সংস্করণের প্রতিশ্রুতি দিয়েছে। NVIDIA DGX B200 সিস্টেমে, ফলে মাল্টিহেড অ্যাটেনশন কার্নেল cuDNN কে 3.5% পর্যন্ত এবং FlashAttention-4 10.5% পর্যন্ত ছাড়িয়ে গেছে। তখন এজেন্ট তার বিকশিত কার্নেলকে 30 মিনিটের অতিরিক্ত স্বায়ত্তশাসিত কাজের মধ্যে দলবদ্ধ-কোয়েরি মনোযোগের জন্য অভিযোজিত করে।

একই মূল লুপ — পরিদর্শন, পরিকল্পনা, বাস্তবায়ন, পরীক্ষা, মূল্যায়ন — তারপর শুধুমাত্র টাস্ক ইন্টারফেস পরিবর্তন করে ARC-AGI-3-এ নির্দেশ করা হয়েছিল। দুই মেকানিজম বাহিত. প্রথমটি হল ক্রমাগত মেমরি, যা পূর্বের বাস্তবায়ন, মূল্যায়ন ফলাফল, কম্পাইলার এবং প্রোফাইলার আউটপুট এবং জমা যুক্তি সংরক্ষণ করে, তাই এজেন্ট স্ক্র্যাচ থেকে প্রসঙ্গ পুনর্নির্মাণের পরিবর্তে তার বর্তমান অবস্থা থেকে পুনরায় শুরু করতে পারে। দ্বিতীয়টি হল একজন সুপারভাইজার, একজন দ্বিতীয় এজেন্ট যে সামগ্রিক গতিপথ পর্যবেক্ষণ করে এবং যখন অগ্রগতি থেমে যায় তখন হস্তক্ষেপ করে।

সুপারভাইজার হল ব্রেকথ্রু

টেকক্রাঞ্চ, যেটি কোম্পানির এআই ইউনিটের প্রোডাক্টের ভাইস প্রেসিডেন্ট এনভিডিয়ার অ্যাডেল এল হাল্লাকের সাক্ষাৎকার নিয়েছে, সুপারভাইজারকে সবচেয়ে গুরুত্বপূর্ণ উপাদান হিসেবে তুলে ধরেছে। "এটি প্রায় একজন সিইও-এর মতো কাজ করে যখন এজেন্ট দিক থেকে সরে যায় বা এমন একটি পথ অন্বেষণ করতে শুরু করে যা একটি শেষ পরিণতির দিকে নিয়ে যেতে পারে, বা এটি আগে যে পথটি পাড়ি দিয়েছিল তা পুনরায় অন্বেষণ করতে পারে," এল হলাক প্রকাশনাকে বলেছেন।

পারফরম্যান্সের ব্যবধান প্রকট। এনভিডিয়ার পরীক্ষায় দেখা গেছে যে ক্লাউড ওপাস 5 একটি অত্যাধুনিক জোতা ছাড়াই ARC-AGI-3-এ 30% স্কোর পরিচালনা করেছে — পরীক্ষিত নগ্ন মডেলগুলির মধ্যে সেরা ফলাফল, কিন্তু সম্পূর্ণ রানের কাছাকাছি কোথাও নেই। OpenAI এর মডেলগুলি বেঞ্চমার্কে 10% এর নিচে স্কোর করেছে, এবং কোম্পানিটি গত মাসে তার নিজস্ব গবেষণা প্রকাশ করেছে যে দেখায় যে শুধুমাত্র দুটি জোতা সেটিংস টুইক করা তার স্কোর তিনগুণ করেছে। কোনো মডেল-শুধু কনফিগারেশন 100% এর কাছাকাছি আসেনি যা AVO অর্জন করেছে।

উল্লেখযোগ্যভাবে, AVO কনফিগারেশনটি একটি পাঠ্য-শুধুমাত্র পদ্ধতিতে চলে: প্রতিটি পর্যবেক্ষণ একটি সঠিক 64x64 পাঠ্য গ্রিড হিসাবে সরবরাহ করা হয়েছিল, মডেলটিতে কোনও চিত্র বা চিত্র টোকেন পাঠানো হয়নি। যুক্তি শক্তি মডেলের চারপাশে লুপ থেকে এসেছে, মাল্টিমডাল উপলব্ধি থেকে নয়।

কেন শিল্প harnesses উপর বাজি হয়

এজেন্ট অবকাঠামো, কাঁচা মডেলের ক্ষমতা নয়, স্বায়ত্তশাসিত এআই-এর জন্য বর্তমান বাধা। ডেটাব্রিক্স জুলাই মাসে বেঞ্চমার্কিং গবেষণা প্রকাশ করেছে যে দেখায় যে জোতা নাটকীয়ভাবে কর্মক্ষমতা এবং খরচ উভয়কেই প্রভাবিত করে। "আপনি একই মডেল বাছাই করতে পারেন কিন্তু ভিন্ন হারনেস, এবং আপনি যদি ভুল জোতা ব্যবহার করেন তবে আপনি উল্লেখযোগ্যভাবে বেশি খরচ পাবেন," Databricks CEO আলী ঘোডসি টেকক্রাঞ্চকে বলেছেন। "এটি নিজেই আপনার খরচ 2 গুণ করতে পারে।"

এল হলাক খোলামেলাতার পরিপ্রেক্ষিতে এনভিডিয়ার বিস্তৃত যুক্তি তৈরি করেছেন। "আমরা একটি ওপেন এজেন্ট স্ট্যাক থাকাতে বিশ্বাস করি - যেখানে আপনার নিয়ন্ত্রণ রয়েছে জোতা জুড়ে, অবকাঠামো জুড়ে, রানটাইম জুড়ে - আমাদের জন্য ইকোসিস্টেমকে এগিয়ে এবং নিরাপদে নিয়ে যাওয়ার জন্য যা প্রয়োজন," তিনি বলেছিলেন। Nvidia এর NeMo ব্র্যান্ডের অধীনে খোলা আকারের জোতা প্রযুক্তির টুকরা রয়েছে এবং AVO গবেষণাটি arXiv-এর একটি গবেষণাপত্রে নথিভুক্ত করা হয়েছে।

একটি ইতিহাস সহ একটি বেঞ্চমার্ক

ARC-AGI-3 ফ্রন্টিয়ার-ল্যাব প্রতিদ্বন্দ্বিতায় একটি ফ্ল্যাশপয়েন্ট হয়ে উঠেছে। OpenAI পূর্বে বেঞ্চমার্কে তার GPT-5.6 Sol মডেলের জন্য শক্তিশালী ফলাফল দাবি করেছে, ব্যবহৃত মূল্যায়ন সেটিংসের উপর যাচাই-বাছাই করে। এনভিডিয়ার ফলাফল এক অর্থে বিতর্ককে পাশ কাটিয়ে দেয় — এটি একটি স্মার্ট মডেল দাবি করে না, শুধুমাত্র একটি বিদ্যমান মডেলের চারপাশে একটি ভাল-ইঞ্জিনিয়ারড এজেন্ট।

এজেন্টিক পণ্য তৈরির ডেভেলপার এবং এন্টারপ্রাইজগুলির জন্য বার্তাটি সরাসরি: মডেল নির্বাচন এখনও গুরুত্বপূর্ণ, কিন্তু সিস্টেম ডিজাইন এখন সিদ্ধান্ত নেয় যে একটি সীমান্ত মডেল সীমান্ত ফলাফল প্রদান করে কিনা। এনভিডিয়া যেমন বলেছে, একটি মডেলের মূল্যায়ন করা একজন এজেন্টকে মূল্যায়ন করার মতো নয় — এবং 2026-এর বেঞ্চমার্ক টেবিলগুলি ক্রমবর্ধমানভাবে পুরস্কৃত করছে ইঞ্জিনিয়ারদের যারা ভারা তৈরি করে।

এআই থেকে এগিয়ে থাকুন

এজেন্ট আর্কিটেকচার আগের চেয়ে দ্রুত এগিয়ে চলেছে, এবং একটি ভাল জোতা এবং একটি খারাপের মধ্যে ব্যবধান এখন বেঞ্চমার্ক পয়েন্ট এবং আসল ডলারে পরিমাপ করা হয়। এআই বাজ ওয়্যার অনুসরণ করুন এআই গবেষণা, বেঞ্চমার্ক এবং পণ্য লঞ্চের দৈনিক, উৎস-যাচাইকৃত কভারেজের জন্য।

আরও এআই গবেষণার খবর পড়ুন →