OpenAI এর GPT-6 Astra কোডিং ফ্রন্টে ব্যবহারকারী-বিশ্বাসের সমস্যাগুলির সাথে লড়াই করতে পারে, কিন্তু একটি নতুন রোবোটিক্স বেঞ্চমার্কে এটি এমন নম্বর পোস্ট করছে যেখানে গবেষকরা একটি গুণগত লিপের কথা বলছেন। StationeryBench-এ, সাধারণ ডেস্ক অবজেক্টের চারপাশে নির্মিত একটি পরীক্ষা, Astra 100টি কাজের মধ্যে 7টি সম্পূর্ণভাবে সম্পন্ন করেছে যখন Ai2-এর MolmoAct2, মডেলটি শূন্য সম্পন্ন করেছে।

দ্য ডিকোডার দ্বারা বর্ণিত বেঞ্চমার্ক, পাঁচটি ডেস্ক-অবজেক্ট টাস্ক জুড়ে দুটি মডেলকে একে অপরের বিরুদ্ধে দাঁড় করিয়ে দেয় — একটি মার্কার আনক্যাপ করা, কাগজের ক্লিপগুলি ঢেলে দেওয়া, বা দুটি রোবট অস্ত্রের মধ্যে একটি শাসক পাস করা। উভয় মডেলই 200টি ট্রায়াল জুড়ে একই ডুয়াল-আর্ম YAM রোবট নিয়ন্ত্রণ করেছে, একটি কন্ট্রোল ডিজাইন যা হার্ডওয়্যার পার্থক্য থেকে মডেলের ক্ষমতাকে বিচ্ছিন্ন করে। সমস্ত ফলাফল, ভিডিও এবং কোড GitHub এ প্রকাশিত হয়েছে। এই ধরনের আরও গবেষণা কভারেজের জন্য, আমাদের AI নিউজ হাব দেখুন।

একটি 'পদক্ষেপ পরিবর্তন,' গবেষকদের মতে

কর্নেল এবং গুগল ডিপমাইন্ডের একজন এআই গবেষক, ইয়োভ আর্টিজি, অ্যাস্ট্রার পারফরম্যান্সকে "স্থানিক যুক্তিতে একটি ধাপে পরিবর্তন" বলে অভিহিত করেছেন — ভাষার বেঞ্চমার্কের ফলাফল খুব কমই উপার্জন করে। REMAP নামক একটি এখনও-অপ্রকাশিত বেঞ্চমার্কে, অ্যাস্ট্রা মানুষের স্তরের কাছাকাছি নির্ভুলতা পৌঁছেছে, যদিও আর্টিজি উল্লেখ করেছেন যে "এমনকি অ্যাস্ট্রাও অন্যান্য পরিস্থিতিতে মানুষ যা করে তা পায় না।"

Astra-এর মধ্যম অগ্রগতি স্কোর 100-এর মধ্যে 46-এ আঘাত করেছে, MolmoAct2-এর জন্য 12-এর তুলনায় - একটি ব্যবধান যা শিরোনাম সমাপ্তির সংখ্যার চেয়ে বেশি গুরুত্বপূর্ণ। রোবোটিক্সের কাজগুলি আংশিক অগ্রগতির পাশাপাশি পূর্ণ সাফল্যের উপর শ্রেণীবদ্ধ করা হয় এবং প্রতিদ্বন্দ্বীর মধ্যম স্কোরকে তিনগুণ করা ইঙ্গিত দেয় যে মডেলটি কিছু কিছু পরীক্ষায় ভাগ্যের দ্বারা সফল হওয়ার পরিবর্তে ম্যানিপুলেশন সিকোয়েন্সের মাধ্যমে ধারাবাহিকভাবে এগিয়ে যাচ্ছে।

কেন স্থানিক যুক্তি হঠাৎ গুরুত্বপূর্ণ

ফলাফল কিভাবে Astra প্রশিক্ষিত ছিল ইঙ্গিত. আর্টিজি সন্দেহ করে যে ওপেনএআই মডেলটিকে প্রচুর পরিমাণে 3D ডেটার উপর প্রশিক্ষণ দিয়েছে, যেমন ব্লেন্ডার দৃশ্য, যা 3D কাজের ক্ষেত্রে মডেলের বিশেষ শক্তির সাথে সামঞ্জস্যপূর্ণ হবে। যদি সেই পড়া সঠিক হয়, তাহলে এটি সিন্থেটিক 3D পরিবেশের পরামর্শ দেয় - বাস্তব-বিশ্বের ডেটা সংগ্রহের চেয়ে সস্তা এবং নিরাপদ - শারীরিক-বিশ্বের দক্ষতার জন্য একটি কার্যকর পথ হয়ে উঠছে, যা রোবোটিক্সের সবচেয়ে দীর্ঘস্থায়ী বাধাগুলির মধ্যে একটি।

বেঞ্চমার্কের নকশাও রোবোটিক্স মূল্যায়ন কোথায় যাচ্ছে সে সম্পর্কে কিছু বলে। StationeryBench-এর কাজগুলি ইচ্ছাকৃতভাবে জাগতিক — একটি মার্কার খুলে দেওয়া, কাগজের ক্লিপগুলি ঢেলে দেওয়া, একজন শাসককে হস্তান্তর করা — কারণ দৈনন্দিন ম্যানিপুলেশন, সিনেমাটিক কৃতিত্ব নয়, ল্যাব ডেমোগুলিকে দরকারী মেশিনগুলি থেকে আলাদা করে৷ 200টি ট্রায়াল জুড়ে একই ডুয়াল-আর্ম YAM হার্ডওয়্যারে উভয় মডেলকে গ্রেড করা এবং প্রতিটি ভিডিও প্রকাশ করা, একটি সীমান্ত ল্যাবের ফ্ল্যাগশিপ জড়িত একটি সক্ষমতা দাবির জন্য একটি অস্বাভাবিকভাবে স্বচ্ছ সেটআপ।

MolmoAct2, AI (Ai2) এর জন্য অ্যালেন ইনস্টিটিউটের তুলনামূলক মডেল, কোনও কাজই সম্পূর্ণ না করা তার নিজস্ব ধরণের ডেটাম: এটি প্রস্তাব করে যে সাধারণ-উদ্দেশ্য ফ্রন্টিয়ার মডেল এবং উদ্দেশ্য-নির্মিত রোবোটিক্স মডেলগুলির মধ্যে ব্যবধান এখন আর বন্ধ হচ্ছে না বরং উল্টে যাচ্ছে, অন্তত যুক্তি-প্রধান ম্যানিপুলেশনের উপর।

এটি OpenAI এর বিবৃত উচ্চাকাঙ্ক্ষার সাথেও খাপ খায়: কোম্পানির নিজস্ব ভোক্তা রোবট তৈরি করার দীর্ঘমেয়াদী পরিকল্পনা রয়েছে, দ্য ডিকোডার দ্বারা উদ্ধৃত প্রতিবেদন অনুসারে। একটি ফ্রন্টিয়ার ল্যাঙ্গুয়েজ মডেল যা বস্তু, হাত এবং ট্র্যাজেক্টোরিজ সম্পর্কে যুক্তি দিতে পারে সেই পিচের অর্ধেক সফ্টওয়্যার। হার্ডওয়্যার অর্ধেক অমীমাংসিত রয়ে গেছে, কিন্তু StationeryBench-এর মতো বেঞ্চমার্কগুলি কীভাবে সেই গল্পটি পরিমাপ করা হয়।

প্রসঙ্গ: একটি জটিল সপ্তাহ সহ একটি মডেল

ফলাফল ওপেনএআই-এর জন্য একটি অদ্ভুত সংবাদ চক্রের মধ্যে পড়ে। এই বেঞ্চমার্কের কেন্দ্রে অবস্থিত একই মডেলটি ব্যবহারকারীর অভিযোগের মুখোমুখি হয়ে সপ্তাহ কাটিয়েছে যে এটি লঞ্চের পর থেকে অপ্রস্তুত হয়েছে — অভিযোগ ওপেনএআই কোডেক্স ব্যবহারের সীমা রিসেট করার আগে, ভুল দক্ষতা থেকে অসদাচরণমূলক প্রসঙ্গ পরীক্ষা পর্যন্ত তিনটি নামযুক্ত ত্রুটির সন্ধান করেছে। একটি মডেল যা ল্যাবে ধাপে-পরিবর্তনের ফলাফল পোস্ট করার সময় উত্পাদনে হোঁচট খায় তা বর্তমান AI শিল্পের একটি সূক্ষ্মতা: সক্ষমতা এবং নির্ভরযোগ্যতা বিভিন্ন ঘড়িতে অগ্রসর হচ্ছে।

এটি একটি নিরাপত্তা বিতর্কের মধ্যেও অবতরণ করে যেখানে OpenAI এর নিজস্ব নেতৃত্ব যোগ দিয়েছিল। কোম্পানির প্রধান বিজ্ঞানী সতর্ক করেছেন যে কোনও ল্যাবই ক্রমবর্ধমান স্বায়ত্তশাসিত সিস্টেমের নিয়ন্ত্রণের সমাধান করেনি, এবং অ্যানথ্রপিকের সিইও শিল্পটিকে সম্পূর্ণভাবে সীমান্ত উন্নয়নকে ধীর করার আহ্বান জানিয়েছেন। ভৌত জগতের কারসাজি করে এমন মডেলগুলি দেখানোর মানদণ্ড - এমনকি যদি বিশ্বটি কেবল স্টেশনারির মধ্যে আচ্ছাদিত একটি ডেস্ক হয় - ঠিক সেই ধরনের ফলাফল যা উভয় নির্বাহীই উদ্ধৃত করেন যখন তারা যুক্তি দেন যে অগ্রগতির গতি তত্ত্বাবধানকে ছাড়িয়ে যাচ্ছে।

নীচের লাইন

100টির মধ্যে সাতটি সম্পূর্ণভাবে সম্পন্ন করা কাজ আগামীকাল আপনার ডেস্কে একটি রোবট রাখবে না। কিন্তু প্রতিদ্বন্দ্বীর শূন্য থেকে সাতে যাওয়া, মধ্যম অগ্রগতি স্কোর তিনগুণ বেশি, দুই বছর আগে ভাষা বোঝার ক্ষমতার চার্টকে পুনরায় তৈরি করা এক ধরনের বিচ্ছিন্নতা। খোলা প্রশ্ন হল একই মডেল নির্ভরযোগ্যভাবে সেই দক্ষতা প্রদান করতে পারে কিনা, বেঞ্চমার্কের বাইরে, একটি মূল্যে বিকাশকারীরা দিতে ইচ্ছুক।

এআই থেকে এগিয়ে থাকুন

মানদণ্ড, সাফল্য এবং যন্ত্রের প্রতি দৌড় যা কাজ করে — প্রতিদিন অনুসরণ করে।

আরও এআই খবর পড়ুন →