একটি নতুন বেঞ্চমার্ক চ্যালেঞ্জ করছে যে কীভাবে এআই শিল্প বৈজ্ঞানিক সক্ষমতা পরিমাপ করে এবং এর প্রথম ফলাফলগুলি সীমান্ত ল্যাবগুলির জন্য নম্র। টার্মিনাল-বেঞ্চ-সায়েন্স 0.1, এই সপ্তাহে স্ট্যানফোর্ড ইউনিভার্সিটির গবেষকরা এবং জনপ্রিয় টার্মিনাল-বেঞ্চ কোডিং বেঞ্চমার্কের পিছনের দল দ্বারা চালু করা হয়েছে, কর্মরত বিজ্ঞানীদের দ্বারা অবদানকৃত বাস্তব বৈজ্ঞানিক গবেষণা কর্মপ্রবাহের উপর AI এজেন্টদের মূল্যায়ন করে — এবং সবচেয়ে শক্তিশালী মডেল পরীক্ষিত, Claude Opus 5 চলছে, Claude Code %3-এর মাধ্যমে চলছে।

বেঞ্চমার্কের ঘোষণার পৃষ্ঠাটি তার নির্দেশক নীতিকে স্পষ্টভাবে বর্ণনা করে: বিজ্ঞানীদের, মডেল ডেভেলপার বা ডেটা বিক্রেতাদের নয়, AI-তে বৈজ্ঞানিক সক্ষমতার জন্য বার সেট করা উচিত। প্রকল্পটি সারা বিশ্বের গবেষণা প্রতিষ্ঠানের ডোমেন বিশেষজ্ঞদের সহযোগিতায় তৈরি করা হয়েছিল, এবং এর প্রথম প্রকাশে জীবন বিজ্ঞান, পদার্থবিদ্যা, আর্থ সায়েন্স, গণিত এবং প্রকৌশলের 70টি কাজ অন্তর্ভুক্ত রয়েছে।

পাঠ্যপুস্তকের মানদণ্ড থেকে এটি কীভাবে আলাদা

বেশিরভাগ বৈজ্ঞানিক এআই মূল্যায়ন জ্ঞান পরীক্ষা করে: বহু-পছন্দের প্রশ্ন, পাঠ্যপুস্তকের সমস্যা, প্রমিত অনুশীলন। টার্মিনাল-বেঞ্চ-সায়েন্স পরিবর্তে পরিমাপ করে যে এজেন্টরা প্রযুক্তিগতভাবে চাহিদাপূর্ণ, সময়সাপেক্ষ ওয়ার্কফ্লোগুলি চালাতে পারে যা প্রকৃত গবেষকদের দিনগুলি পূরণ করতে পারে — যে ধরনের কাজ কোনও পরীক্ষায় প্রদর্শিত হয় না। কার্যগুলি বাস্তবসম্মত পরিবেশে চালিত হয় এবং গ্রেডিং করা হয় কংক্রিট শিল্পকর্মের উপর ভিত্তি করে: বিশ্লেষণ, সিমুলেশন, প্রমাণ, কোড এবং ডেটা পণ্য, বিচারের মডেল বা একাধিক-চয়েস স্কোরিংয়ের পরিবর্তে পুনরুত্পাদনযোগ্য টাস্ক-নির্দিষ্ট পরীক্ষা দিয়ে পরীক্ষা করা হয়।

এই নকশাটি বিজ্ঞানের জন্য এআই সহকারীরা শেষ পর্যন্ত কী করা উচিত তার একটি তত্ত্ব প্রতিফলিত করে। বৈজ্ঞানিক বিচারকে প্রতিস্থাপন করার পরিবর্তে, বেঞ্চমার্কের লেখকরা যুক্তি দেন, এজেন্টদের এক্সিকিউশন লেয়ারটি গ্রহণ করা উচিত — পরীক্ষা-নিরীক্ষা চালানো, ডেটা প্রক্রিয়াকরণ, প্রমাণ পরীক্ষা করা — বিজ্ঞানীদের গবেষণার অংশগুলির জন্য মুক্ত করা যেখানে মানুষের রায় সবচেয়ে গুরুত্বপূর্ণ: প্রশ্ন সংজ্ঞায়িত করা, হাইপোথিসিস তৈরি করা, ফলাফল খুঁজে বের করা, আন্তঃপ্রকাশ করা।

প্রকল্পটি স্পষ্টভাবে একটি চলমান লক্ষ্য হিসাবে নির্মিত হয়েছে। যেখানে অনেক বেঞ্চমার্ক একবার প্রকাশ করা হয় এবং পরিত্যক্ত হয় — ঘোষণাটি এটিকে "প্রকাশের জন্য কাগজপত্র" সমস্যা বলে — টার্মিনাল-বেঞ্চ-সায়েন্স একটি ক্রমাগত বেঞ্চমার্ক হিসাবে ডিজাইন করা হয়েছে যা সীমান্তের পাশাপাশি বিকশিত হয়, নিয়মিত প্রকাশের উদ্দেশ্য মডেল অগ্রগতির আগে মূল্যায়ন রাখা এবং দূষণ-চালিত স্কোর মুদ্রাস্ফীতি প্রতিরোধ করার উদ্দেশ্যে।

প্রথম লিডারবোর্ড: নির্ভরযোগ্য থেকে একটি দীর্ঘ পথ

v0.1 লিডারবোর্ড, যা এই সপ্তাহে হ্যাকার নিউজে পৌঁছানোর সময় তাৎপর্যপূর্ণ মনোযোগ আকর্ষণ করেছিল, শীর্ষ থেকে একটি খাড়া ড্রপ-অফ দেখায়:

  • Claude Opus 5 (Claude Code): 30.0%
  • GPT-5.6 Sol (Codex): 22.4%
  • Claude Fable 5 (Claude Code): 21.4%
  • Claude Opus 4.8 (Claude Code): 10.5%
  • GPT-5.6 টেরা (কোডেক্স): 8.6%
  • GLM 5.3 (ক্লদ কোড): 8.1%
  • কিমি K3 (ক্লড কোড): 7.1%
  • Grok 4.6 (Grok বিল্ড): 7.1%
  • GPT-5.6 লুনা (কোডেক্স): 3.3%

ফলাফলগুলি পরামর্শ দেয় যে বৈজ্ঞানিক কর্মপ্রবাহগুলি সফ্টওয়্যার ইঞ্জিনিয়ারিংয়ের তুলনায় এজেন্টদের জন্য যথেষ্ট কঠিন থেকে যায়, যেখানে মূল টার্মিনাল-বেঞ্চ এবং প্রতিদ্বন্দ্বী কোডিং বেঞ্চমার্কগুলি স্কোরগুলি দ্রুত আরোহণ করতে দেখেছে। সেরা উপলব্ধ সিস্টেমের জন্য একটি 30% রেজোলিউশন রেট মানে হল যে দশটি বাস্তব গবেষণা কাজের মধ্যে সাতটিতে, এমনকি একটি শক্তিশালী জোতা দিয়ে যুক্ত একটি শীর্ষ-স্তরের এজেন্টও যাচাইযোগ্যভাবে সঠিক কাজ তৈরি করতে ব্যর্থ হয়।

মডেল পরিবারের মধ্যে বিস্তার এছাড়াও শিক্ষামূলক. Claude Opus 5 এবং Claude Opus 4.8 - প্রায় বিশ পয়েন্ট - এবং GPT-5.6 ভেরিয়েন্ট Sol, Terra, এবং Luna-এর মধ্যে ব্যবধান দেখায় যে ফলাফলের গুণমান কতটা নির্ভর করে মডেল এবং এজেন্ট জোতার পারস্পরিক ক্রিয়াকলাপের উপর, শুধুমাত্র কাঁচা মডেলের বুদ্ধিমত্তা নয়। প্রতিটি উচ্চ-স্কোরিং এন্ট্রি একটি এজেন্টিক কোডিং জোতা ব্যবহার করে (ক্লদ কোড, কোডেক্স, গ্রোক বিল্ড), উদীয়মান ঐক্যমত্যকে শক্তিশালী করে যে ভারা অন্তর্নিহিত ওজনের মতোই নিষ্পত্তিমূলক।

কেন বিজ্ঞানীরা তাদের নিজস্ব বেঞ্চমার্ক তৈরি করেছেন

বেঞ্চমার্কের ফ্রেমিং একটি সূক্ষ্ম প্রাতিষ্ঠানিক যুক্তি বহন করে। ঘোষণায় বলা হয়েছে, "বিজ্ঞানের অংশীদারিত্ব খুব বেশি, এবং এর মানদণ্ডগুলি অবশ্যই বাইরের স্বার্থের পরিবর্তে বৈজ্ঞানিক সম্প্রদায়ের অগ্রাধিকারগুলিকে প্রতিফলিত করবে।" প্রকল্পটি কর্মরত গবেষকদের একটি সরাসরি প্রক্রিয়া দেয় যাতে তারা প্রকৃতপক্ষে স্বয়ংক্রিয়ভাবে প্রয়োজনীয় কাজগুলিকে এনকোড করতে পারে - এবং একটি যাচাইযোগ্য মানদণ্ডের বিপরীতে "বৈজ্ঞানিক আবিষ্কারকে ত্বরান্বিত করার" বিক্রেতাদের দাবিকে ধরে রাখতে।

এটি গুরুত্বপূর্ণ কারণ বিপণন এবং বাস্তবতার মধ্যে ব্যবধানের বাস্তব পরিণতি রয়েছে। যদি ফ্রন্টিয়ার ল্যাবগুলি দাবি করে যে তাদের এজেন্টরা স্বাধীন থাকাকালীন গবেষণাকে ত্বরান্বিত করতে পারে, বিশেষজ্ঞ-পরিকল্পিত মূল্যায়ন একক-ডিজিট-থেকে-30% রেজোলিউশনের হার, অর্থায়নের সিদ্ধান্ত, নিয়োগের পরিকল্পনা এবং সেই দাবিগুলির উপর নির্মিত ল্যাব নীতিগুলি উত্তরাধিকারসূত্রে ত্রুটি দেখায়৷ ক্রমাগত, সম্প্রদায়ের মালিকানাধীন বেঞ্চমার্কগুলি একটি সংশোধনমূলক: তারা অস্পষ্ট দাবিগুলিকে পুনরুত্পাদনযোগ্য সংখ্যায় রূপান্তর করে।

গবেষণা প্রতিষ্ঠানের জন্য একটি সংকেত

বিশ্ববিদ্যালয়, জাতীয় ল্যাব এবং R&D টিমের জন্য কখন এজেন্টদের মোতায়েন করতে হবে, বেঞ্চমার্ক এমন কিছু অফার করে যা বিক্রেতাদের ডেমো পারে না: নির্ভরযোগ্যতার লাইনটি আসলে কোথায় বসেছে তার একটি সম্প্রদায়-রক্ষণাবেক্ষণ করা পরিমাপ। কিশোর বা বিশের দশকে একটি রেজোলিউশন রেট মানে এই সিস্টেমগুলিকে আজকে সহায়ক হিসাবে সবচেয়ে ভালভাবে বিবেচনা করা হয় যার পর্যালোচনার প্রয়োজন হয়, পরীক্ষামূলক পাইপলাইনের স্বায়ত্তশাসিত নির্বাহক হিসাবে নয়। টাস্কের বিভাগগুলি — বিস্তৃত জীবন, ভৌত, আর্থ, গাণিতিক, এবং প্রকৌশল বিজ্ঞান — এছাড়াও ডোমেন বিশেষজ্ঞদের এমন ক্ষেত্রগুলি থেকে কর্মপ্রবাহে অবদান রাখার জন্য একটি টেমপ্লেট দেয় যা জেনেরিক বেঞ্চমার্কগুলি নিয়মিতভাবে উপেক্ষা করে।

বৃহত্তর শিল্পের প্রেক্ষাপট শক্তিশালী করে যে কেন সময় গুরুত্বপূর্ণ। বিজ্ঞান ফ্রন্টিয়ার এআই-এর জন্য সবচেয়ে বেশি প্রচারিত ব্যবহারের ক্ষেত্রে পরিণত হয়েছে, ল্যাবগুলি উপাদান আবিষ্কার, প্রোটিন বিজ্ঞান এবং গণিতে অবদানের সাথে জড়িত। এই দাবিগুলি অডিট করা কঠিন: বৈজ্ঞানিক আউটপুট যাচাই করতে ধীর, এবং উত্সাহ প্রতিলিপির চেয়ে দ্রুত চলে। একটি বেঞ্চমার্ক যা বাস্তব কর্মপ্রবাহের উপর যাচাইযোগ্য নিদর্শনগুলিকে গ্রেড করে তা গবেষণা প্রতিষ্ঠানগুলিকে প্রদর্শন থিয়েটার থেকে প্রদর্শিত ক্ষমতাকে আলাদা করার উপায় দেয় — এবং ট্র্যাক করার, প্রকাশের মাধ্যমে প্রকাশ করা, বিজ্ঞানের এজেন্টিক অগ্রগতি সফ্টওয়্যার প্রকৌশলের মতো দ্রুততর হচ্ছে কিনা, যেখানে টার্মিনাল-বেঞ্চ প্রথম নাম করেছে৷

AI শিল্পের জন্য, v0.1-এর বার্তাটি দ্বি-ধারী। সীমান্ত স্পষ্টভাবে অগ্রসর হচ্ছে — পুরানো Opus 4.8-এর 10.5%-এর উপরে Opus 5-এর 30% টাওয়ার — কিন্তু বাস্তব পরীক্ষাগারগুলির জন্য প্রয়োজনীয় নির্ভরযোগ্যতা থেকে সিলিং অনেক দূরে রয়েছে। বেঞ্চমার্কের ডিজাইনাররা বলছেন যে নিয়মিত রিলিজগুলি ঠিক কত দ্রুত সেই ফাঁকটি বন্ধ করে তা ট্র্যাক করবে। বিজ্ঞানীরা এজেন্টিক রিসার্চ টুলে উদীয়মান AI প্রবণতা দেখছেন তাদের নিজেদের তৈরি করা মানদণ্ড রয়েছে।

---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →