বেঞ্চমার্কিং ফার্ম কৃত্রিম বিশ্লেষণ 4 সেপ্টেম্বর, 2026-এ তার ইন্টেলিজেন্স ইনডেক্সের 4.2 সংস্করণ প্রকাশ করেছে, একটি অন্তর্বর্তীকালীন আপডেট যা পুনরায় কাজ করে যে কীভাবে সীমান্ত AI মডেলগুলি পরিমাপ করা হয় — এবং, নতুন লিডারবোর্ড অনুসারে, Anthropic's Claude Fable 5.1 শীর্ষস্থান ধরে রেখেছে, OpenAI-এর GPT-6 Astra-এর পরে GPT-6-এর উপরে GPT-6-এ দ্বিতীয় স্থানে রয়েছে।
জানুয়ারিতে Index v4 চালু হওয়ার মাত্র আট মাস পরে আপডেটটি আসে, সাম্প্রতিক ফ্রন্টিয়ার রিলিজের গতির জন্য দৃঢ় বৈশিষ্ট্যগুলি একটি অস্বাভাবিক দ্রুত পরিবর্তন। "গত সপ্তাহগুলিতে সীমান্ত এত দ্রুত অগ্রসর হওয়ার সাথে সাথে, আমরা মনে করি যে আমাদের সূচকটি আগের মতো প্রাসঙ্গিক এবং দরকারী থাকে তা নিশ্চিত করার জন্য একটি তাত্ক্ষণিক অন্তর্বর্তী আপডেট সরবরাহ করা গুরুত্বপূর্ণ," কোম্পানি তার ঘোষণায় লিখেছিল।
শিরোনাম র্যাঙ্কিং
প্রকাশিত ফলাফল অনুসারে, Anthropic's Claude Fable 5.1 সূচকে এগিয়ে, এরপর OpenAI-এর GPT-6 Astra, যা GPT-5.6 Sol এর চেয়ে চার পয়েন্টের উন্নতি করেছে। লিডারবোর্ডে মেটা তৃতীয় শক্তিশালী ল্যাব হিসেবে স্থান পেয়েছে, তারপরে SpaceXAI, Moonshot/Kimi, Z.AI এবং Google।
নৃতাত্ত্বিক এবং ওপেনএআই আপডেট করা খরচ-দক্ষতার ছবিও ভাগ করে: মেটা এবং জেড.এআই-এর সাথে দুটি কোম্পানি সূচকের "কাস্ট প্রতি টাস্ক" প্যারেটো ফ্রন্টিয়ার দখল করে, যার অর্থ বর্তমানে অন্য কোনও ল্যাব সম্পূর্ণ কাজ প্রতি একই মূল্যের জন্য কঠোরভাবে ভাল বুদ্ধিমত্তা প্রদান করে না।
টোকেন দক্ষতার উপর, কৃত্রিম বিশ্লেষণে GPT-6 Astra "বুদ্ধিমত্তা সীমান্তের কাছাকাছি প্রায় প্রতিটি মডেলের চেয়ে বেশি টোকেন দক্ষ" পাওয়া গেছে, যেখানে ক্লাউড ফেবল 5.1, গ্রোক 4.5, এবং জেমিনি 3.5 ফ্ল্যাশ-লাইট বক্ররেখার উভয় প্রান্তে বসে আছে। দৃঢ় একটি সহচর বিশ্লেষণে উল্লেখ করেছে, তবে, Astra-এর নিম্ন টোকেন ব্যবহার এর উচ্চ মূল্যের কারণে বেশি - একটি অনুস্মারক যে কাঁচা দক্ষতা এবং মোট খরচ সবসময় একসাথে চলে না।
v4.2 এ কি পরিবর্তন হয়েছে
সবচেয়ে উল্লেখযোগ্য কাঠামোগত পরিবর্তন হল বেঞ্চমার্ক গেমিংয়ের বিরুদ্ধে একটি ইচ্ছাকৃত চাপ। সূচকের ওজনের চল্লিশ শতাংশ এখন প্রাইভেট, হোল্ড-আউট টেস্ট সেট থেকে আসে — v4.1-এর দ্বিগুণ শেয়ার — AA-Briefcase, AA-Omniscience, এবং CritPt-এর সমাধান সহ। সংস্থাটি বলেছে যে সূচক v5 এ সংখ্যা আরও বাড়বে।
দুটি নতুন মূল্যায়ন আপডেট অ্যাঙ্কর করে:
- AA-ব্রিফকেস, একটি প্রাইভেট হোল্ড-আউট টেস্ট সেট সহ ইন-হাউস এজেন্টিক জ্ঞান কাজের বেঞ্চমার্ক। মডেলগুলিকে বহু-সপ্তাহের পেশাদার প্রকল্পে মূল্যায়ন করা হয়, প্রতিটিতে অনেকগুলি লিঙ্কযুক্ত কাজ এবং হাজার হাজার ইনপুট সোর্স ফাইল রয়েছে এবং যাচাইযোগ্য কাজের সাফল্য, বিশ্লেষণাত্মক গুণমান এবং উপস্থাপনার গুণমানকে কভার করে রুব্রিক স্কোরিং এবং জুটিভিত্তিক তুলনার সমন্বয়ের মাধ্যমে গ্রেড করা হয়।
- GDP.pdf, সার্জ এআই দ্বারা তৈরি, যা পেশাদার নথি জুড়ে একক পালা যুক্তি পরীক্ষা করে: দশটি ডোমেনে বিস্তৃত 100টি PDF, 4,592 পৃষ্ঠার পাঠ্য, টেবিল, চার্ট এবং পাদটীকা জুড়ে বিতরিত প্রমাণ সহ। প্রতিক্রিয়াগুলি 1,275 বিশেষজ্ঞ-লেখিত পারমাণবিক মানদণ্ডের বিপরীতে গ্রেড করা হয়, এবং শিরোনাম অল-পাস রেট শুধুমাত্র যখন প্রতিটি মানদণ্ড সন্তুষ্ট হয় তখনই একটি টাস্ক ক্রেডিট করে।
একটি দীর্ঘস্থায়ী বেঞ্চমার্ক বের হওয়ার পথে: GPQA ডায়মন্ড, স্নাতক-স্তরের বিজ্ঞান যুক্তি পরীক্ষা, সরানো হয়েছে কারণ এটি কার্যকরভাবে সীমান্ত মডেল দ্বারা পরিপূর্ণ হয়েছে৷
ফার্মটি তার গ্রেডিং অবকাঠামোকেও আপগ্রেড করেছে, একটি নতুন গ্রেডিং সিস্টেম প্রম্পট এবং সংশোধন করা উত্তর কী সহ AA-LCR v1.1 প্রকাশ করেছে, GDPval-AA v2 এবং AA-ব্রিফকেসের জন্য Elo স্কেলকে পুনরায় অ্যাঙ্কর করছে যাতে নতুন মডেল আসার সাথে সাথে রেটিংগুলি স্থিতিশীল থাকে এবং SciCode-এর কঠোর করা হয় যাতে একটি ধীরগতির কোড-গ্রেডিং-কোড গণনা করা হয় না। ব্যর্থতা
নতুন পরীক্ষা কি প্রকাশ করে
নতুন মূল্যায়নের ফলাফলগুলি ফ্রন্টিয়ার ল্যাবগুলি আসলে কোথায় দাঁড়িয়েছে তার আরও দানাদার ছবি অফার করে।
AA-ব্রিফকেসে, Anthropic's Claude Fable 5.1 এবং Opus 5 লিড, এরপর OpenAI এর GPT-6 Astra এবং Meta's Muse Spark 1.3। GPT-6 Astra একই মূল্যায়নে GPT-5.6 Sol-এর উপরে মোটামুটি 85 Elo পয়েন্ট স্কোর করেছে — ধারাবাহিক ওপেনএআই প্রজন্মের মধ্যে একটি উল্লেখযোগ্য লাফ।
GDP.pdf-এ, ছবি উল্টে যায়: OpenAI GPT-6 Astra-এর সাথে 33.2% অল-পাস রেটে এগিয়ে, তারপর GPT-5.6 Sol-এর 28.2% এবং Claude Fable 5.1-এ 26.2%। ভিন্নতা প্রস্তাব করে যে অনেক বড় প্রেক্ষাপটে দীর্ঘ-নথি সংশ্লেষণ ওপেনএআই-এর নতুন মডেলের জন্য একটি আপেক্ষিক শক্তি হিসাবে রয়ে গেছে, এমনকি অ্যানথ্রোপিক-এর মডেলগুলি সামগ্রিক সূচক এবং এজেন্টিক কাজের কাজগুলিকে নেতৃত্ব দেয়।
কেন প্রাইভেট পরীক্ষা সেট গুরুত্বপূর্ণ
হোল্ড-আউট মূল্যায়নের দিকে স্থানান্তর AI বেঞ্চমার্কিং-এ একটি বৃহত্তর বিশ্বাসযোগ্যতার সমস্যা প্রতিফলিত করে। যেহেতু মডেলগুলি আরও পাবলিক পরীক্ষার ডেটা শোষণ করেছে, ল্যাব এবং স্বাধীন পর্যবেক্ষকরা ক্রমবর্ধমানভাবে উদ্বিগ্ন হয়ে উঠেছে যে সুপরিচিত বেঞ্চমার্কের শিরোনাম স্কোরগুলি প্রকৃত সক্ষমতার পরিবর্তে মুখস্থ বা লক্ষ্যযুক্ত প্রশিক্ষণকে প্রতিফলিত করে। এর পরীক্ষার সেটগুলির একটি ক্রমবর্ধমান অংশকে ব্যক্তিগত রেখে এবং সেগুলিকে আরও বেশি ওজন করে, কৃত্রিম বিশ্লেষণ সেই সংকেতটি সংরক্ষণ করার চেষ্টা করছে যে পাবলিক লিডারবোর্ডগুলি হারাচ্ছে।
ফার্মটি বলেছে যে এটি "মাস ধরে" সূচক v5-এর উপাদান তৈরি করছে এবং সাম্প্রতিক বড় মডেল লঞ্চের মাধ্যমে সূচকটিকে স্থিতিশীল রাখতে ইচ্ছাকৃতভাবে আপডেটগুলিকে আটকে রেখেছে। অন্তর্বর্তীকালীন v4.2 প্রকাশের বাইরে, এটি অদূর ভবিষ্যতে আরও ক্রমবর্ধমান আপডেটের পরিকল্পনা করে কারণ এটি v5 রূপান্তর সম্পূর্ণ করে।
ক্রেতাদের জন্য ফ্রন্টিয়ার মডেলগুলির মধ্যে বেছে নেওয়ার জন্য, v4.2 থেকে বাস্তবসম্মত উপায় হল যে বাজারের শীর্ষস্থানটি অ্যানথ্রপিক এবং ওপেনএআই-এর মধ্যে একটি দ্বি-ঘোড়ার দৌড়ে রয়ে গেছে, মেটা ব্যবধানটি বন্ধ করে দিয়েছে — এবং গেমিং প্রতিরোধী হওয়ার জন্য ডিজাইন করা মূল্যায়নগুলি এখন র্যাঙ্কিংয়ের আরও বেশি কাজ করছে। মডেল নির্বাচনের সিদ্ধান্ত ট্র্যাকিং ব্যবহারকারীরা v5 রোলআউট আসার সাথে সাথে সর্বশেষ AI উন্নয়নগুলি অনুসরণ করতে পারে।
এআই থেকে এগিয়ে থাকুন
এই ধরনের বেঞ্চমার্ক আপডেটগুলি কীভাবে শিল্পের অগ্রগতি বিচার করে তা পুনর্নির্মাণ করে। আরও AI খবর পড়ুন এবং প্রতিটি মডেল রিলিজের আগে থাকুন।
আরও এআই খবর পড়ুন →