Anthropic-এর Claude Opus 5 ARC-AGI-3 বেঞ্চমার্কে আধিপত্য করার পরে OpenAI পিছিয়ে যাচ্ছে, ফলাফল প্রকাশ করছে যা দেখায় যে তার নিজস্ব GPT-5.6 Sol মডেল 38.3 শতাংশ হিট করছে — যদি আপনি অফিসিয়াল পরীক্ষার হারনেসের পরিবর্তে OpenAI-এর পছন্দের সেটিংস ব্যবহার করেন।
30 জুলাই, 2026-এ শুরু হওয়া বিরোধটি AI মূল্যায়নে একটি ক্রমবর্ধমান সমস্যার কেন্দ্রবিন্দুতে কেটে যায়: বেঞ্চমার্কগুলি আর শুধুমাত্র একটি মডেলকে পরিমাপ করে না, বরং পুরো প্রযুক্তিগত ভারা এটিকে ঘিরে রয়েছে। সর্বশেষ AI উন্নয়ন এবং মডেল প্রকাশের গভীর বিশ্লেষণের জন্য, AI Buzz Wire গল্পটি ট্র্যাক করছে।
সংখ্যা এবং ধরা
OpenAI রিপোর্ট করেছে যে GPT-5.6 Sol ARC-AGI-3-এ 38.3 শতাংশে পৌঁছেছে, যা অ্যানথ্রপিকের ক্লড ওপাস 5কে অতিক্রম করেছে, যা পূর্বে বেঞ্চমার্কের রেকর্ডকে চারগুণ করার পরে 30.2 শতাংশ স্কোর করেছিল। সতর্কতাটি তাৎপর্যপূর্ণ: যে 38.3 শতাংশ সংখ্যা OpenAI এর প্রতিক্রিয়া API এর দুটি নির্দিষ্ট বৈশিষ্ট্যের উপর নির্ভর করে।
প্রথমটি হল রিটেইনড রিজনিং, যা প্রতিটি ক্রিয়াকলাপের পরে এটিকে বাতিল না করে ধাপগুলির মধ্যে মডেলের চিন্তাধারাকে সংরক্ষণ করে৷ দ্বিতীয়টি হল কম্প্যাকশন, যা পুরানো প্রেক্ষাপটকে ছেঁটে ফেলার পরিবর্তে সংক্ষিপ্ত করে, মডেলটিকে আগের যুক্তি না হারিয়ে দীর্ঘ সমস্যার উপর কাজ চালিয়ে যেতে দেয়।
ARC প্রাইজের অফিসিয়াল স্ট্যান্ডার্ডাইজড জোতার মাধ্যমে চালান — যা ইচ্ছাকৃতভাবে অ্যাপল-টু-আপেল তুলনা নিশ্চিত করতে প্রদানকারী-নির্দিষ্ট সেটিংস এড়িয়ে চলে — GPT-5.6 Sol মাত্র 7.8 শতাংশ পরিচালনা করেছে। কারণ, ওপেনএআই যুক্তি দেয় যে, অফিসিয়াল সেটআপ প্রতিটি পদক্ষেপের পরে মডেলের যুক্তিকে বাতিল করে দেয়, যে কাজগুলিতে টেকসই বহু-পদক্ষেপের চিন্তাভাবনার প্রয়োজন হয় তার কার্যক্ষমতা বৃদ্ধি করে।
বিশুদ্ধতার জন্য নির্মিত একটি বেঞ্চমার্ক
ARC-AGI-3 ফ্রাঙ্কোইস চোলেট এবং এআরসি প্রাইজ টিম দ্বারা ডিজাইন করা হয়েছিল একটি মডেলের অভিনব যুক্তিযুক্ত ধাঁধা সমাধান করার ক্ষমতা অনুসন্ধান করার জন্য যা এটি আগে কখনও দেখা যায়নি — মুখস্থ জ্ঞানের পরিবর্তে সাধারণ বুদ্ধিমত্তার পরীক্ষা। তুলনা ন্যায্য রাখার জন্য, অফিসিয়াল জোতা ইচ্ছাকৃতভাবে প্রদানকারী-নির্দিষ্ট বৈশিষ্ট্যগুলিকে সরিয়ে দেয়, একটি নিরপেক্ষ পরিবেশে কাঁচা মডেলের ক্ষমতা পরিমাপ করে।
OpenAI এর পাল্টা যুক্তি হল যে এই নিরপেক্ষতা একটি প্রতিবন্ধকতা হতে পারে। কোম্পানী দাবি করে যে অফিসিয়াল জোতা একটি পুরানো "ওপেনএআই-স্টাইল সমাপ্তি API" এর উপর নির্ভর করে যেটিতে ক্লাউড এপিআই ইতিমধ্যে অফার করা সক্ষমতার অভাব ছিল, কার্যকরীভাবে মূল তুলনাতে নৃতাত্ত্বিকের তুলনায় ওপেনএআইকে একটি কাঠামোগত অসুবিধায় ফেলেছে।
সারমর্মে, OpenAI বলছে: আপনি আমাদের মডেলটিকে তার পিছনে একটি হাত বেঁধে পরিমাপ করেছেন।
চোলেটের প্রতিক্রিয়া
ARC পুরস্কারের সহ-প্রতিষ্ঠাতা ফ্রাঁসোয়া চোলেট দুটি ধরণের পরীক্ষার সেটআপের মধ্যে একটি স্পষ্ট রেখা অঙ্কন করে প্রতিক্রিয়া জানিয়েছেন। তিনি বলেন, "বেঞ্চমার্ক সমাধানের জন্য কাস্টম-মেড বা যে বেঞ্চমার্ক বিন্যাস সম্পর্কে জ্ঞান রয়েছে" সেগুলি সীমাবদ্ধ নয়। কিন্তু সাধারণ-উদ্দেশ্য API সেটিংস "যা ARC-AGI-3 এর জন্য তৈরি করা হয়নি এবং যেগুলি সমস্ত API ব্যবহারকারীদের জন্য উপলব্ধ" হল ন্যায্য খেলা৷
কার্যত, Chollet স্বীকার করেছেন যে ARC পুরস্কারের নিজস্ব GPT-5.6 Sol স্কোর OpenAI-কে একটি অসুবিধায় ফেলেছে। তিনি উল্লেখ করেছেন যে সংস্থাটি "ওপেনএআই-এর সাথে তাদের মডেলগুলিকে কীভাবে সর্বোত্তমভাবে পরীক্ষা করা যায়, বিশেষত কমপ্যাকশনের বিষয়ে" সম্পর্কে অনেক বার বার আলোচনা করেছে এবং "উত্তর খুঁজে বের করা শুরু করে" কোম্পানিকে স্বাগত জানিয়েছে৷
Chollet একটি অবশিষ্ট উদ্বেগ পতাকাঙ্কিত. বিভিন্ন সেটিং ব্যবহার করে বিভিন্ন প্রদানকারীরা যাকে "একটি সম্ভাব্য সমতা সমস্যা" বলে অভিহিত করে তা তৈরি করে — তবে তিনি এটিকে গ্রহণযোগ্য বলে মনে করেন "যতক্ষণ সেটিংস এবং খরচ স্পষ্টভাবে রিপোর্ট করা হয়।"
কেন এটি লিডারবোর্ডের বাইরে গুরুত্বপূর্ণ
পর্বটি একটি উত্তেজনাকে আন্ডারস্কোর করে যা এআই শিল্প কীভাবে অগ্রগতি মূল্যায়ন করে তা পুনর্নির্মাণ করছে। যেহেতু মডেলগুলি স্বতন্ত্র সিস্টেমের পরিবর্তে বৈশিষ্ট্য-সমৃদ্ধ API-এর মাধ্যমে ক্রমবর্ধমানভাবে স্থাপন করা হচ্ছে, একটি মডেলের অন্তর্নিহিত ক্ষমতা এবং এর চারপাশের প্রকৌশলের মধ্যে রেখা ঝাপসা হয়ে যাচ্ছে। একটি বেঞ্চমার্ক যা ভারাকে উপেক্ষা করে তা বাস্তব-বিশ্বের কর্মক্ষমতাকে অবমূল্যায়ন করতে পারে; একটি যে এটি আলিঙ্গন পরীক্ষা গেমিং জন্য কোম্পানি পুরস্কৃত হতে পারে.
ARC-AGI-3 বিতর্ক শেষ হওয়ার সম্ভাবনা কম। যেহেতু ফ্রন্টিয়ার মডেলগুলি প্রতিষ্ঠিত বেঞ্চমার্কের শীর্ষের কাছাকাছি রয়েছে, ন্যায্য পরিমাপ হিসাবে কী গণনা করা হয় তা নিয়ে মতবিরোধ — এবং যার জোতা মান নির্ধারণ করতে পারে — কেবলমাত্র তীব্র হবে৷
এআই থেকে এগিয়ে থাকুন
মডেল, বেঞ্চমার্ক এবং সেগুলি তৈরি করা ল্যাবগুলিতে ব্রেকিং এআই নিউজ অনুসরণ করতে চান? এআই বাজ ওয়্যার আপনাকে কভার করেছে।
আরও এআই খবর পড়ুন