OpenAI এর GPT-6 Astra ARC-AGI-3-এ অত্যাধুনিক ফলাফল পোস্ট করেছে, এজেন্টিক বুদ্ধিমত্তা পরিমাপ করার জন্য ডিজাইন করা বিমূর্ত যুক্তির মানদণ্ড, ARC প্রাইজ ফাউন্ডেশন বুধবার প্রকাশিত ফলাফল অনুসারে। মডেলটি ফাউন্ডেশনের স্ট্যান্ডার্ড জোতার অধীনে বেঞ্চমার্কের সেমি-প্রাইভেট সেটে 62.7% স্কোর করেছে এবং একটি প্রোভাইডার অ্যাডাপ্টার জোতা দিয়ে মূল্যায়ন করার সময় 99.9% স্কোর করেছে যা অনুরোধের মধ্যে মডেলের অভ্যন্তরীণ যুক্তির অবস্থা সংরক্ষণ করে।
ওপেনএআই Astra-এর মঞ্চস্থিত রোলআউট শুরু করার একদিন পরে ফলাফল আসে, কোম্পানিটি একটি নতুন যুগের সূচনা হিসাবে ফ্ল্যাগশিপ মডেল তৈরি করেছে। ফ্রন্টিয়ার ল্যাবস ট্রেড বেঞ্চমার্ক ব্লো হিসাবে স্কোর ধরে রাখার চেষ্টা করা পাঠকদের জন্য, সর্বশেষ AI উন্নয়ন পৃষ্ঠা প্রতিটি বড় রিলিজকে ট্র্যাক করে।
দুটি হারনেস, দুটি খুব ভিন্ন স্কোর
Astra এর দুটি শিরোনাম সংখ্যার মধ্যে ব্যবধানটি প্রতিবেদনের সবচেয়ে গুরুত্বপূর্ণ বিশদ। এআরসি প্রাইজ বিভিন্ন জোতাগুলির অধীনে এজেন্টদের মূল্যায়ন করে এবং প্রতিটি মডেলকে তার নিজস্ব প্রেক্ষাপটে যা করার অনুমতি দেওয়া হয় তা পরিবর্তন করে।
স্ট্যান্ডার্ড জোতা অধীনে, একটি মডেল এটি একটি পরিবেশের মাধ্যমে কাজ করে রাখার জন্য বেছে নেওয়া নোটগুলিকে এগিয়ে নিয়ে যেতে পারে৷ সেই সেটআপের সাথে, Astra সর্বোচ্চ যুক্তির প্রচেষ্টায় 62.7% স্কোর করেছে, মূল্যায়ন চালানোর জন্য মোট $26,098 খরচ। বিপরীত প্রান্তে, যুক্তির সাথে একই জোতা চালানো বন্ধ করা মাত্র 35.2% উত্পাদিত হয়েছে যখন বেশি খরচ হয়েছে — $49,791 — কারণ মডেলটির অগ্রগতির জন্য আরও অনেক পদক্ষেপের প্রয়োজন।
প্রোভাইডার অ্যাডাপ্টার জোতা আরও উদার: এটি অনুরোধের মধ্যে মডেলের অস্বচ্ছ যুক্তির অবস্থা সংরক্ষণ করে এবং দীর্ঘ কথোপকথনের জন্য কমপ্যাকশন ব্যবহার করে, অ্যাস্ট্রাকে পূর্বের কাজ পুনরায় ব্যবহার করতে দেয়। সেই জোগানের অধীনে, Astra উচ্চ যুক্তির প্রচেষ্টায় $18,817 এর জন্য 99.9% এবং $17,332-এর জন্য সর্বাধিক প্রচেষ্টায় 98.6% স্কোর করেছে। এমনকি সর্বনিম্ন যুক্তি সেটিং 96.7% পৌঁছেছে।
অন্য কথায়, একটি আংশিক স্কোর এবং একটি কাছাকাছি-নিখুঁত স্কোরের মধ্যে পার্থক্য শুধুমাত্র কাঁচা সামর্থ্য নয় - এটি ধাপগুলির মধ্যে মডেলটির কার্যকারী অবস্থার কতটা টিকে থাকে।
কর্ম দক্ষতার উপর মানুষের মারধর
ARC-AGI-3 উপন্যাস, বিমূর্ত, টার্ন-ভিত্তিক গেম পরিবেশকে ঘিরে তৈরি করা হয়েছে। এজেন্টদের অবশ্যই নির্দেশাবলী ছাড়াই অন্বেষণ করতে হবে, বিশ্ব কীভাবে কাজ করে তা অনুমান করতে হবে, বিরল পুরষ্কার থেকে লক্ষ্যগুলি সনাক্ত করতে হবে এবং বহু-পদক্ষেপের কর্মের পরিকল্পনা করতে হবে। পরিবেশগুলিকে ক্রমাঙ্কিত করা হয় যাতে মানুষ তাদের 100% সমাধান করতে পারে, যা মানুষের কর্মক্ষমতাকে বেঞ্চমার্ক পরিমাপের বিরুদ্ধে বেসলাইন করে তোলে।
Astra শুধুমাত্র বেশিরভাগ স্তরের সমাধান করেনি - এটি তাদের দক্ষতার সাথে সমাধান করেছে। ARC প্রাইজ অনুসারে, মডেলটি 96% স্তরে মধ্যম পরীক্ষিত মানুষের চেয়ে কম ক্রিয়া ব্যবহার করেছে, সমগ্র সেট জুড়ে কর্ম দক্ষতায় মানব বেসলাইনকে ছাড়িয়ে গেছে।
তুলনার অর্থনীতি কঠোর। মানব পরীক্ষায় অংশগ্রহণকারীদের প্রতি 90-মিনিটের সেশনে $115 এবং প্রতি সম্পূর্ণ খেলা প্রতি $5 প্রদান করা হয়, প্রতি চেষ্টা করা গেমে মোটামুটি $12.78 পর্যন্ত কাজ করে। কনফিগারেশনের উপর নির্ভর করে একটি সম্পূর্ণ Astra মূল্যায়ন রানের জন্য পাঁচটি পরিসংখ্যান খরচ হয়। কিন্তু ARC প্রাইজ একটি কাউন্টারইন্ট্যুটিভ রিঙ্কেল উল্লেখ করেছে: উচ্চতর যুক্তির প্রচেষ্টা সাধারণত কম খরচ করে, কারণ Astra কম অ্যাকশনে গেমস সমাধান করে, প্রতি রানে মোট কল এবং টোকেন বার্ন করা কমিয়ে দেয়।
একটি মডেল যা নিজের ভাষা তৈরি করে
স্কোরের বাইরে, ARC পুরস্কার একটি গুণগত আচরণ হাইলাইট করেছে দলটি পর্যবেক্ষণ করেছে। Astra ধারাবাহিকভাবে অপরিচিত পরিবেশকে কমপ্যাক্ট সিম্বলিক ওয়ার্ল্ড মডেলে পরিণত করেছে — গেম মেকানিক্সকে যৌক্তিক নিয়ম হিসাবে উপস্থাপন করে, এবং স্টেট এবং প্ল্যান অ্যাকশন ট্র্যাক করার জন্য নিজস্ব ডোমেন-নির্দিষ্ট শর্টহ্যান্ড তৈরি করে।
এটি অবিকল দক্ষতা ARC-AGI-3 তদন্ত করার জন্য ডিজাইন করা হয়েছিল। যেখানে বেঞ্চমার্কের আগের প্রজন্মগুলি উপন্যাসের প্যাটার্নগুলির উপর তরল যুক্তি পরীক্ষা করেছে, তৃতীয় প্রজন্ম পরীক্ষা করে যে কোনও এজেন্ট এমন পরিবেশে অন্বেষণ করতে, মডেল করতে, লক্ষ্য নির্ধারণ করতে এবং পরিকল্পনাগুলি সম্পাদন করতে পারে কিনা যা এটি কখনও দেখেনি — ARC পুরস্কারের উপাদানগুলি অনুসন্ধান, মডেলিং, লক্ষ্য-সেটিং, এবং পরিকল্পনা এবং সম্পাদন হিসাবে তালিকাভুক্ত করে৷
AGI-যুগের পটভূমি
মানদণ্ডের ফলাফল ওপেনএআই থেকে সর্বাধিক বাগ্মীতার মধ্যে এসেছে। বৃহস্পতিবার লঞ্চের আগে একটি প্রেস ব্রিফিংয়ে, কোম্পানির প্রেসিডেন্ট গ্রেগ ব্রকম্যান বলেছিলেন যে "আমরা এখন এজিআই যুগে আছি এটা অনুভব করা অযৌক্তিক নয়," যখন একটি আনুষ্ঠানিক ঘোষণার সংক্ষিপ্ততা বন্ধ করে, দ্য নিউ স্ট্যাকের লঞ্চের কভারেজ অনুসারে। তিনি AGI কে চুক্তিভিত্তিক ট্রিগারের পরিবর্তে একটি "মিশন ধারণা বা আধ্যাত্মিক ধারণা" হিসাবে বর্ণনা করেছেন।
ওপেনএআই গবেষক আইডান ক্লার্ক বলেন, অ্যাস্ট্রা ছিল কোম্পানির এখন পর্যন্ত পরিচালিত সবচেয়ে বড় প্রশিক্ষণ — টেক্সাসের স্টারগেট সাইটে 100,000-এরও বেশি GPU-তে প্রথম প্রি-প্রশিক্ষিত — এবং প্রথম OpenAI রিলিজ যেখানে পূর্বের মডেলগুলি প্রশিক্ষণ প্রক্রিয়ার তত্ত্বাবধানে গুরুত্বপূর্ণ ভূমিকা পালন করেছিল। অ্যাক্সেস পর্যায়ক্রমে রয়ে গেছে: ডেব্রেক প্রোগ্রামে এন্টারপ্রাইজ গ্রাহকদের সাথে রোলআউট শুরু হয়, প্লাস, প্রো, বিজনেস এবং এন্টারপ্রাইজের প্রাপ্যতা প্লাস এপিআই এবং এডব্লিউএস অ্যাক্সেসের প্রতিশ্রুতি আগামী দিনে।
স্কোরে তারকাচিহ্ন
বিভিন্ন ফ্রন্টে সতর্কতা জারি করা হয়েছে। Astra এর ARC-AGI-3 কর্মক্ষমতা জোতা কনফিগারেশনের উপর ব্যাপকভাবে নির্ভর করে, যেমন দুটি শিরোনাম সংখ্যা দেখায়, এবং কাস্টম হারনেস যা মডেল স্টেট রক্ষা করে বেঞ্চমার্ক বিবাদে বিবাদের পুনরাবৃত্তিমূলক পয়েন্ট হয়েছে। লঞ্চের নিউ স্ট্যাকের বিশ্লেষণে উল্লেখ করা হয়েছে যে Astra "বিশেষ কাজগুলিতে বড় লাভ পোস্ট করে, কিন্তু এটি একটি প্রিমিয়ামে আসে এবং স্পষ্টভাবে কোডিং প্যাকে নেতৃত্ব দেয় না" - একটি অনুস্মারক যে এজেন্টিক পাজল বেঞ্চমার্ক এবং দৈনন্দিন বাণিজ্যিক কাজের চাপ বিভিন্ন জিনিস পরিমাপ করে৷
ARC প্রাইজ নিজেই অনুশীলনটিকে বর্তমান AI এবং AGI-এর মধ্যে "অবশিষ্ট ব্যবধান" পরিমাপ হিসাবে তৈরি করে, AGI কে একজন মানুষের যে কোনও দক্ষতা অর্জন করার ক্ষমতা হিসাবে সংজ্ঞায়িত করে, একজন মানুষের মতো দক্ষতার সাথে। অনুকূল পরিস্থিতিতে একটি কাছাকাছি-নিখুঁত স্কোর নিজেই সেই ব্যবধানটি বন্ধ করে না। এবং প্রতি মূল্যায়ন চালানোর জন্য $17,000 থেকে $50,000-এ, শুধুমাত্র ভাল রিসোর্সড ল্যাবগুলি এই স্কেলে বেঞ্চমার্ক চালানোর সামর্থ্য রাখে — যদিও ARC প্রাইজের খরচের ডেটা দেখায় যে স্মার্ট যুক্তি আসলে বিলকে সঙ্কুচিত করতে পারে।
কেন এটা গুরুত্বপূর্ণ
কর্ম দক্ষতা তুলনা একটি সত্যিকারের নতুন অক্ষ. একটি মডেল যেটি প্রতিটি স্তরের সমাধান করে কিন্তু হাজার হাজার কল নষ্ট করে তা কম দরকারী — এবং আরও ব্যয়বহুল — যেটি এখানে Astra এর মতো কাজ করে: ইচ্ছাকৃতভাবে অন্বেষণ করা, যা শিখেছে তা সংকুচিত করা এবং এতে কাজ করা৷ এজিআই বিতর্ক সম্পর্কে যেই উপসংহারে আসা হোক না কেন, এআরসি পুরস্কারের ডেটা দেখায় যে সীমান্ত এজেন্টরা এখন মানুষের সাথে মিল করছে শুধু তারা অভিনব সমস্যাগুলি সমাধান করতে পারে কিনা তা নয়, বরং তারা কীভাবে অর্থনৈতিকভাবে তাদের সমাধান করে।
এআই থেকে এগিয়ে থাকুন
প্রতিটি বেঞ্চমার্ক ফলাফল, মডেল লঞ্চ এবং নিরাপত্তা বিতর্ক, এটি ঘটে এমনভাবে ট্র্যাক করা হয়েছে — আরও এআই খবর পড়ুন →
