বিকেন্দ্রীভূত AI ল্যাব প্রাইম ইন্টেলেক্ট একটি বৃহৎ মাপের পরীক্ষার ফলাফল প্রকাশ করেছে যা পরীক্ষা করে যে আজকের ফ্রন্টিয়ার এআই মডেলগুলি কতটা ভালভাবে স্বায়ত্তশাসিত মেশিন লার্নিং গবেষণা সম্পাদন করতে পারে — এবং সেগুলির মধ্যে সেরাটি একটি বিখ্যাত সম্প্রদায়ের মানদণ্ডে মানব বিশ্ব রেকর্ডের সাথে মিলে যাওয়ার উল্লেখযোগ্যভাবে কাছাকাছি এসেছে৷
প্রকল্প, NanoGPT Speedrun Frontier নামে ডাকা হয়েছে এবং 22শে আগস্ট প্রকাশিত হয়েছে, 18টি ফ্রন্টিয়ার মডেল জুড়ে 153টি স্বায়ত্তশাসিত রান নিয়ে গঠিত যা ন্যানোজিপিটি অপ্টিমাইজার স্পিডরানের চেষ্টা করছে - একটি প্রতিযোগিতা যেখানে গবেষকরা একটি নির্দিষ্ট মানের লক্ষ্যে একটি ছোট ভাষা মডেলকে প্রশিক্ষণ দেওয়ার সবচেয়ে কার্যকর উপায় অনুসন্ধান করে৷ গল্পটি দ্রুত হ্যাকার নিউজের প্রথম পৃষ্ঠায় আরোহণ করে, যেখানে এটি প্রকৃত বৈজ্ঞানিক আবিষ্কারের জন্য AI এর সক্ষমতা সম্পর্কে ফলাফলগুলি কী বলে তা নিয়ে বিতর্ক করে কয়েক ডজন মন্তব্য করে। For more context on this story, see our ongoing artificial intelligence updates.
NanoGPT স্পিডরান আসলে কি?
বেঞ্চমার্ক কেলার জর্ডান দ্বারা রক্ষণাবেক্ষণ করা modded-nanogpt সংগ্রহস্থল এবং সম্প্রদায় অবদানকারীদের একটি দীর্ঘ তালিকা থেকে আসে। চ্যালেঞ্জটি বলাটা প্রতারণামূলকভাবে সহজ: 8টি NVIDIA H100 GPU ব্যবহার করে, FineWeb যাচাইকরণ সেটে 3.28 ক্রস-এনট্রপি লস-এ পৌঁছানোর জন্য একটি ভাষা মডেলকে প্রশিক্ষণ দিন — পারফরম্যান্স লেভেল Andrej Karpathy-এর আসল GPT-2 প্রতিলিপি 45 মিনিট পরে পৌঁছেছে — যত দ্রুত সম্ভব।
গত দুই বছরে শত শত সম্প্রদায়ের অবদানের মাধ্যমে, মানব রেকর্ড 75 সেকেন্ডের নিচে এবং 400 মিলিয়ন প্রশিক্ষণ টোকেনের নিচে নেমে এসেছে, যা মূল রেসিপির তুলনায় 30 গুণেরও বেশি উন্নতি। বিজয়ী সমাধানগুলি আধুনিক ML ইঞ্জিনিয়ারিং-এর ক্যাটালগের মতো পড়ে: Muon অপ্টিমাইজার, QK-Norm-এর সাথে রোটারি এম্বেডিং, ReLU-squared অ্যাক্টিভেশন, FP8 কোয়ান্টাইজেশন অন অ্যাটেনশন এবং MLP পাস, স্লাইডিং-উইন্ডো প্যাটার্ন সহ ফ্ল্যাশ অ্যাটেনশন 3, এবং আরও কয়েক ডজন অন্যান্য কৌশল একে অপরের উপরে স্তুপীকৃত।
প্রাইম ইন্টেলেক্টের পরীক্ষায় বেঞ্চমার্কের অপ্টিমাইজার ট্র্যাক ব্যবহার করা হয়েছে, যা — সংগ্রহস্থলের ডকুমেন্টেশন অনুসারে — কার্যকরভাবে সীমাহীন প্রাচীর-ঘড়ি বাজেটের সাথে একটি নির্দিষ্ট আর্কিটেকচার, ডেটাসেট এবং ব্যাচের আকারের সাপেক্ষে লক্ষ্য ক্ষতি পূরণের জন্য প্রয়োজনীয় প্রশিক্ষণ পদক্ষেপের সংখ্যা কমিয়ে দেয়। এটি কাঁচা হার্ডওয়্যার গতির পরিবর্তে অ্যালগরিদম আবিষ্কারের একটি বিশুদ্ধ পরীক্ষা করে তোলে।
পরীক্ষাটি কীভাবে কাজ করেছে
18টি মডেলের প্রতিটিকে স্বায়ত্তশাসিতভাবে কাজটি দেওয়া হয়েছিল: প্রশিক্ষণের রেসিপিতে পরিবর্তনের প্রস্তাব করুন, পরীক্ষা চালান, ফলাফলগুলি পরিদর্শন করুন এবং পুনরাবৃত্তি করুন — একটি নির্দিষ্ট যাচাইকরণ স্ক্রিপ্ট এবং নির্দিষ্ট র্যান্ডম বীজের সাথে নিশ্চিত করুন যে দাবি করা উন্নতি ভাগ্যবান দৌড়ের পরিবর্তে বাস্তব। যেহেতু একজন হ্যাকার নিউজ মন্তব্যকারী এটির সংক্ষিপ্ত বিবরণ দিয়েছেন, মডেলগুলিকে গবেষণা করতে বলা হয়েছিল কীভাবে একটি ছোট মডেলের প্রশিক্ষণ উন্নত করা যায়, বারবার পরিবর্তনের চেষ্টা করা, সেগুলি পরীক্ষা করা এবং ফলাফলগুলি ব্যবহার করে পরবর্তী কী চেষ্টা করা যায় তা সিদ্ধান্ত নেওয়ার জন্য।
মডেলগুলি বিভিন্ন ধরণের এজেন্ট ব্যবহার করে কাজ করেছে — যার মধ্যে রয়েছে claude-code, OpenAI এর কোডেক্স, kimi-code, grok-cli, qwen-code, এবং Prime Intellect-এর নিজস্ব প্রাইম-এজেন্ট — এবং দলটি প্রতিটি রানের টোকেন খরচ, এক্সপেরিমেন্ট কাউন্ট, টুল কল এবং অতিবাহিত এজেন্টের সময় ট্র্যাক করেছে। মোট, পরীক্ষাটি শীর্ষ মডেলের প্রতি কয়েক মিলিয়ন টোকেন এবং পুরো গ্রিড জুড়ে বিলিয়ন খরচ করেছে।
লিডারবোর্ড: রূপকথা 5 প্যাকে নেতৃত্ব দেয়
শিরোনাম ফলাফল: ফেবল 5 হিসাবে চিহ্নিত মডেলটি, ক্লোড-কোড জোতা দিয়ে চলমান, বেসলাইন রেসিপি এবং মানব রেকর্ডের মধ্যে ব্যবধানের 81.7 শতাংশ বন্ধ করেছে, লিডারবোর্ডের মেট্রিকে 2,726 এর সেরা বৈধ ফলাফলের সাথে। সেখানে পৌঁছাতে 8.7 দিনের ক্রমবর্ধমান এজেন্ট সময়, প্রায় 800 মিলিয়ন টোকেন, 811টি পরীক্ষা, এবং প্রায় 3,000 টুল কল।
চেজিং প্যাকটির নেতৃত্বে ছিল Opus 5, যা ব্যবধানের 53.6 শতাংশ বন্ধ করে দেয়, এরপর কিমি K3-এর 52.2 শতাংশে প্রাইম ইন্টেলেক্টের প্রাইম-এজেন্ট জোতা দ্বারা চালিত হয় (এবং 45.8 শতাংশ কিমি-কোডের মাধ্যমে)। Opus 4.8 39.4 শতাংশ পরিচালনা করেছে, বেশ কয়েকটি GPT-5.6 ভেরিয়েন্ট প্রায় 11 থেকে 36 শতাংশের মধ্যে এসেছে, সনেট 5 26.8 শতাংশ বন্ধ করেছে, এবং Grok 4.5 এবং Qwen3.8 ম্যাক্স প্রতিটি প্রায় 24.6 শতাংশে পৌঁছেছে।
আরও নিচে, DeepSeek V4 Pro 12.3 শতাংশ ব্যবধান বন্ধ করেছে, GPT-5.5 8.1 শতাংশে পৌঁছেছে এবং পুরানো কিমি K2.7 7.2 শতাংশে পৌঁছেছে। উল্লেখযোগ্যভাবে, সম্প্রতি প্রকাশিত একটি মডেল — GLM 5.3 — এখনও প্রকাশনার সময় চলছিল কোন বৈধ রেকর্ড ছাড়াই, একটি অনুস্মারক যে বেঞ্চমার্ক সেই মডেলগুলিকে শাস্তি দেয় যেগুলি তাদের নিজস্ব উন্নতিগুলি নির্ভরযোগ্যভাবে যাচাই করতে পারে না৷
কেন এটা গুরুত্বপূর্ণ
বেঞ্চমার্কগুলি এই বিষয়টি পছন্দ করে কারণ তারা কিছু কোডিং লিডারবোর্ড করতে পারে না: একটি প্রকৃত গবেষণা লুপ চালানোর ক্ষমতা — অনুমান, পরীক্ষা, বিশ্লেষণ, সংশোধন — মিনিটের চেয়ে দিন ধরে। সেই ক্ষমতা হল স্বায়ত্তশাসিত AI গবেষণার উদীয়মান ক্ষেত্রের ভিত্তি, যেখানে এজেন্টদেরকে নির্দিষ্ট করার জন্য কোড লেখার দায়িত্ব দেওয়া হয় না কিন্তু এমন জিনিসগুলি আবিষ্কার করা যা কেউ তাদের দেখায়নি।
ফলাফলের বিস্তার নিজেই তথ্যপূর্ণ। প্রজেক্টের লিখন অনুসারে পরীক্ষায় প্রায় প্রতিটি মডেল একই মূল বিজয়ী ধারণা খুঁজে পেয়েছে — যা সেরা রানগুলিকে আলাদা করেছে তা হল একটি পরীক্ষা যা রেখে যায়: শক্তিশালী এজেন্টরা তাদের যাচাই করার জন্য যথেষ্ট পরিমাণে শোরগোল ফলাফলে দুর্বল সংকেতগুলি সংরক্ষণ করে এবং তাদের নিজস্ব পরীক্ষামূলক ডেটা আরও ভালভাবে বুঝতে পেরেছিল।
সম্প্রদায়ের পক্ষ থেকে সতর্কতা
হ্যাকার নিউজ মন্তব্যকারীরা ন্যায্য পদ্ধতিগত পয়েন্ট উত্থাপিত. মডেল জুড়ে প্রচেষ্টার সেটিংস এবং জোতা বিভিন্ন রকমের — Fable 5 একটি উচ্চ যুক্তির সেটিংয়ে চলে যখন Opus 5 সর্বোচ্চ তে চলে — এবং 18টি মডেল জুড়ে 153 রানের পাটিগণিত বোঝায় কিছু মডেল অন্যদের তুলনায় বেশি প্রচেষ্টা পেয়েছে৷ একটি মডেলের র্যাঙ্কিং তার অশোধিত গবেষণার ক্ষমতাকে প্রতিফলিত করে বা এর জোতার গুণমান একটি উন্মুক্ত প্রশ্ন থেকে যায়।
তারপরও ভ্রমণের দিকটা পরিষ্কার। যখন দ্রুততম মানব হাতগুলি বর্তমান রেকর্ডে পৌঁছানোর জন্য বহু বছরের সম্মিলিত প্রচেষ্টা নিয়েছিল, তখন সেরা স্বায়ত্তশাসিত এজেন্টরা এখন গণনা সময়ের এক সপ্তাহের কিছু বেশি সময়ের মধ্যে সেই ব্যবধানের বেশিরভাগই বন্ধ করে দিচ্ছে। পরবর্তী প্রশ্ন - কোন মডেল বাকি 18.3 শতাংশ বন্ধ করতে পারে কিনা - প্রত্যাশার চেয়ে তাড়াতাড়ি উত্তর দেওয়া যেতে পারে।
AI এর সীমানা গঠনের মানদণ্ড এবং গবেষণা সম্পর্কে আরও জানতে, AI Buzz Wire-এর অব্যাহত কভারেজ অনুসরণ করুন।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →