যখন একটি বড় ভাষা মডেল পঞ্চম গ্রেডের বাইরে উপাদান দেখতে পায় না তখন কী ঘটে? সাতজন গবেষকের একটি দল আক্ষরিক অর্থেই সেই প্রশ্নের উত্তর দিয়েছে: তারা লিটললার্নার তৈরি করেছে, একটি 5-বিলিয়ন-প্যারামিটার LLM স্ক্র্যাচ থেকে প্রশিক্ষিত একটি কর্পাস থেকে মার্কিন প্রাথমিক-স্কুল পাঠ্যক্রমে ফিল্টার করা হয়েছে, এবং তারপর পরীক্ষা করেছে যে কিছু আছে কিনা — আরও পরামিতি, আরও বেশি-প্রশিক্ষণ-পরবর্তী, চতুরতার অতীতের ডেটা প্রম্পট করতে পারে। উত্তর, তারা রিপোর্ট, না.
গবেষণাপত্র, "লিটললার্নার: ল্যাঙ্গুয়েজ মডেলস আন্ডার পেডাগোগিক্যালি-কন্ট্রোলড নলেজ এক্সপোজার," ফানফেই লি, জনা জেলার, ম্যানুয়েল প্রাদা-করাল, থাডাউস উইডেমার, প্রসন্ন মায়িলভাহানন, রায়ান কোটেরেল এবং উইল্যান্ড ব্যারেনডেল 13 আগস্ট arXiv-এ জমা দিয়েছেন। 16 অগাস্টের মধ্যে এটি 200 টিরও বেশি আপভোট সহ একটি দ্রুত-আরোহণকারী হ্যাকার নিউজ আলোচনার বিষয় ছিল, কারণ গবেষক এবং অনুশীলনকারীরা বিতর্ক করেছিলেন যে এটি শিল্পের প্রিয় অনুমানের জন্য কী বোঝায় — যে-প্রশিক্ষণ-পরবর্তী ক্ষমতাগুলিকে পাতলা বাতাস থেকে বের করে দিতে পারে। আমরা আমাদের এআই গবেষণা কভারেজ এ ঠিক যে ধরনের সতর্কতামূলক, বিপরীত পরীক্ষা দেখি।
একটি জ্ঞান সীমানা সহ একটি স্যান্ডবক্স
আধুনিক এলএলএমগুলিকে মূলত সবকিছুর উপর প্রশিক্ষিত করা হয়, যা প্রশিক্ষণের সময় একটি প্রদর্শিত দক্ষতা সত্যিকার অর্থে শেখা হয়েছিল নাকি সঠিক প্রম্পটের মাধ্যমে এটি অর্জন করা হয়েছিল তা বলা প্রায় অসম্ভব করে তোলে। দলের সমাধান ছিল প্রশিক্ষণ বিতরণ নিজেই সীমাবদ্ধ করা। FineWeb-Edu থেকে শুরু করে, তারা একটি 88-বিলিয়ন-টোকেন কর্পাস ডিস্টিল করেছে — যাকে লিটল কারিকুলাম বলা হয়েছে — একটি পাঁচ-পর্যায়ের ফিল্টারিং পাইপলাইনের মাধ্যমে গ্রেড 5 পর্যন্ত কিন্ডারগার্টেনের জন্য সাধারণ মূল মানগুলির সাথে সংযুক্ত।
এই কর্পাসে তারা স্ক্র্যাচ থেকে তিনটি স্কেলে (0.6B, 1.3B, এবং 5B প্যারামিটার) মডেলগুলিকে প্রশিক্ষিত করেছে, প্রতিটি একই স্থাপত্য এবং টোকেন বাজেটের সাথে আনফিল্টারড ডেটাতে প্রশিক্ষিত মিলিত নিয়ন্ত্রণ মডেলের পাশাপাশি পাঠানো হয়েছে। ফলাফল হল এমন একটি মডেল যা ওপেন-এন্ডেড মূল্যায়নের জন্য যথেষ্ট সাবলীল — আপনি একটি ব্রাউজারে একটি হোস্ট করা 5B সংস্করণের সাথে চ্যাট করতে পারেন — তবুও একটি তীক্ষ্ণ, ব্যাখ্যাযোগ্য জ্ঞানের সীমানা রয়েছে: যদি এটি প্রাথমিক পাঠ্যক্রমের মধ্যে না থাকে তবে মডেলটি কখনই এটি দেখতে পায়নি৷
এলিটেশন, অধিগ্রহণ নয়
মূল অনুসন্ধানটি ভোঁতা: মডেলগুলিকে আরও স্মার্ট করে তোলার জন্য আদর্শ টুলকিট লিটললার্নার ইতিমধ্যে যা জানত তা বিবর্ধিত করেছে, কিন্তু এর কোনোটিই সুযোগের বাইরের কর্মক্ষমতাকে অর্থপূর্ণভাবে উন্নত করেনি।
স্কেলিং মডেলের নিয়ন্ত্রিত জ্ঞানের মধ্যে নির্ভুলতা উন্নত করেছে এবং একই শিক্ষার গতিপথে বিনয়ীভাবে প্রসারিত হয়েছে, কিন্তু গ্রেড-5 উপাদানের বাইরে সক্ষমতার প্রয়োজনের সমস্যাগুলির জন্য খুব কমই করেছে। GRPO-এর সাথে প্রশিক্ষণ-পরবর্তী — যুক্তি-মডেল বুমের পিছনে শক্তিবৃদ্ধি-শিক্ষার পদ্ধতি — উল্লেখযোগ্যভাবে ইন-স্কোপ K-5 ক্ষমতাগুলিকে বাড়িয়েছে, তবুও সুযোগের বাইরের ডেটা দিয়ে প্রশিক্ষিত হওয়া সত্ত্বেও K-5 ক্ষমতার বাইরে পুনরুদ্ধার করতে ব্যর্থ হয়েছে। এবং প্রেক্ষাপটে শিক্ষা, জ্ঞানকে একটি প্রম্পটে স্টাফ করার প্রতিদিনের জাদু, মডেলটিকে যা ছিল তা ব্যবহার করতে সাহায্য করেছে কিন্তু সীমানার বাইরে নতুন যুক্তি আনলক করেনি।সংক্ষেপে প্রিট্রেইনিং ফিল্টার কার্যকর ক্ষমতা সিলিং সেট করে। লেখকরা ফলাফলটিকে একটি পার্থক্যের প্রমাণ হিসাবে তৈরি করেছেন যে ক্ষেত্রটি ক্রমাগত ঝাপসা হয়ে যায়: প্রশিক্ষণ-পরবর্তী এবং প্রম্পটিং প্রকাশ; pretraining অর্জন করে।
পরিচ্ছন্ন নিয়ন্ত্রণ, পাবলিক চেকপয়েন্ট
কর্মপদ্ধতি হল যা দাবিগুলিকে তাদের শক্তি দেয়৷ কারণ প্রতিটি LittleLearner মডেল একটি মিলে যাওয়া আনফিল্টারড কন্ট্রোলের সাথে পাঠানো হয় — একই স্থাপত্য, একই টোকেন গণনা, একই প্রশিক্ষণের রেসিপি — দলটি একা পাঠ্যক্রম ফিল্টারে যেকোনো আচরণগত পার্থক্যকে দায়ী করতে পারে। MathCAMPS বেঞ্চমার্কে প্রশিক্ষণ-পরবর্তী গণিত বিশেষজ্ঞরা গবেষকদের স্কুলের গ্রেড অনুসারে পারফরম্যান্স গ্রেড করতে দেয়, যেখানে ইন-স্কোপ ক্ষমতা শেষ হয় তা ঠিক করে। এবং বেশিরভাগ ফ্রন্টিয়ার পেপারের বিপরীতে, সবকিছুই সর্বজনীন: HuggingFace-এর তিনটি স্কেলে কর্পাস, বেস এবং পোস্ট-প্রশিক্ষিত চেকপয়েন্ট এবং একটি হোস্ট করা চ্যাট ডেমো, তাই স্বাধীন দলগুলি নিজেরাই সীমানা তদন্ত করতে পারে।
সেই উন্মুক্ততা হ্যাকার নিউজ বিতর্কে ইন্ধন জোগাচ্ছে। মন্তব্যকারীরা হোস্ট করা মডেলের আচরণকে তার জ্ঞানের প্রান্তে পরীক্ষা করে দেখছে — এটি পরিহার করে, অনুমান করে বা হ্যালুসিনেট করে যখন গ্রেড 5-এ ঠেলে দেয় — এবং এর প্রভাব নিয়ে তর্ক করে: কেউ কেউ ফলাফলগুলিকে যুক্তি-মডেল হাইপের জন্য খারাপ খবর হিসাবে পড়েন, অন্যরা উল্লেখ করেন যে ওয়েব-স্কেল প্রিট্রেইনিং ডেটাতে সামনের মডেলের ধারণার তুলনায় অনেক বেশি কিছু রয়েছে। অনুরূপভাবে উচ্চতর। কাগজের লেখকরা নিজেরাই এই বিষয়ে সতর্ক: তাদের দাবি একটি পরিচিত, নিয়ন্ত্রিত শিক্ষা সহ একটি মডেলের জন্য স্ট্যান্ডার্ড হস্তক্ষেপগুলি কী করতে পারে না, ফ্রন্টিয়ার ল্যাব সম্পর্কে সরাসরি ভবিষ্যদ্বাণী নয়।
কেন এটা ক্লাসরুমের বাইরে গুরুত্বপূর্ণ
পরীক্ষাটি AI-তে সরাসরি বিতর্কের সাথে কথা বলে। এআই ল্যাবগুলি প্রশিক্ষন-পরবর্তী পদ্ধতিতে বিলিয়ন বিলিয়ন ব্যয় করে এই ধারণার উপর ভিত্তি করে যে শক্তিবৃদ্ধি শিক্ষা একটি বেস মডেলকে তার কাঁচা ক্ষমতার বাইরে ঠেলে দিতে পারে। LittleLearner পরামর্শ দেয় যে এই লাভগুলি মূলত এর মধ্যেই থাকতে পারে — এবং এর দ্বারা আবদ্ধ হতে পারে — যা প্রিট্রেইনিং ডেটা সমর্থন করে৷ এটি ডেটা কিউরেশন সম্পর্কে আরও বেশি যত্ন নেওয়ার এবং সংশয়বাদের সাথে "উত্থানকালীন" প্রশিক্ষণ-পরবর্তী ক্ষমতার দাবির চিকিত্সার জন্য একটি যুক্তি।
রিলিজটি একটি প্রকৃত গবেষণার উপকরণ, শুধু একটি কাগজ নয়। দলটি লিটল কারিকুলাম এবং সমস্ত মডেলের চেকপয়েন্টগুলিকে প্রকাশ্যে প্রকাশ করেছে, এবং প্রকল্পের পৃষ্ঠাটি স্যান্ডবক্স সক্ষম করা পরীক্ষাগুলিকে স্কেচ করে: RL এটিকে পুরস্কৃত করার পরিবর্তে সত্যিকারের ক্ষমতা তৈরি করতে পারে কিনা, কীভাবে নমুনা-দক্ষতার সাথে একটি মডেল একটি সত্যিকারের নতুন ধারণা যেমন নেতিবাচক সংখ্যাগুলি চালু করার সময় শেখে, এবং মেশিন এবং বাচ্চাদের অনুরূপ এক্সপোজারের প্রয়োজন — একই রকম ভুল শেখার সময়।
একটি ক্ষেত্রের জন্য যা খুব কমই পরিষ্কার নিয়ন্ত্রণ পায়, একটি স্পষ্টভাবে নির্দিষ্ট শিক্ষা সহ একটি মডেল একটি বিরল উপহার। এবং অন্য সকলের জন্য, এটি ডেস্কের উপরে পিন করা একটি অনুস্মারক: কোন মডেল — বা ব্যক্তি — তাদের যা শেখানো হয়নি তা থেকে বেরিয়ে আসতে পারে না৷
এআই থেকে এগিয়ে থাকুন
গবেষণার পিয়ার-রিভিউ-গ্রেড কভারেজ AI রিশেপিং, প্রতিদিন বিতরণ করা হয়। সর্বশেষ AI উন্নয়ন এর জন্য আমাদের হাব বুকমার্ক করুন।
আরও এআই খবর পড়ুন →