একটি নতুন ওপেন-সোর্স প্রকল্প মেশিন লার্নিংয়ের একগুঁয়ে সীমাবদ্ধতা মোকাবেলার জন্য মনোযোগ আকর্ষণ করছে: একটি ভাষা মডেল তৈরি করা যা শেখা বন্ধ করে না। মিনি-এজিআই নামে পরিচিত, প্রকল্পটি নিজেকে একটি ক্রমাগত শিক্ষা, বাইট-স্তরের ভাষা মডেল হিসাবে বর্ণনা করে যা তার নিজস্ব আর্কিটেকচারকে একত্রিত করে, 8GB VRAM সহ একটি একক GPU-তে স্ক্র্যাচ থেকে প্রশিক্ষণ দেয় এবং এটি যা পড়ে তা থেকে শিখতে থাকে।
প্রকল্পটি সপ্তাহান্তে হ্যাকার নিউজে উপস্থিত হয়েছিল, যেখানে এটি একশোর বেশি পয়েন্টে পৌঁছেছে এবং GitHub-এ এর সংগ্রহস্থল MIT লাইসেন্সের অধীনে প্রকাশিত হয়েছে। প্রকল্পের README অনুসারে, লক্ষ্য হল যে ডেটার একটি একক প্রবাহ থেকে ক্রমাগত শিক্ষা — বিপর্যয়কর ভুলে যাওয়া ছাড়া — এমনকি বিনয়ী, ভোক্তা-গ্রেড হার্ডওয়্যারেও সম্ভব। For more context on this story, see our ongoing breaking AI news.
ডিস্কে ওজন, VRAM-এ নয়
মিনি-এজিআই-এর পিছনে কেন্দ্রীয় কৌশল হল একটি অপ্রচলিত মেমরি ম্যানেজমেন্ট স্কিম। জিপিইউ মেমরিতে সমস্ত মডেলের প্যারামিটার রাখার পরিবর্তে, সিস্টেমটি তার ওজনগুলিকে ডিস্কে সাধারণ ফাইল হিসাবে সঞ্চয় করে এবং প্রয়োজন অনুসারে গ্রাফিক্স কার্ডে পেজ করে।
এই নকশা পছন্দের একটি উল্লেখযোগ্য পরিণতি রয়েছে: মডেলের পরামিতি গণনা VRAM এর পরিবর্তে মুক্ত ডিস্ক স্থান দ্বারা আবদ্ধ। README বলে যে মডেলটি প্রশিক্ষণের সময় নতুন ক্ষমতা বৃদ্ধি করতে পারে যখন এটি ছোট হয়, এবং এমন ক্ষমতা ছাঁটাই করে যা কিছুই চাইবে না। প্রশিক্ষণ এবং অনুমান ঠিক একই কোড পাথের মধ্য দিয়ে চলে, তাই আলাদা কোন ফাইন-টিউনিং ব্যবস্থা নেই এবং কোন হিমায়িত বেস মডেল নেই — পড়া এবং প্রশিক্ষিত হওয়া, প্রকল্পের ভাষায়, একই ঘটনা।
সিস্টেমটি অন্তত একটি 8GB VRAM GPU সহ একটি PC বা ল্যাপটপে লক্ষ্য করা হয়েছে, হার্ডওয়্যার যা অনেক ডেভেলপার ইতিমধ্যেই মালিক৷
কেন ক্রমাগত শেখা কঠিন
বর্তমানে উপলব্ধ বেশিরভাগ ভাষা মডেল একই জীবনচক্র অনুসরণ করে: একটি ল্যাব একটি মডেলকে প্রশিক্ষণ দেয়, এটিকে হিমায়িত করে এবং এটি প্রেরণ করে। ব্যবহারকারীরা প্রান্তের চারপাশে সূক্ষ্ম-টিউন করতে পারে, কিন্তু ভিত্তি ওজন আর কখনও পরিবর্তন হয় না। প্রকল্পের অনুপ্রেরণা বিভাগ যুক্তি দেয় যে এটি প্রতিটি ব্যক্তিগত মালিকানাধীন মডেলকে "আপনার উপরে একটি পাতলা স্তর সহ অন্য কারো মডেল" করে তোলে - যা জাহাজে যাওয়ার দিন শেখা বন্ধ করে দেয়।
মেশিন লার্নিং গবেষণায় প্রতিবন্ধকতা একটি সুপরিচিত: বিপর্যয়কর ভুলে যাওয়া, নতুন ডেটার উপর প্রশিক্ষণের সময় পূর্বে শেখা জ্ঞানকে ওভাররাইট করার প্রবণতা নিউরাল নেটওয়ার্কের। একটি মডেল যা প্রতিদিনের তথ্যের প্রবাহ থেকে ক্রমাগত শিখে থাকে তা সাধারণত আগে যা জানত তার সবকিছুর অবনতি হয়।
README সেই সীমাবদ্ধতার রূপরেখা দেয় যা নকশাকে আকার দেয়। মডেলটিকে 8GB VRAM-এর সাথে মানানসই করতে হবে — কোয়ান্টাইজেশনের সাথে নয়, যেহেতু প্রশিক্ষণের জন্য গ্রেডিয়েন্ট এবং অপ্টিমাইজার স্টেট প্রয়োজন যা ওজনের মেমরির প্রায় তিনগুণ যোগ করে। এবং এটিকে ভুলে যাওয়া উচিত নয়, পাঠ্যের একটি অবিরাম প্রবাহ থেকে নতুন উপাদান শোষণ করার সময় এটি ইতিমধ্যে যা শিখেছে তা ধরে রাখা।
একটি বাইট-স্তরের মডেল যা নিজেকে তৈরি করে
মিনি-এজিআই টোকেনের পরিবর্তে বাইট স্তরে কাজ করে, অক্ষরের একটি স্ট্রীম এক সময়ে এক খণ্ড পড়া এবং প্রতিটি খণ্ডে একটি গ্রেডিয়েন্ট পদক্ষেপ নেয়। প্রজেক্টটি আরও বলে যে মডেলটি "নিজস্ব স্থাপত্যকে একত্রিত করে," এটিকে প্রচলিত মডেল থেকে আলাদা করে যার গঠন প্রশিক্ষণ শুরু হওয়ার আগে তাদের নির্মাতাদের দ্বারা স্থির করা হয়।
পদ্ধতিটি ইচ্ছাকৃতভাবে পরীক্ষামূলক। এটি একটি প্রশিক্ষণ ব্যবস্থার একটি ছোট আকারের প্রদর্শন, সীমান্ত ব্যবস্থার জন্য একটি চ্যালেঞ্জ নয়।
গুরুত্বপূর্ণ সতর্কতা
প্রকল্পের লেখক সিস্টেমের বর্তমান অবস্থা সম্পর্কে স্পষ্ট। README এর নিজের ভাষায়, মিনি-এজিআই হল "একটি ছোট খেলনা-স্তরের মডেল," এবং পাঠকদের সীমান্ত-স্তরের ক্ষমতা আশা করা উচিত নয়৷ অনুশীলনের মূল বিষয় হল বিপর্যয়কর ভুলে যাওয়া ছাড়াই একটি একক ডেটা স্ট্রীম থেকে ক্রমাগত শেখা একেবারেই সম্ভব - এবং হার্ডওয়্যারেও সম্ভব যা প্রায় যে কেউ অ্যাক্সেস করতে পারে।
মডেলের ওজন এখনও প্রকাশিত হয়নি। ট্রেনিং রানটি এখনও যে কর্পাস থেকে শিখছে তার প্রথম পাসটি সম্পূর্ণ করছে এবং লেখক বলেছেন যে পাসটি সম্পূর্ণ হয়ে গেলে ওজন প্রকাশ করা হবে, যা বর্তমান হারে কয়েক সপ্তাহ দূরে। ততক্ষণ পর্যন্ত, পর্যবেক্ষকরা প্রকল্পের পৃষ্ঠায় প্রশিক্ষণের ইতিহাস থেকে নমুনাগুলি পরীক্ষা করে দেখতে পারেন যে পড়ার সময় মডেলটি কীভাবে উন্নত হয়েছে।
কেন এটা গুরুত্বপূর্ণ
যদি পদ্ধতিটি মডেলের স্কেলগুলিকে আরও সক্ষম আকারে ধারণ করে, তবে এটি একটি ভিন্ন ধরণের AI মালিকানার দিকে নির্দেশ করে: ব্যক্তিগত মডেলগুলি যেগুলি আপনার নিজের মেশিনে বাস করে, আপনি তাদের খাওয়ানো নথি এবং ডেটা থেকে শিখতে থাকুন এবং বিক্রেতার প্রকাশের সময়সূচীর দ্বারা কখনই তাদের ওজন হিমায়িত করবেন না৷
প্রকল্পটি একটি অনুস্মারক যে AI-তে সমস্ত আকর্ষণীয় কাজ সীমান্তে ঘটছে না। একটি একক ভোক্তা GPU, সাধারণ ডিস্ক স্পেস এবং একটি MIT লাইসেন্স সহ, মিনি-এজিআই এমন একটি প্রশ্নের উত্তর দেওয়ার চেষ্টা করছে যেটি বড় ল্যাবগুলিকে অনেকাংশে পাশ কাটিয়ে গেছে — লোকেরা যেভাবে করে তা শিখতে একটি মডেল তৈরি করা যেতে পারে কিনা: ক্রমাগত, পরবর্তী যা কিছুর মুখোমুখি হয় তা থেকে।
কোড এবং ডকুমেন্টেশনগুলি GitHub-এ সামঞ্জস্যপূর্ণ হার্ডওয়্যার সহ যেকোনও ব্যক্তির জন্য উপলব্ধ রয়েছে যারা অনুসরণ করতে চান, প্রকল্পটি কাঁটাচামচ করতে চান বা মডেলটিকে উপযুক্ত বলে প্রশিক্ষণ দিতে চান।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →