AMD Instella-MoE-16B-A3B প্রকাশ করেছে, একটি সম্পূর্ণ উন্মুক্ত মিক্সচার-অফ-এক্সপার্টস (MoE) ভাষার মডেল যা স্ক্র্যাচ থেকে প্রশিক্ষিত Instinct MI300X এবং MI325X GPUs। রিলিজটি সিলিকন সম্পর্কে যতটা বিবৃতি সফ্টওয়্যার সম্পর্কে: প্রতিটি প্রশিক্ষণের পর্যায়, ডেটা মিশ্রণ এবং কনফিগারেশন প্রকাশ করে, AMD প্রদর্শন করছে যে তার ডেটা-সেন্টার এক্সিলারেটরগুলি প্রান্ত থেকে শেষ পর্যন্ত সীমানা-শ্রেণীর উন্মুক্ত মডেলগুলি তৈরি করতে পারে — এনভিডিয়া দীর্ঘদিন ধরে আধিপত্য বিস্তার করেছে। এটি আমাদের ব্রেকিং এআই নিউজ এ ট্র্যাক করা ওপেন-ওয়েট রেসের মধ্যে একটি আরও সুস্পষ্ট পদক্ষেপ।

বিশেষজ্ঞদের ডিজাইনের একটি ছোট-কিন্তু প্রশস্ত মিশ্রণ

MarkTechPost-এ একটি বিশদ বিভাজন অনুসারে, Instella-MoE-16B-A3B হল একটি ডিকোডার-শুধুমাত্র MoE মডেল যার 16 বিলিয়ন মোট প্যারামিটার রয়েছে যা প্রতি টোকেন মাত্র 2.8 বিলিয়ন সক্রিয় করে। এর 27টি স্তরের প্রতিটিতে 2048 এর লুকানো আকার, 16টি মনোযোগের মাথা এবং একটি 128,896-টোকেন শব্দভাণ্ডার সহ 2 ভাগ করা বিশেষজ্ঞ এবং 64 জনের একটি পুল থেকে নির্বাচিত 6 রাউটেড বিশেষজ্ঞ ব্যবহার করা হয়েছে। একটি মাল্টি-টোকেন ভবিষ্যদ্বাণী** উদ্দেশ্য প্রাক-প্রশিক্ষণ এবং মধ্য-প্রশিক্ষণ উভয় সময়েই ব্যবহৃত হয়।

সেই বিক্ষিপ্ত স্থাপত্য - যেখানে প্রতিটি টোকেনের জন্য নেটওয়ার্কের একটি ছোট টুকরো "জাগে" - সস্তা-টু-চালিত ওপেন মডেলগুলির পিছনে একই দক্ষতার যুক্তি যা গত বছর ধরে বাজারকে নতুন আকার দিয়েছে৷ AMD মডেলটিকে নিমোট্রন-CC-v2, MegaMath, FineMath, RefineCode, এবং TxT360 সহ খোলা কর্পোরা থেকে আঁকা 7.1 ট্রিলিয়ন টোকেন-এর উপর প্রশিক্ষিত করেছে, তারপর Dolma3 ডলমিনো 100B-তে একটি মধ্য-প্রশিক্ষণের পর্যায় চালিয়েছে যা তিনটি ডেটা ভেরিয়েন্ট জুড়ে একত্রিত করা হয়েছে। ইয়াআরএন ব্যবহার করে একটি দীর্ঘ-প্রসঙ্গ পর্যায় উইন্ডোটিকে 4K থেকে 64K টোকেন পর্যন্ত প্রসারিত করে।

দুটি সিস্টেম-স্তরের উদ্ভাবন

রিলিজ দুটি কাঠামোগত পছন্দ বহন করে যা AMD অর্থপূর্ণ ইঞ্জিনিয়ারিং জয় হিসাবে হাইলাইট করে। প্রথমটি হল গেটেড মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন (গেটেড এমএলএ), যা মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশনে একটি লাইটওয়েট শেখা আউটপুট গেট যোগ করে। একটি ডেডিকেটেড লিনিয়ার প্রজেকশন একটি ইনপুট-কন্ডিশন্ড গেট প্রাপ্ত করে যা আউটপুট প্রজেকশনের আগে গুণগতভাবে প্রয়োগ করা হয়।

দ্বিতীয়টি, FarSkip-Collective, একটি সংযোগ স্কিম যা MoE এবং মনোযোগ স্তরগুলিতে পুরানো এবং আংশিক সক্রিয়করণ পাস করে, গণনার সাথে বিশেষজ্ঞ-সমান্তরাল যোগাযোগকে ওভারল্যাপ করে। বিশেষজ্ঞ সমান্তরালতার সাথে পরিবেশন করার সময় AMD একটি 12.7% প্রি-ট্রেনিং স্পিডআপ এবং প্রথম টোকেন করার সময় 39.2% পর্যন্ত হ্রাসের রিপোর্ট করে। দাম-পারফরম্যান্সের উপর তার হার্ডওয়্যার পিচ করার জন্য একটি কোম্পানির জন্য, এই সংখ্যাগুলি একজন ক্রেতা দেখতে চায়।

একটি সম্পূর্ণ উন্মুক্ত মডেলের জন্য শক্তিশালী বেঞ্চমার্ক

বেস চেকপয়েন্টে, মূল্যায়ন জুড়ে Instella-MoE গড় 76.7, যেটিকে AMD সম্পূর্ণ উন্মুক্ত মডেলগুলির মধ্যে সবচেয়ে শক্তিশালী ফলাফল বলে। এটি এটিকে মুনলাইট-16B-A3B (76.2), SmolLM3-3B-বেস (70.5), OLMO-3-7B (70.1), এবং OLMoE-1B-7B (61.9) থেকে এগিয়ে রাখে, যদিও এটি এখনও Qwen3.5-4B-বেস (79.5) এর পিছনে রয়েছে। এটি উইনোগ্রান্ডে 86.5 স্কোর নিয়ে এবং HumanEval+ এ 65.7 স্কোর নিয়ে এগিয়ে রয়েছে। দীর্ঘ-প্রসঙ্গ কাজের জন্য, এটি হেলমেটে গড় 41.5 এবং RULER-এ 79.4।

পোস্ট-ট্রেনিং মডেলটিকে আরও তীক্ষ্ণ করে। গড় স্কোর 71.58 থেকে তত্ত্বাবধানে ফাইন-টিউনিংয়ের পরে 72.67 এবং "থিঙ্ক" কনফিগারেশনে 73.22-এর পরে Olmo3-7B-থিঙ্ক (71.97), জেমা-4-E4B থিঙ্ক (70.47), এবং Qwen3.3.75) কে পরাজিত করে৷ নির্দেশ-অনুসরণ করে, IFEval 77.08 থেকে 83.70-এ বেড়ে যায়।

প্রশিক্ষণ পরবর্তী রেসিপি নিজেই উল্লেখযোগ্য। Dolci-Think-SFT-7B এবং Nemotron মিশ্রণে SFT-এর পরে, AMD রাউটার বায়াস আপডেটের সাথে DPO চালায় এবং অধঃপতন এড়াতে সহায়ক লোড-ব্যালেন্সিং লস অক্ষম করে। রিইনফোর্সমেন্ট লার্নিং তখন AMD-এর মাইল ফ্রেমওয়ার্ক-এর মধ্যে এগিয়ে যায়: নির্দেশনা-অনুসরণকারী RLVR-এর 1,400 ধাপ, তারপরে মাল্টি-টিচার অন-পলিসি ডিস্টিলেশন যা গণিত বা কোড পারফরম্যান্সকে বিসর্জন না করেই লাভকে ফিরিয়ে আনে।

লাইসেন্সিং ক্যাচ

একটি সতর্কতা আছে যা বাণিজ্যিক ব্যবহারকারীদের জন্য গুরুত্বপূর্ণ। মডেলের ওজন রিসার্চরাইল লাইসেন্সের অধীনে পাঠানো হয়, যা শুধুমাত্র একাডেমিক এবং গবেষণার উদ্দেশ্যে ব্যবহার সীমাবদ্ধ করে, তাই Instella-MoE উৎপাদন স্থাপনার জন্য ড্রপ-ইন মডেল নয়। প্রশিক্ষণ কোডবেস, তবে, MIT লাইসেন্সযুক্ত, এবং এটি তর্কযোগ্যভাবে আরও পুনঃব্যবহারযোগ্য সম্পদ — এটি অন্যান্য ল্যাবগুলিকে AMD সিলিকনের প্রশিক্ষণের জন্য একটি কংক্রিট ব্লুপ্রিন্ট দেয়।

AMD প্রতিটি প্রশিক্ষণের পর্যায় থেকে সম্পূর্ণ ওজন, ডেটা মিশ্রণ, প্রশিক্ষণ কনফিগারেশন এবং একটি আলিঙ্গন মুখ সংগ্রহ, একটি GitHub সংগ্রহস্থল এবং এর ROCm ব্লগ জুড়ে অনুমান কোড প্রকাশ করেছে। উন্মুক্ততার সেই স্তর — প্রশিক্ষণ-পর্যায়-দ্বারা-প্রশিক্ষণ-পর্যায়, শুধুমাত্র একটি চূড়ান্ত চেকপয়েন্ট নয় — যা একটি সাধারণ ওপেন-ওয়েট থেকে একটি "সম্পূর্ণ উন্মুক্ত" মুক্তিকে আলাদা করে।

কেন এটি মানদণ্ডের বাইরে গুরুত্বপূর্ণ

রিলিজের সাবটেক্সট হল হার্ডওয়্যার প্রতিযোগিতা। এনভিডিয়ার CUDA ইকোসিস্টেম এবং H100-শ্রেণির জিপিইউগুলি ফ্রন্টিয়ার মডেল প্রশিক্ষণের জন্য ডিফল্ট সাবস্ট্রেট, এবং চ্যালেঞ্জাররা তাদের এক্সিলারেটরগুলি সম্পূর্ণ প্রশিক্ষণ স্ট্যাক পরিচালনা করতে পারে তা প্রমাণ করার জন্য বছরের পর বছর কাটিয়েছে। Instella-MoE হল একটি বিশ্বাসযোগ্য আর্টিফ্যাক্ট যা AMD এর Instinct লাইন — ইতিমধ্যে হাইপারস্কেলার এবং ন্যাশনাল ল্যাব দ্বারা স্কেলে মোতায়েন করা হয়েছে — অনুমান কাজের চাপের চেয়ে বেশি কিছু করতে পারে। যদি AMD তার নিজস্ব হার্ডওয়্যারে প্রশিক্ষিত প্রতিযোগিতামূলক উন্মুক্ত মডেলগুলি উত্পাদন চালিয়ে যেতে পারে তবে এটি AI কম্পিউট বাজারে এনভিডিয়ার দখল ভাঙতে চাওয়া ক্রেতাদের ক্ষেত্রে কেস শক্তিশালী করে।

গবেষকদের কাছে আবেদন হলো স্বচ্ছতা। সম্পূর্ণরূপে উন্মুক্ত রিলিজ যা তথ্য মিশ্রণ, মধ্য-প্রশিক্ষণের মিশ্রণ, পাতন কৌশল এবং RL পাঠ্যক্রমের নথিভুক্ত করে বিরল, এবং তারা সম্প্রদায়কে এর জন্য ল্যাবের শব্দ নেওয়ার পরিবর্তে দাবিগুলি অডিট এবং পুনরুত্পাদন করতে দেয়। Instella-MoE একটি ছোট কিন্তু ক্রমবর্ধমান রোস্টারে যোগ দিয়েছে — এএমডি-এর নিজের আগের Instella ঘন মডেলগুলি সহ — সেই মানকে এগিয়ে নিয়ে যাচ্ছে।

এআই থেকে এগিয়ে থাকুন

এটি ঘটতে এই ধরনের গভীর প্রযুক্তিগত কভারেজ চান? সর্বশেষ AI উন্নয়ন এর জন্য আমাদের হাব বুকমার্ক করুন এবং কোনো রিলিজ মিস করবেন না।

আরও এআই খবর পড়ুন →