জার্মান গবেষণা প্রতিষ্ঠান এবং AI কোম্পানিগুলির একটি কনসোর্টিয়াম Soofi S 30B-A3B প্রকাশ করেছে, একটি উন্মুক্ত ভাষার মডেল যা প্রকল্পটি বলে যে সম্পূর্ণ উন্মুক্ত মডেলগুলির মধ্যে ইংরেজি এবং জার্মান উভয় বেঞ্চমার্কে সর্বোচ্চ স্কোর অর্জন করে৷ জার্মানির জাতীয় AI অ্যাসোসিয়েশন KI Bundesverband দ্বারা সমন্বিত, রিলিজটি মিউনিখের ডয়েচে টেলিকমের ইন্ডাস্ট্রিয়াল এআই ক্লাউডে সম্পূর্ণভাবে প্রশিক্ষিত প্রথম বৃহৎ ভাষার মডেলগুলির মধ্যে একটি এবং এটি প্রভাবশালী মার্কিন যুক্তরাষ্ট্র এবং চীনা ওপেন-ওয়েট রিলিজের জন্য একটি সার্বভৌম ইউরোপীয় বিকল্প হিসাবে অবস্থান করছে। ডেভেলপারদের জন্য সর্বশেষ AI ডেভেলপমেন্ট ট্র্যাক করা, স্থাপত্যের মধ্যে বেকড অস্বাভাবিক দক্ষতা এবং ভাষা ফোকাসের তুলনায় কাঁচা স্কেলের জন্য লঞ্চটি কম উল্লেখযোগ্য।
শুধুমাত্র 3.2 বিলিয়ন সক্রিয় প্যারামিটার সহ একটি হাইব্রিড ডিজাইন
Soofi S হল একটি মিক্সচার-অফ-এক্সপার্টস (MoE) মডেল যার মোট 31.6 বিলিয়ন প্যারামিটার রয়েছে, কিন্তু এটি প্রতি জেনারেটেড টোকেনে মাত্র 3.2 বিলিয়ন সক্রিয় করে। এটি একটি প্রচলিত 30-বিলিয়ন-প্যারামিটার ঘন মডেলের তুলনায় একটি 3-বিলিয়ন-প্যারামিটার মডেলের কম্পিউট খরচের কাছাকাছি রাখে, বিদেশী ক্লাউড সরবরাহকারীদের উপর নির্ভর না করে ইউরোপীয় পরিকাঠামোতে চালানোর জন্য যথেষ্ট সস্তা অনুমান রাখার লক্ষ্যে একটি ডিজাইন পছন্দ।
স্থাপত্যটি এনভিডিয়ার নিমোট্রন 3 ন্যানো থেকে ধার করা হয়েছে, একটি হাইব্রিড বিন্যাসে মানক মনোযোগ স্তরের সাথে Mamba-2 স্তরগুলিকে একত্রিত করে। প্রকল্পের প্রাক-প্রশিক্ষণ প্রতিবেদন অনুসারে, মডেলের 52টি স্তরের মধ্যে মাত্র 6টি একটি কী-মান (KV) ক্যাশে বজায় রাখে - মেমরি কাঠামো যা মনোযোগ গণনার জন্য আগের টোকেন সংরক্ষণ করে। প্রচলিত ট্রান্সফরমারগুলিতে, সেই ক্যাশে প্রসঙ্গ দৈর্ঘ্যের সাথে রৈখিকভাবে বৃদ্ধি পায় এবং দীর্ঘ-প্রসঙ্গ অনুমানের সময় একটি প্রধান বাধা হয়ে দাঁড়ায়।
ব্যবহারিক পেঅফ থ্রুপুটে দেখায়। 32টি সমান্তরাল অনুরোধ সহ 40,000 টোকেনের প্রসঙ্গ দৈর্ঘ্যে, Soofi S 14-থেকে-24-বিলিয়ন-প্যারামিটার পরিসরে ঘন মডেলের তুলনায় প্রতি সেকেন্ডে GPU-এ প্রায় আট গুণ বেশি টোকেন তৈরি করে। যদিও প্রসঙ্গ বৃদ্ধির সাথে সাথে প্রচলিত মডেলগুলির জন্য প্রজন্মের গতি দ্রুত হ্রাস পায়, Soofi S 4,000 টোকেন থেকে 256,000 টোকেনে প্রায় সমতল থাকে৷ কনসোর্টিয়ামের পরিমাপের একমাত্র তুলনীয় মডেল হল আলিবাবার Qwen3.5 35B-A3B, যা একটি হাইব্রিড আর্কিটেকচারও ব্যবহার করে।
ইংরেজিকে ত্যাগ না করেই জার্মানের জন্য প্রশিক্ষিত
জার্মানের উপর ইচ্ছাকৃত ফোকাস প্রকল্পের কেন্দ্রবিন্দু। প্রথম প্রশিক্ষণ পর্বে, জার্মানরা 7.2 শতাংশ ডেটা মিশ্রিত করে; দ্বিতীয় পর্যায়ে, এই শেয়ারটি 15.3 শতাংশে উন্নীত হয়। তুলনা করে, এনভিডিয়ার নেমোট্রন রেফারেন্স রেসিপিতে সমস্ত অ-ইংরেজি ভাষার মিলিত প্রশিক্ষণের মিশ্রণের প্রায় 5 শতাংশের জন্য দায়ী।
ডেটা উত্সের মধ্যে রয়েছে এইচপিএলটি কর্পাস থেকে জার্মান ওয়েব পাঠ্য, প্রকাশ্যে লাইসেন্সপ্রাপ্ত জার্মান কমন্স কর্পাস, ফাইনপিডিএফ এবং ফাইনউইকির জার্মান অংশ এবং 916টি জার্মান প্রকাশনা থেকে আঁকা 193 মিলিয়ন সংবাদপত্রের নিবন্ধের বাণিজ্যিকভাবে লাইসেন্সপ্রাপ্ত জিনিওস সংরক্ষণাগার। মেশিন-অনুবাদিত এবং কৃত্রিমভাবে তৈরি জার্মান পাঠ্যগুলি মিশ্রণের বাইরে।
মডেলটি তিনটি প্রশিক্ষণ পর্বে প্রায় 27 ট্রিলিয়ন টোকেন প্রক্রিয়া করেছে: প্রথম পর্যায়ে বিস্তৃত ওয়েব, কোড, গণিত এবং ডোমেন-নির্দিষ্ট পাঠ্যের প্রায় 20 ট্রিলিয়ন টোকেন; সেকেন্ডে প্রায় 6 ট্রিলিয়ন উচ্চ-মানের টোকেন; এবং একটি সংক্ষিপ্ত তৃতীয় পর্যায় 1 মিলিয়ন টোকেন পর্যন্ত দীর্ঘ নথি ব্যবহার করে প্রসঙ্গ উইন্ডোটি প্রসারিত করে।
বেঞ্চমার্ক ফলাফল: জার্মান এবং ইংরেজিতে এগিয়ে, গণিতে দুর্বল
কনসোর্টিয়াম অনুসারে, অন্যান্য 16টি উন্মুক্ত মডেলের বিপরীতে মূল্যায়নে, Soofi S জার্মান এবং ইংরেজি উভয়ের জন্য সমষ্টিগত স্কোরে সমস্ত সম্পূর্ণ উন্মুক্ত মডেলের নেতৃত্ব দেয়। এর মধ্যে AI এর জন্য অ্যালেন ইনস্টিটিউটের OLMo 3 32B এবং ETH জুরিখ এবং EPFL-এর Apertus 70B অন্তর্ভুক্ত রয়েছে৷ প্রতিটি ইউরোপীয় সার্বভৌম বেসলাইনের বিপরীতে, মডেলটি স্যুটের সমস্ত জার্মান বেঞ্চমার্কে এগিয়ে আসে, কখনও কখনও দ্বি-অঙ্কের মার্জিনে।
কোড টাস্কে, Soofi S HumanEval-এ 73.8 শতাংশ, MBPP-এ 70.2 এবং জার্মান MBPP ভেরিয়েন্টে 84.2 স্কোর করেছে — ওপেন-সোর্স সহকর্মীদের মধ্যে সেরা ফলাফল। INCLUDE-DE-তে, জার্মানি-নির্দিষ্ট আঞ্চলিক জ্ঞানের পরীক্ষা, Soofi S বৃহত্তর Qwen3.5 35B-A3B-এর সাথে 61.2 পয়েন্টে প্রথম স্থান অর্জন করে। নেমোট্রন বেসলাইনের সাথে তুলনা করে, জার্মান-ভারিত ডেটা রেসিপি ইংরেজি পারফরম্যান্সে আঘাত না করে 15.1 পয়েন্ট এবং GPQA-ডায়মন্ড সায়েন্স বেঞ্চমার্ক 9.6 পয়েন্ট দ্বারা ভাষার দক্ষতা উন্নত করে।
স্পষ্ট দুর্বলতা আছে। জার্মান প্রতিযোগিতার গণিতে (Minerva MATH-DE), Soofi S 56 পয়েন্ট স্কোর করেছে, Qwen3.5 35B-A3B-এ 76.5 এবং Gemma 3 27B-এ 65.6 স্কোর করেছে। এটি NaturalQuestions-এ ওপেন ফ্যাক্টচুয়াল পুনরুদ্ধারের উপরও ট্র্যাল করে, যেটি দলটি প্রায় 3 বিলিয়ন সক্রিয় প্যারামিটার থাকার জন্য দায়ী করে এবং তাই একটি ঘন 27B মডেলের তুলনায় কম সঞ্চিত বিশ্ব জ্ঞান। রুলার লং-কনটেক্সট টেস্টটি আরেকটি ফাঁক তৈরি করে: যখন মডেলটিকে একটি দীর্ঘ টেক্সট থেকে ঘন ঘন শব্দ বের করতে হয়, তখন এর হিট রেট 32,000 টোকেন ছাড়িয়ে প্রায় 3 শতাংশে নেমে আসে, যখন তুলনীয় নেমোট্রন মডেল এখনও 60 থেকে 64 শতাংশ পরিচালনা করে।
মিউনিখে 512টি Nvidia B200 GPU-তে প্রশিক্ষিত
মিউনিখের ডয়েচে টেলিকমের ইন্ডাস্ট্রিয়াল এআই ক্লাউডে 512টি এনভিডিয়া বি200 জিপিইউ-তে মার্চ থেকে মে 2026-এর মধ্যে প্রশিক্ষণ চালানো হয়েছিল, মোট প্রায় 253,000 জিপিইউ-ঘন্টা। এই সুবিধাটি সম্পূর্ণরূপে পুনর্নবীকরণযোগ্য শক্তির উপর চলে, Eisbach খাল থেকে জল দিয়ে ঠান্ডা করা হয় এবং আশেপাশের Tucherpark আশেপাশের এলাকায় বর্জ্য তাপ খাওয়ানো হয়, রিপোর্ট অনুসারে। সুফি এস ছিল এই অবকাঠামোতে পরিচালিত প্রথম প্রধান প্রশিক্ষণের একটি।
মডেলটির পিছনের কনসোর্টিয়ামটি ইউরোপীয় IPCEI-CIS প্রোগ্রামের অংশ হিসাবে অর্থনৈতিক বিষয় ও শক্তির জন্য জার্মান ফেডারেল মন্ত্রক দ্বারা অর্থায়ন করা হয়। অংশগ্রহণকারীদের মধ্যে Fraunhofer Institutes IAIS এবং IIS, জার্মান রিসার্চ সেন্টার ফর আর্টিফিশিয়াল ইন্টেলিজেন্স (DFKI), TU Darmstadt, Würzburg University, L3S রিসার্চ সেন্টার, বার্লিন ইউনিভার্সিটি অফ অ্যাপ্লাইড সায়েন্স, এবং AI কোম্পানি Ellamind এবং Merantix Momentum অন্তর্ভুক্ত।
'অতিরিক্ত প্রশিক্ষণ' নিয়ে বিতর্ক
লঞ্চের পরপরই, সমালোচকরা যুক্তি দিয়েছিলেন যে Soofi S 2022 সালে Google DeepMind দ্বারা প্রকাশিত ক্লাসিক চিনচিলা স্কেলিং আইনের মানগুলির দ্বারা খুব বেশি প্রশিক্ষিত ছিল, যা প্রতি প্যারামিটারে 20 টোকেনের একটি মোটামুটি মিষ্টি জায়গার পরামর্শ দেয়। 27 ট্রিলিয়ন টোকেন এবং মোটামুটি 30 বিলিয়ন প্যারামিটার সহ, Soofi S প্রতি প্যারামিটারে কয়েকশ টোকেন রয়েছে; শুধুমাত্র 3.2 বিলিয়ন সক্রিয় পরামিতি গণনা অনুপাতকে হাজারে ঠেলে দেয়।
মাইকেল ফ্রম, প্রকল্পের প্রযুক্তিগত নেতৃত্বের অংশ, সেই সমালোচনার পিছনে ঠেলে দিয়েছিলেন, যুক্তি দিয়েছিলেন যে এই নিয়মগুলি MoE আর্কিটেকচারে বহন করে না। "নতুন গবেষণায় দেখানো হয়েছে যে ঘন মডেলের পুরানো স্কেলিং আইন আর MoE আর্কিটেকচারে প্রযোজ্য নয়," ফ্রোম বলেছেন, একটি বড়, উচ্চ-মানের ডেটাসেটে একই নথি বারবার দেখে পৃথক বিশেষজ্ঞরা উপকৃত হন। তুলনার একটি বিন্দু হিসাবে, তিনি এনভিডিয়ার দিকে ইঙ্গিত করেছেন, যা 25 ট্রিলিয়ন টোকেন পর্যন্ত নিজস্ব মডেলগুলিকে প্রশিক্ষণ দিয়েছে।
কি মুক্তি পায়, আর কি হয় না
গবেষকরা নির্বাচিত মধ্যবর্তী চেকপয়েন্ট, সম্পূর্ণ প্রশিক্ষণ এবং মূল্যায়ন কোড এবং কাঁচা টোকেন সংখ্যা, যুগের সংখ্যা এবং উত্স প্রতি কার্যকর অবদানের তালিকাভুক্ত একটি বিশদ ডেটা ইনভেন্টরি সহ মডেল ওজন প্রকাশ করছেন। দলের মতে, এর মানে হল Soofi S ওপেন সোর্স ইনিশিয়েটিভ থেকে ওপেন সোর্স এআই ডেফিনিশন 1.0 পূরণ করে।
একটি ইউরোপীয় ওপেন-ডেটা সংজ্ঞার জন্য একটি কঠোর প্রস্তাব, যার জন্য প্রতিটি একক প্রশিক্ষণ টোকেন অবাধে বিতরণযোগ্য হতে হবে, পূরণ করা হয়নি কারণ মিশ্রণের 1.3 শতাংশ বাণিজ্যিকভাবে লাইসেন্সপ্রাপ্ত জিনিওস কর্পাস থেকে আসে। প্রতিবেদনে বলা হয়েছে যে প্রশিক্ষণের প্রায় 99 শতাংশ ডেটা এখনও স্বাধীনভাবে পুনর্গঠন করা যেতে পারে। মডেলটির প্রকাশের জন্য সঠিক লাইসেন্সটি প্রকাশের সময় চূড়ান্ত করা হয়নি।
কনসোর্টিয়াম এখন প্রযুক্তিগত নথি, কোড জেনারেশন এবং এজেন্ট-ভিত্তিক সিস্টেম জড়িত অ্যাপ্লিকেশনগুলিতে Soofi S পরীক্ষা করার জন্য পরবর্তী পর্যায়ে শিল্প অংশীদারদের সন্ধান করছে। ওপেন-ওয়েট মডেল রিলিজ, সার্বভৌম AI পরিকাঠামো এবং ইউরোপীয় AI ইকোসিস্টেম সম্পর্কে আরও জানতে, এখানে প্রকাশিত AI শিল্প কভারেজ এর সাথে থাকুন।
ওপেন সোর্স AI-তে এগিয়ে থাকুন
ওপেন-ওয়েট রিলিজগুলি মার্কিন যুক্তরাষ্ট্র, চীন এবং এখন ইউরোপের ল্যাবগুলি থেকে প্রায় সাপ্তাহিক আসছে এবং সবচেয়ে বড় মালিকানাধীন মডেল এবং সেরা উন্মুক্ত বিকল্পগুলির মধ্যে ব্যবধান সংকুচিত হচ্ছে৷ সম্পূর্ণ ছবির জন্য এখানে ব্রেকিং এআই নিউজ এবং বেঞ্চমার্ক বিশ্লেষণ অনুসরণ করুন।
আরও এআই মডেল কভারেজ পড়ুন →


