Strata নামক একটি স্বল্প পরিচিত ওপেন-সোর্স প্রকল্প একটি মুহূর্ত চলছে। MIT-লাইসেন্সপ্রাপ্ত ইঞ্জিন, যা আলিবাবার Qwen3.8-Flash-Next চালায় — একটি 125-বিলিয়ন-প্যারামিটার মিশ্রণ-অফ-বিশেষজ্ঞ মডেল — সাধারণ গেমিং পিসিগুলিতে, 4 অক্টোবরে 640 টিরও বেশি পয়েন্ট নিয়ে হ্যাকার নিউজের প্রথম পৃষ্ঠায় শট করা হয়েছিল, এবং এর GitHub সংগ্রহের পর থেকে এটি 10 সেপ্টেম্বর 10 স্টার সংগ্রহ করেছে। 24.

পিচটি সহজ: একটি 125-বিলিয়ন-প্যারামিটার মডেল যা সাধারণত একটি সার্ভারে থাকে চ্যাট করতে পারে, কোড লিখতে পারে, ছবি পড়তে পারে এবং সম্পূর্ণভাবে একটি ভোক্তা গ্রাফিক্স কার্ডে কোডিং এজেন্ট চালাতে পারে, মেশিনের বাইরে কিছুই থাকে না।

স্তর আসলে কি করে

স্ট্র্যাটা উভয়ই একটি অনুমান ইঞ্জিন এবং উইন্ডোজ এবং লিনাক্সের জন্য একটি এক-ক্লিক ইনস্টলার। এর ডকুমেন্টেশন অনুযায়ী, ফ্রন্টিয়ার-মডেল মান অনুসারে প্রয়োজনীয়তাগুলি পরিমিত: NVIDIA-এর RTX 20, 30, 40 বা 50 সিরিজ বা AMD-এর Radeon RX 6000, 7000 বা 9000 সিরিজ থেকে কমপক্ষে 12GB VRAM সহ একটি GPU, কমপক্ষে 32GB RAM, 8GB র‍্যাম এবং 8GB র‍্যাম এবং র‍্যাম মুক্ত।

ইঞ্জিনটি Qwen3.8-Flash-Next-এর কোয়ান্টাইজড সংস্করণগুলিকে বিভিন্ন কম্প্রেশন স্তরে, Q2_0 থেকে IQ3_S পর্যন্ত, এবং একটি কোড-বিশেষায়িত ভেরিয়েন্ট পাঠায়। এটি লোকালহোস্টে ওপেনএআই এবং অ্যানথ্রোপিক-সামঞ্জস্যপূর্ণ এপিআইগুলিকে প্রকাশ করে, যার অর্থ ChatGPT বা Claude-এর জন্য তৈরি সরঞ্জামগুলি — ক্লাউড কোড, কার্সার এবং কোডেক্সের মতো কোডিং এজেন্ট সহ — ন্যূনতম পরিবর্তনের সাথে স্থানীয় সার্ভারে নির্দেশ করা যেতে পারে। ঐচ্ছিক ইমেজ ইনপুট এবং মাল্টি-জিপিইউ সমর্থন অন্তর্ভুক্ত করা হয়েছে, এবং ইনস্টলার এমনকি একটি এআই-সহায়তা সেটআপ মোড অফার করে যা একটি কোডিং সহকারীকে একটি একক পেস্ট করা প্রম্পট থেকে মেশিনটি কনফিগার করতে দেয়।

গতির সংখ্যা

দুটি ভোক্তা ডেস্কটপে পরিমাপ করা প্রকল্পের প্রকাশিত বেঞ্চমার্কগুলি রিলিজ ছড়িয়ে পড়ার কারণ। একটি NVIDIA RTX 5070-এ 12GB VRAM এর সাথে Ryzen 5 7600 এবং 64GB RAM এর সাথে যুক্ত, Strata রিপোর্ট করে:

  • Q2_0 কোয়ান্টাইজেশন: প্রজন্মের জন্য প্রতি সেকেন্ডে 94টি টোকেন এবং একটি 32K-টোকেন নথিতে প্রম্পট প্রক্রিয়াকরণের জন্য প্রতি সেকেন্ডে 2,650 টোকেন
  • IQ3_S: প্রতি সেকেন্ড জেনারেশনে 53টি টোকেন, প্রতি সেকেন্ডে 1,620 টোকেন প্রম্পট প্রসেসিং
  • কোডার ভেরিয়েন্ট: প্রতি সেকেন্ড জেনারেশনে ৫৫টি টোকেন

AMD এর দিকে, 16GB VRAM সহ একটি RX 9070 XT Q2_0 এ প্রতি সেকেন্ডে 60 টোকেন পরিচালনা করে। ডকুমেন্টেশন অনুমান করে যে 24GB VRAM সহ একটি RTX 3090 প্রতি সেকেন্ডে 100 থেকে 140 টোকেনে পৌঁছাতে হবে - যা বেশিরভাগ লোক পড়তে পারে তার চেয়ে দ্রুত৷

তুলনা করার জন্য, ছয় মাস আগে, স্থানীয়ভাবে ব্যবহারযোগ্য গতিতে এমনকি একটি 70-বিলিয়ন-প্যারামিটার ঘন মডেল চালানোর জন্য শত শত গিগাবাইট ইউনিফাইড মেমরি বা আক্রমনাত্মক অনুমানমূলক ডিকোডিং কৌশল সহ একটি ওয়ার্কস্টেশন প্রয়োজন।

কেন একটি 125B মডেল একটি গেমিং কার্ডে ফিট করে

প্রযুক্তির দুটি অংশ এটি সম্ভব করে তোলে। প্রথমটি নিজেই মডেল। AI Buzz Wire এর প্রকাশের সময় কভার করা হয়েছে, Qwen3.8-Flash-Next হল বিশেষজ্ঞদের মিশ্রণের একটি আর্কিটেকচার যার মোটামুটি 125 বিলিয়ন মোট প্যারামিটার রয়েছে কিন্তু প্রতি টোকেনে মাত্র 6 বিলিয়ন সক্রিয় — তাই প্রতিটি জেনারেট করা শব্দ নেটওয়ার্কের একটি ছোট টুকরো স্পর্শ করে, নাটকীয়ভাবে প্রতি টোকেন গণনাকে কমিয়ে দেয়।

দ্বিতীয়টি হল পরিমাপকরণ। Strata-এর দ্রুততম প্রিসেটগুলি মডেলের ওজনকে প্রতি প্যারামিটারে দুই বা তিন বিটে সংকুচিত করে, একটি 12GB GPU এবং সিস্টেম RAM জুড়ে ফিট করা একটি পদচিহ্নের জন্য কিছু নির্ভুলতা ট্রেড করে। সেই ট্রেডঅফ হল প্রধান সতর্কতা: Q2-শ্রেণী এবং IQ2-শ্রেণির কোয়ান্টগুলি যুক্তিযুক্ত-ভারী কাজগুলিতে পরিমাপযোগ্যভাবে গুণমানকে হ্রাস করে এবং ক্রেতাদের উচিত প্রতিটি কাজের চাপের গ্যারান্টির পরিবর্তে শিরোনাম গতির সংখ্যাগুলিকে একটি সূচনা পয়েন্ট হিসাবে বিবেচনা করা। রিপোজিটরিতে কমিউনিটি বেঞ্চমার্ক পৃষ্ঠাগুলি মাপ জুড়ে গুণমানের ফলাফলগুলি ট্র্যাক করে৷

একটি বড় স্থানীয়-এআই তরঙ্গের অংশ

স্থানীয় অনুমানের জন্য ত্বরান্বিত গতির মধ্যে স্ট্র্যাটা আসে। আলিবাবার কুয়েন পরিবার সর্বাধিক ডাউনলোড করা ওপেন-ওয়েট মডেল লাইনে পরিণত হয়েছে, মেটা এবং Google-এর নিজস্ব ওপেন-সোর্সড প্রতিযোগিতামূলক মডেল রয়েছে, এবং সরঞ্জামগুলির একটি তরঙ্গ এখন গ্রাহকদের তাদের ডিভাইসগুলি রেখে সাবস্ক্রিপশন বা ডেটা ছাড়াই সক্ষম সহকারী চালাতে দেয়৷

প্রকল্পটি প্রতিফলিত করে যে কীভাবে "ভোক্তা হার্ডওয়্যার" এর সংজ্ঞা পরিবর্তন হচ্ছে। 12GB VRAM সহ একটি মিড-রেঞ্জ 2026 গ্রাফিক্স কার্ড, যা প্রাথমিকভাবে গেমিংয়ের জন্য পাঠানো হয়েছিল, এখন আকার শ্রেণীর একটি মডেলের জন্য একটি কার্যকর ইনফারেন্স অ্যাক্সিলারেটর যা মাত্র দুই বছর আগে সীমান্ত সিস্টেমকে সংজ্ঞায়িত করেছিল।

স্ট্র্যাটা প্রাথমিক সফ্টওয়্যার রয়ে গেছে — সংগ্রহস্থলের ইস্যু ট্র্যাকারগুলি পুরানো GPU এবং নন-AVX2 প্রসেসরগুলিতে মোটামুটি প্রান্তের নথিগুলি তৈরি করে — তবে প্রকল্পটি MIT- লাইসেন্সপ্রাপ্ত, বিনামূল্যে এবং উন্মুক্ত, Intel Arc, পুরানো টেসলা এবং Radeon কার্ডগুলির জন্য পরীক্ষামূলক সমর্থন সহ, এবং সম্প্রদায়ের সদস্যদের দ্বারা নথিভুক্ত মাল্টি-GPU রিগগুলির সাথে।

ডেভেলপারদের জন্য, লোকালহোস্ট এপিআই সামঞ্জস্যতা হতে পারে সবচেয়ে ব্যবহারিক উপায়: OpenAI বা Anthropic SDK-এর বিরুদ্ধে লিখিত যেকোনো স্ক্রিপ্ট বা এজেন্ট একটি বেস ইউআরএল পরিবর্তন করে স্থানীয় Qwen ডিপ্লোয়মেন্টে পুনঃনির্দেশিত করা যেতে পারে, স্ট্র্যাটাকে গোপনীয়তা-সংবেদনশীল প্রোটোটাইপিং, অফলাইন ব্যবহার বা সহজভাবে API খরচ ক্যাপ করার জন্য একটি কম-ঘর্ষণ বিকল্প তৈরি করে।

কিভাবে ট্রাই করবেন

শুরু করার জন্য একটি ম্যানুয়াল সহ একটি টার্মিনাল সেশনের প্রয়োজন নেই৷ ইনস্টলার একটি পাসে ড্রাইভার, মডেল ওজন এবং স্থানীয় সার্ভারের ব্যবস্থা করে এবং সংগ্রহস্থলে একটি সেটআপ ফাইল রয়েছে যা সরাসরি একটি AI কোডিং সহকারীতে পেস্ট করার জন্য ডিজাইন করা হয়েছে, যা পরে স্বায়ত্তশাসিতভাবে মেশিনটিকে কনফিগার করে। ডিস্ক থেকে ওজন লোড হওয়ার সময় প্রথম লঞ্চগুলি ধীর হয়; ডকুমেন্টেশন একটি SSD সুপারিশ করে এবং সতর্ক করে যে দীর্ঘ কথোপকথনগুলি সিস্টেম র‌্যামে আরও কাজ স্থানান্তর করে।

এআই থেকে এগিয়ে থাকুন

ওপেন সোর্স মডেল, স্থানীয় এআই টুলস এবং ইনফারেন্স হার্ডওয়্যারের সর্বশেষ তথ্যের জন্য AI Buzz Wire অনুসরণ করুন।

আরও এআই খবর পড়ুন →