একজন স্বাধীন ডেভেলপার দেখিয়েছেন যে DeepSeek-এর V4 ফ্ল্যাশ মডেল, একটি 304-বিলিয়ন-প্যারামিটার মিশ্রণ-অফ-বিশেষজ্ঞ সিস্টেম, একটি একক AMD MI300X GPU-তে উৎপাদনে চলতে পারে, কোনো ওজন পরিমাপ বা অফলোডিং ছাড়াই একক-স্ট্রিম ডিকোডিংয়ে প্রতি সেকেন্ডে 168.6 টোকেন অর্জন করতে পারে। GitHub-এ প্রকাশিত এবং 4 আগস্ট, 2026-এ হ্যাকার নিউজের শীর্ষে থাকা এই কাজটি এখনও স্পষ্ট প্রমাণ দেয় যে AMD-এর হার্ডওয়্যার Nvidia-এর উপর নির্ভর না করে একটি ফ্রন্টিয়ার-স্কেল ওপেন মডেল পরিবেশন করতে পারে।
ডেভেলপার রায়ান ঝু দ্বারা রক্ষণাবেক্ষণ করা সংগ্রহস্থলে একটি সম্পূর্ণ ডকার কম্পোজ স্ট্যাক, পিন করা ফাইল ওভারলে এবং একটি MI300X-এ DeepSeek-V4-Flash-0731 চেকপয়েন্ট চালানোর জন্য টিউনিং টেবিল অন্তর্ভুক্ত রয়েছে। AMD এবং Nvidia-এর মধ্যে চিপ যুদ্ধের বিষয়ে ব্রেকিং এআই নিউজ ট্র্যাক করা পাঠকদের জন্য, ফলাফলটি তাৎপর্যপূর্ণ কারণ এটি এই ধারণাটিকে চ্যালেঞ্জ করে যে সীমান্ত অনুমানের জন্য Nvidia-এর সর্বশেষ এবং সবচেয়ে ব্যয়বহুল হার্ডওয়্যার প্রয়োজন।
সংখ্যা
VLLM-এর ROCm রাত্রিকালীন বিল্ড ব্যবহার করে একটি পিন করা সফ্টওয়্যার স্ট্যাকের উপর পরিমাপ করা বেঞ্চমার্ক করা কর্মক্ষমতা, একটি একক AMD অ্যাক্সিলারেটর কী করতে পারে সে সম্পর্কে একটি আকর্ষণীয় গল্প বলে:
- একক-স্ট্রিম ডিকোড: প্রতি সেকেন্ডে 168.6 টোকেন, রিয়েল-টাইম চ্যাট এবং এজেন্টিক কাজের চাপের জন্য যথেষ্ট দ্রুত।
- প্রিফিল থ্রুপুট: টিউন করা কার্নেল সহ প্রতি সেকেন্ডে প্রায় 7,900 থেকে 8,500 টোকেন, যার অর্থ দীর্ঘ প্রম্পটগুলি এক সেকেন্ডের মধ্যে ভালভাবে প্রক্রিয়া করা হয়।
- আটটি সমবর্তী স্ট্রীম: প্রতি সেকেন্ডে মোট ৫৪২ টোকেন, প্রতি স্ট্রীম প্রতি সেকেন্ডে ৯০.৩ টোকেন।
- 64-স্ট্রীম বার্স্ট: প্রতি সেকেন্ডে 830টি টোকেন, মেমরির বাইরের ত্রুটি এবং কোনো ইঞ্জিন ব্যর্থতা ছাড়াই।
- প্রসঙ্গ দৈর্ঘ্য: 256,000 টোকেন পরীক্ষায় যাচাই করা হয়েছে, আর্কিটেকচারটি এক মিলিয়ন পর্যন্ত সমর্থন করে।
সম্পূর্ণ মডেলটি 156.67 গিগাবাইট উচ্চ-ব্যান্ডউইথ মেমরি দখল করে, যা সম্পূর্ণরূপে MI300X-এর 192-গিগাবাইট HBM3 পুলের মধ্যে ফিট করে। কোন অতিরিক্ত পরিমাণ বা ওজন অফলোডিং প্রয়োজন ছিল না, যা মডেলের সম্পূর্ণ নির্ভুলতা সংরক্ষণ করে।
কেন MI300X কাজ করে
AMD MI300X-এ দুটি বৈশিষ্ট্য রয়েছে যা একটি মডেলের একক-GPU স্থাপনকে এত বড় করে তোলে। এটিতে 192 গিগাবাইট HBM3 মেমরি, একটি Nvidia H100 SXM5 এর ক্ষমতার 2.4 গুণ এবং মেমরি ব্যান্ডউইথের প্রতি সেকেন্ডে 5.3 টেরাবাইট। ফার্গাস ফিন নামে পরিচিত একজন বিকাশকারীর একটি পৃথক লেখা, যা এই স্থাপনার ভিত্তি স্থাপন করেছিল, অনুমান করেছে যে MI300X-এর মূল্য তালিকা মূল্যে তুলনাযোগ্য Nvidia হার্ডওয়্যারের তুলনায় প্রায় অর্ধেক।
এই বিশেষ 304-বিলিয়ন-প্যারামিটার চেকপয়েন্টের জন্য, মেমরির ক্ষমতা হল নির্ধারক ফ্যাক্টর। মডেলটি সম্পূর্ণরূপে অন-চিপ মেমরিতে ফিট করে, একটি 20-গিগাবাইট GPU কী-মানের ক্যাশে পুল এবং বহিষ্কৃত প্রিফিক্স-ক্যাশ এন্ট্রিগুলির জন্য একটি 96-গিগাবাইট CPU স্তরের জন্য জায়গা রেখে দেয়। একটি কার্ড দুটি থেকে আটটি সাধারণ সমসাময়িক স্ট্রীম এবং 64টি স্ট্রীম পর্যন্ত বিস্ফোরণ পরিচালনা করতে পারে, যা অনেক উত্পাদন অনুমান কাজের চাপের জন্য যথেষ্ট।
ইঞ্জিনিয়ারিং বাধা
MI300X-এ DeepSeek V4 Flash চালানো সোজা ছিল না। অফিসিয়াল ভিএলএলএম রেসিপিটি এনভিডিয়া হার্ডওয়্যার এবং নতুন AMD জিপিইউ যেমন MI325X এবং MI355X কভার করে, তবে 31 জুলাই চেকপয়েন্টের জন্য একটি একক-MI300X উত্পাদন কনফিগারেশন নয়।
রিপোজিটরিটি বেশ কয়েকটি ইঞ্জিনিয়ারিং সমস্যার নথি দেয় যা সমাধান করতে হয়েছিল। MI300X FP8 নম্বর বিন্যাসের একটি বৈকল্পিক ব্যবহার করে যা নতুন AMD চিপগুলির দ্বারা ব্যবহৃত মান থেকে আলাদা, এবং একটি কার্নেল যা অনুমান করে যে ভুল শব্দার্থবিদ্যা দুটির একটি ফ্যাক্টর দ্বারা ফলাফল তৈরি করতে পারে। ডেভেলপারকে উচ্চ সঙ্গতি, কার্যকারণ অনুমানমূলক যাচাইকরণ, এবং সিপিইউ কী-মান সিঙ্ক্রোনাইজেশনে বিশেষজ্ঞদের মিশ্রণের রাউটিংও ঠিক করতে হয়েছিল, যার মধ্যে কয়েকটি আপস্ট্রিম ভিএলএলএম-এ অপরিবর্তিত থেকে যায়।
সংগ্রহস্থলে শুদ্ধতা ওভারলে, অনুমানমূলক খসড়া সহ একটি বৈধ পরিবেশন কনফিগারেশন, প্যাকেজ করা টেবিলগুলি অনুপস্থিত চিপ আকারের জন্য AITER GEMM টিউনিং টেবিল এবং একটি হাইব্রিড কী-মানের কৌশল যা CPU অফলোডের সাথে একটি GPU ক্যাশকে একত্রিত করে।
চিপ যুদ্ধের জন্য এর অর্থ কী
এআই-তে এএমডি-এর উচ্চাকাঙ্ক্ষার জন্য একটি গুরুত্বপূর্ণ মুহুর্তে প্রদর্শনটি পৌঁছেছে। এনভিডিয়া AI এক্সিলারেটর বাজারের সিংহভাগ নিয়ন্ত্রণ করে, এটির CUDA সফ্টওয়্যার ইকোসিস্টেমের দ্বারা চাপা পড়ে, যেটিকে অনেক ডেভেলপার একটি পরিখা হিসাবে দেখেন যা এএমডি অতিক্রম করতে সংগ্রাম করেছে। সেমিঅ্যানালাইসিস সেই প্রশ্নটি সরাসরি পরীক্ষা করেছে জুলাই 2026 এর একটি বিশ্লেষণে "এএমডি কি CUDA পরিখা ভাঙতে পারে?" এবং উত্তর প্রতিদ্বন্দ্বিতা অবশেষ.
কিন্তু ওপেন-সোর্স প্রকল্পগুলি উপলব্ধি ফাঁকে এই এক চিপ দূরে। যদি একটি একক MI300X প্রতিযোগিতামূলক গতিতে একটি ফ্রন্টিয়ার-স্কেল মডেল পরিবেশন করতে পারে, তাহলে AMD-এর জন্য খরচের যুক্তি খারিজ করা কঠিন হয়ে যায়। এএমডি তার নিজস্ব ওপেন মডেল পোর্টফোলিও তৈরি করছে, Instella-MoE-16B প্রকাশ করছে, একটি সম্পূর্ণ উন্মুক্ত মডেল যা তার নিজস্ব Instinct GPU-তে স্ক্র্যাচ থেকে প্রশিক্ষিত, এবং 15-মেগাওয়াট MI355X প্ল্যাটফর্মে Zyphra-এর সাথে অংশীদারিত্ব করছে।
ইতিমধ্যে, ডিপসিক নিজেই ফ্রন্টিয়ার এআই-এর খরচ কমিয়ে চলেছে। V4 ফ্ল্যাশ মডেলটি ইতিমধ্যেই সবচেয়ে সস্তা সুপরিচিত মডেল ছিল গবেষণা সংস্থার বিশ্লেষণ অনুযায়ী, GPT-5.6 লুনার সাথে 60 শতাংশ কম খরচে মেলে। সস্তা এএমডি হার্ডওয়্যারের সাথে মিলিত, এনভিডিয়া ইকোসিস্টেমের বাইরে বড় মডেল পরিবেশন করার অর্থনীতি দ্রুত উন্নতি করছে।
ওপেন সোর্স সুবিধা
সংগ্রহস্থলটি 2026 এআই ডেভেলপমেন্টে একটি বিস্তৃত থিমকে আন্ডারস্কোর করে: ওপেন-ওয়েট মডেল এবং ওপেন-সোর্স ইনফারেন্স টুলিং স্বাধীন প্রকৌশলীদের পক্ষে এমন স্থাপনার প্রতিলিপি এবং অপ্টিমাইজ করা সম্ভব করে তুলছে যেগুলি একসময় ভাল-অর্থায়িত ল্যাবগুলির একচেটিয়া ডোমেন ছিল। সম্পূর্ণ কনফিগারেশন, টিউনিং টেবিল, এবং পথ ধরে নির্দিষ্ট বাগগুলি প্রকাশ করার মাধ্যমে, কাজটি গুরুতর AI কাজের চাপের জন্য AMD হার্ডওয়্যার বিবেচনা করার জন্য বাধা কমিয়ে দেয়।
এআই থেকে এগিয়ে থাকুন
এআই অনুমানের জন্য এএমডি এবং এনভিডিয়ার মধ্যে যুদ্ধ তীব্রতর হচ্ছে, এবং এই স্থাপনার মতো ওপেন-সোর্স অবদানগুলি নিঃশব্দে প্রতিযোগিতামূলক ল্যান্ডস্কেপকে সরিয়ে দিচ্ছে। হার্ডওয়্যার, ওপেন মডেল এবং পরিকাঠামোতে সর্বশেষ AI উন্নয়ন এর জন্য আমাদের কভারেজের সাথে থাকুন।
আরও এআই খবর পড়ুন →