एक स्वतंत्र डेवलपर ने प्रदर्शित किया है कि डीपसीक का वी4 फ्लैश मॉडल, एक 304-बिलियन-पैरामीटर मिश्रण-विशेषज्ञ प्रणाली, एकल एएमडी एमआई300एक्स जीपीयू पर उत्पादन में चल सकता है, बिना किसी भार परिमाणीकरण या ऑफलोडिंग के सिंगल-स्ट्रीम डिकोडिंग में प्रति सेकंड 168.6 टोकन प्राप्त कर सकता है। काम, GitHub पर प्रकाशित हुआ और 4 अगस्त, 2026 को हैकर न्यूज़ के शीर्ष पर सामने आया, यह अब तक का सबसे स्पष्ट सबूत पेश करता है कि AMD का हार्डवेयर एनवीडिया पर भरोसा किए बिना फ्रंटियर-स्केल ओपन मॉडल की सेवा दे सकता है।

डेवलपर रयान झोउ द्वारा बनाए गए रिपॉजिटरी में एक MI300X पर डीपसीक-V4-फ्लैश-0731 चेकपॉइंट चलाने के लिए एक संपूर्ण डॉकर कंपोज़ स्टैक, पिन किए गए फ़ाइल ओवरले और ट्यूनिंग टेबल शामिल हैं। एएमडी और एनवीडिया के बीच चिप युद्ध पर [ब्रेकिंग एआई न्यूज] (https://aibuzzwire.news) पर नज़र रखने वाले पाठकों के लिए, परिणाम महत्वपूर्ण है क्योंकि यह इस धारणा को चुनौती देता है कि फ्रंटियर अनुमान के लिए एनवीडिया के नवीनतम और सबसे महंगे हार्डवेयर की आवश्यकता होती है।

संख्याएँ

वीएलएलएम के आरओसीएम नाइटली बिल्ड का उपयोग करके पिन किए गए सॉफ़्टवेयर स्टैक पर मापा गया बेंचमार्क प्रदर्शन, एक एकल एएमडी त्वरक क्या कर सकता है, इसके बारे में एक आकर्षक कहानी बताता है:

  • सिंगल-स्ट्रीम डिकोड: 168.6 टोकन प्रति सेकंड, वास्तविक समय चैट और एजेंटिक वर्कलोड के लिए पर्याप्त तेज़।
  • प्रीफ़िल थ्रूपुट: ट्यून्ड कर्नेल के साथ प्रति सेकंड लगभग 7,900 से 8,500 टोकन, जिसका अर्थ है कि लंबे संकेतों को एक सेकंड के भीतर संसाधित किया जाता है।
  • आठ समवर्ती स्ट्रीम: कुल 542 टोकन प्रति सेकंड, प्रति स्ट्रीम 90.3 टोकन प्रति सेकंड।
  • 64-स्ट्रीम बर्स्ट: 830 टोकन प्रति सेकंड कुल, बिना मेमोरी त्रुटि और कोई इंजन विफलता के।
  • संदर्भ लंबाई: परीक्षण में 256,000 टोकन मान्य किए गए, जिसमें आर्किटेक्चर दस लाख तक का समर्थन करता है।

पूरे मॉडल में 156.67 गीगाबाइट उच्च-बैंडविड्थ मेमोरी है, जो पूरी तरह से MI300X के 192-गीगाबाइट HBM3 पूल के भीतर फिट होती है। किसी अतिरिक्त परिमाणीकरण या भार उतारने की आवश्यकता नहीं थी, जो मॉडल की पूर्ण सटीकता को बरकरार रखता है।

MI300X क्यों काम करता है

AMD MI300X में दो विशेषताएं हैं जो इतने बड़े मॉडल की एकल-जीपीयू तैनाती को संभव बनाती हैं। इसमें 192 गीगाबाइट HBM3 मेमोरी, Nvidia H100 SXM5 की क्षमता का 2.4 गुना और 5.3 टेराबाइट्स प्रति सेकंड मेमोरी बैंडविड्थ है। फर्गस फिन नामक डेवलपर द्वारा एक अलग लेख, जिसने इस तैनाती के लिए आधार तैयार किया, ने अनुमान लगाया कि एमआई 300 एक्स की कीमत सूची मूल्य पर तुलनीय एनवीडिया हार्डवेयर से लगभग आधी है।

इस विशेष 304-बिलियन-पैरामीटर चेकपॉइंट के लिए, मेमोरी क्षमता निर्णायक कारक है। मॉडल पूरी तरह से ऑन-चिप मेमोरी में फिट बैठता है, जिससे 20-गीगाबाइट जीपीयू की-वैल्यू कैश पूल और बेदखल उपसर्ग-कैश प्रविष्टियों के लिए 96-गीगाबाइट सीपीयू टियर के लिए जगह बचती है। एक कार्ड दो से आठ विशिष्ट समवर्ती धाराओं और 64 धाराओं तक के विस्फोट को संभाल सकता है, जो कई उत्पादन अनुमान कार्यभार के लिए पर्याप्त है।

इंजीनियरिंग बाधाएँ

MI300X पर डीपसीक V4 फ़्लैश चलाना सीधा नहीं था। आधिकारिक वीएलएलएम रेसिपी में एनवीडिया हार्डवेयर और नए एएमडी जीपीयू जैसे एमआई325एक्स और एमआई355एक्स शामिल हैं, लेकिन 31 जुलाई चेकपॉइंट के लिए एकल-एमआई300एक्स उत्पादन कॉन्फ़िगरेशन नहीं है।

रिपॉजिटरी कई इंजीनियरिंग समस्याओं का दस्तावेजीकरण करती है जिन्हें हल किया जाना था। MI300X FP8 संख्या प्रारूप के एक संस्करण का उपयोग करता है जो नए AMD चिप्स द्वारा उपयोग किए जाने वाले मानक से भिन्न होता है, और एक कर्नेल जो गलत शब्दार्थ मानता है वह दो के कारक से परिणाम उत्पन्न कर सकता है। डेवलपर को उच्च संगामिति, कारण सट्टा सत्यापन और सीपीयू कुंजी-मूल्य सिंक्रनाइज़ेशन पर मिश्रण-विशेषज्ञ रूटिंग को भी ठीक करना पड़ा, जिनमें से कई अपस्ट्रीम वीएलएलएम में अपरिवर्तित रहते हैं।

रिपॉजिटरी में शुद्धता ओवरले, सट्टा प्रारूपण के साथ एक मान्य सर्विंग कॉन्फ़िगरेशन, चिप आकृतियों के लिए AITER GEMM ट्यूनिंग टेबल जो पैक किए गए टेबल गायब थे, और एक हाइब्रिड कुंजी-मूल्य रणनीति जो सीपीयू ऑफलोड के साथ जीपीयू कैश को जोड़ती है, जोड़ती है।

चिप युद्ध के लिए इसका क्या अर्थ है

यह प्रदर्शन एआई में एएमडी की महत्वाकांक्षाओं के लिए एक महत्वपूर्ण क्षण पर आता है। एनवीडिया एआई एक्सेलेरेटर बाजार के विशाल बहुमत को नियंत्रित करता है, जो इसके सीयूडीए सॉफ्टवेयर पारिस्थितिकी तंत्र द्वारा समर्थित है, जिसे कई डेवलपर्स एक खाई के रूप में देखते हैं जिसे एएमडी ने पार करने के लिए संघर्ष किया है। सेमीएनालिसिस ने सीधे जुलाई 2026 के विश्लेषण में उस प्रश्न की जांच की जिसका शीर्षक था "क्या एएमडी सीयूडीए खाई को तोड़ सकता है?" और उत्तर विवादित बना हुआ है।

लेकिन इस तरह की ओपन-सोर्स परियोजनाएं धारणा के अंतर को दूर कर देती हैं। यदि एक एकल MI300X प्रतिस्पर्धी गति पर फ्रंटियर-स्केल मॉडल की सेवा कर सकता है, तो AMD के लिए लागत तर्क को खारिज करना कठिन हो जाता है। एएमडी अपने स्वयं के ओपन मॉडल पोर्टफोलियो का निर्माण भी कर रहा है, इंस्टेला-एमओई-16बी जारी कर रहा है, जो अपने स्वयं के इंस्टिंक्ट जीपीयू पर स्क्रैच से प्रशिक्षित एक पूरी तरह से खुला मॉडल है, और 15-मेगावाट एमआई355एक्स प्लेटफॉर्म पर ज़िफ्रा के साथ साझेदारी कर रहा है।

इस बीच, डीपसीक स्वयं फ्रंटियर एआई की लागत को कम कर रहा है। अनुसंधान फर्म के विश्लेषण के अनुसार V4 फ़्लैश मॉडल पहले से ही चलने वाला सबसे सस्ता प्रसिद्ध मॉडल था, जो 60 प्रतिशत कम लागत पर GPT-5.6 लूना से मेल खाता था। सस्ते एएमडी हार्डवेयर के साथ, एनवीडिया पारिस्थितिकी तंत्र के बाहर बड़े मॉडलों की सेवा की अर्थव्यवस्था में तेजी से सुधार हो रहा है।

The Open Source Advantage

रिपॉजिटरी 2026 एआई विकास में एक व्यापक विषय को रेखांकित करती है: ओपन-वेट मॉडल और ओपन-सोर्स अनुमान टूलींग स्वतंत्र इंजीनियरों के लिए उन तैनाती को दोहराने और अनुकूलित करना संभव बना रहे हैं जो कभी अच्छी तरह से वित्त पोषित प्रयोगशालाओं के विशिष्ट डोमेन थे। पूर्ण कॉन्फ़िगरेशन, ट्यूनिंग टेबल और रास्ते में तय किए गए विशिष्ट बग को प्रकाशित करके, कार्य गंभीर एआई वर्कलोड के लिए एएमडी हार्डवेयर पर विचार करने वाले किसी भी व्यक्ति के लिए बाधा को कम करता है।

एआई से आगे रहें

एआई अनुमान के लिए एएमडी और एनवीडिया के बीच लड़ाई तेज हो रही है, और इस तैनाती जैसे ओपन-सोर्स योगदान चुपचाप प्रतिस्पर्धी परिदृश्य को बदल रहे हैं। हार्डवेयर, ओपन मॉडल और बुनियादी ढांचे में [नवीनतम एआई विकास] (https://aibuzzwire.news) के लिए, हमारे कवरेज के साथ बने रहें।

अधिक AI समाचार पढ़ें →