एका स्वतंत्र विकसकाने हे दाखवून दिले आहे की DeepSeek चे V4 Flash मॉडेल, 304-अब्ज-पॅरामीटर मिश्रण-तज्ञ प्रणाली, एकल AMD MI300X GPU वर उत्पादनात चालू शकते, कोणत्याही वजन परिमाणीकरण किंवा ऑफलोडिंगशिवाय सिंगल-स्ट्रीम डीकोडिंगमध्ये 168.6 टोकन प्रति सेकंद मिळवते. GitHub वर प्रकाशित झालेले आणि 4 ऑगस्ट 2026 रोजी हॅकर न्यूजच्या शीर्षस्थानी आलेले हे काम, AMD चे हार्डवेअर Nvidia वर विसंबून न राहता फ्रंटियर-स्केल ओपन मॉडेल सर्व्ह करू शकते याचा स्पष्ट पुरावा देते.

डेव्हलपर रायन झोऊने देखरेख केलेल्या रेपॉजिटरीमध्ये संपूर्ण डॉकर कंपोझ स्टॅक, पिन केलेले फाइल ओव्हरले आणि एका MI300X वर DeepSeek-V4-Flash-0731 चेकपॉईंट चालवण्यासाठी ट्यूनिंग टेबल्स समाविष्ट आहेत. AMD आणि Nvidia यांच्यातील चिप वॉरवर ब्रेकिंग एआय न्यूज ट्रॅक करणाऱ्या वाचकांसाठी, परिणाम महत्त्वपूर्ण आहे कारण तो Nvidia चे नवीनतम आणि सर्वात महाग हार्डवेअर आवश्यक आहे या गृहीतकाला आव्हान देतो.

संख्या

vLLM च्या ROCm नाईटली बिल्डचा वापर करून पिन केलेल्या सॉफ्टवेअर स्टॅकवर मोजलेले बेंचमार्क केलेले कार्यप्रदर्शन, एकल AMD प्रवेगक काय करू शकतो याबद्दल एक आकर्षक कथा सांगते:

  • सिंगल-स्ट्रीम डीकोड: 168.6 टोकन प्रति सेकंद, रिअल-टाइम चॅट आणि एजंटिक वर्कलोडसाठी पुरेसे जलद.
  • प्रीफिल थ्रूपुट: ट्यून केलेल्या कर्नलसह अंदाजे 7,900 ते 8,500 टोकन प्रति सेकंद, म्हणजे लांब प्रॉम्प्ट्सवर एका सेकंदाच्या आत प्रक्रिया केली जाते.
  • आठ समवर्ती प्रवाह: प्रति सेकंद एकूण ५४२ टोकन, प्रति स्ट्रीम प्रति सेकंद ९०.३ टोकन्ससह.
  • 64-स्ट्रीम बर्स्ट: 830 टोकन प्रति सेकंद, मेमरीबाहेरील त्रुटी आणि इंजिनमध्ये बिघाड न होता.
  • संदर्भ लांबी: 256,000 टोकन्स चाचणीमध्ये प्रमाणित केले गेले आहेत, आर्किटेक्चर एक दशलक्ष पर्यंत समर्थित आहे.

संपूर्ण मॉडेलमध्ये 156.67 गीगाबाइट्सची उच्च-बँडविड्थ मेमरी आहे, जी पूर्णपणे MI300X च्या 192-gigabyte HBM3 पूलमध्ये बसते. कोणत्याही अतिरिक्त परिमाणीकरण किंवा वजन ऑफलोडिंगची आवश्यकता नव्हती, जे मॉडेलची पूर्ण अचूकता जतन करते.

MI300X का काम करते

AMD MI300X मध्ये दोन विशेषता आहेत ज्यामुळे एवढ्या मोठ्या मॉडेलचे सिंगल-GPU तैनात करणे शक्य होते. यात 192 गीगाबाइट्स HBM3 मेमरी, Nvidia H100 SXM5 च्या क्षमतेच्या 2.4 पट आणि मेमरी बँडविड्थ प्रति सेकंद 5.3 टेराबाइट्स आहे. फर्गस फिन नावाच्या डेव्हलपरचे वेगळे लेखन, ज्याने या उपयोजनासाठी पाया घातला, असा अंदाज आहे की MI300X ची किंमत सूचीच्या किमतीत तुलना करता येण्याजोग्या Nvidia हार्डवेअरच्या जवळपास निम्मी आहे.

या विशिष्ट 304-अब्ज-पॅरामीटर चेकपॉईंटसाठी, मेमरी क्षमता हा निर्णायक घटक आहे. मॉडेल पूर्णपणे ऑन-चिप मेमरीमध्ये बसते, 20-गीगाबाइट GPU की-व्हॅल्यू कॅशे पूल आणि बाहेर काढलेल्या उपसर्ग-कॅशे एंट्रीसाठी 96-गीगाबाइट CPU टियरसाठी जागा सोडते. एक कार्ड दोन ते आठ ठराविक समवर्ती प्रवाह हाताळू शकते आणि 64 पर्यंत प्रवाहांचे स्फोट होऊ शकते, जे अनेक उत्पादन अनुमान वर्कलोडसाठी पुरेसे आहे.

अभियांत्रिकी अडथळे

MI300X वर DeepSeek V4 Flash चालवणे सोपे नव्हते. अधिकृत vLLM रेसिपीमध्ये Nvidia हार्डवेअर आणि नवीन AMD GPU जसे की MI325X आणि MI355X समाविष्ट आहेत, परंतु 31 जुलैच्या चेकपॉईंटसाठी एकल-MI300X उत्पादन कॉन्फिगरेशन नाही.

रिपॉझिटरीमध्ये अनेक अभियांत्रिकी समस्यांचे दस्तऐवज आहेत ज्यांचे निराकरण करणे आवश्यक होते. MI300X FP8 नंबर फॉरमॅटचा एक प्रकार वापरतो जो नवीन AMD चिप्सद्वारे वापरल्या जाणाऱ्या मानकांपेक्षा वेगळा असतो आणि कर्नल जो चुकीचा शब्दार्थ गृहित धरतो तो दोन घटकांद्वारे परिणाम देऊ शकतो. डेव्हलपरला उच्च समनुमान, कारणात्मक सट्टा पडताळणी आणि CPU की-व्हॅल्यू सिंक्रोनाइझेशनवर तज्ञांचे मिश्रण देखील निश्चित करावे लागले, ज्यापैकी अनेक अपस्ट्रीम vLLM मध्ये अनिश्चित राहतात.

रेपॉजिटरी अचूकतेचे आच्छादन, सट्टा मसुद्यासह प्रमाणित सर्व्हिंग कॉन्फिगरेशन, पॅकेज केलेल्या टेबल गहाळ असलेल्या चिप आकारांसाठी AITER GEMM ट्यूनिंग टेबल आणि एक हायब्रिड की-व्हॅल्यू स्ट्रॅटेजी जोडते जी CPU ऑफलोडसह GPU कॅशे एकत्र करते.

चिप युद्धासाठी याचा अर्थ काय आहे

प्रात्यक्षिक AI मधील AMD च्या महत्त्वाकांक्षेसाठी एका निर्णायक क्षणी पोहोचते. Nvidia AI त्वरक बाजारपेठेतील बहुसंख्य भाग नियंत्रित करते, त्याच्या CUDA सॉफ्टवेअर इकोसिस्टमने बळकट केले आहे, ज्याला अनेक विकासक एक खंदक म्हणून पाहतात ज्याला AMD पार करण्यासाठी संघर्ष करत आहे. अर्धविश्लेषणाने थेट जुलै 2026 च्या विश्लेषणात "AMD CUDA खंदक तोडू शकतो?" आणि उत्तर विवादित राहते.

परंतु यासारखे मुक्त-स्रोत प्रकल्प समज अंतरावर एक चिप दूर आहेत. जर एकच MI300X स्पर्धात्मक वेगाने फ्रंटियर-स्केल मॉडेल सर्व्ह करू शकत असेल, तर AMD साठी खर्चाचा युक्तिवाद रद्द करणे कठीण होईल. AMD स्वतःचे ओपन मॉडेल पोर्टफोलिओ देखील तयार करत आहे, Instella-MoE-16B, पूर्णपणे उघडलेले मॉडेल, त्याच्या स्वतःच्या Instinct GPUs वर सुरवातीपासून प्रशिक्षित केलेले, आणि Zyphra सोबत 15-megawatt MI355X प्लॅटफॉर्मवर भागीदारी करत आहे.

दरम्यान, डीपसीक स्वतः फ्रंटियर एआयची किंमत कमी करत आहे. V4 फ्लॅश मॉडेल हे आधीपासून संशोधन फर्मच्या विश्लेषणानुसार चालणारे सर्वात स्वस्त सुप्रसिद्ध मॉडेल होते, जीपीटी-5.6 लुनाशी 60 टक्के कमी किमतीत जुळणारे. स्वस्त AMD हार्डवेअरसह, Nvidia इकोसिस्टमच्या बाहेर मोठ्या मॉडेलची सेवा देण्याचे अर्थशास्त्र वेगाने सुधारत आहे.

मुक्त स्रोत फायदा

रिपॉझिटरी 2026 AI डेव्हलपमेंटमध्ये एक व्यापक थीम अधोरेखित करते: ओपन-वेट मॉडेल्स आणि ओपन-सोर्स इन्फरन्स टूलींग स्वतंत्र अभियंत्यांना एकेकाळी चांगल्या-अनुदानित लॅबचे खास डोमेन असलेल्या तैनातीची प्रतिकृती आणि ऑप्टिमाइझ करणे शक्य करत आहेत. संपूर्ण कॉन्फिगरेशन, ट्यूनिंग टेबल्स आणि मार्गात निश्चित केलेल्या विशिष्ट बग्स प्रकाशित करून, गंभीर AI वर्कलोड्ससाठी AMD हार्डवेअरचा विचार करणाऱ्या प्रत्येकासाठी हे काम अडथळा कमी करते.

AI च्या पुढे रहा

AI अनुमानासाठी AMD आणि Nvidia मधील लढाई तीव्र होत आहे आणि या तैनातीसारख्या मुक्त-स्रोत योगदानामुळे स्पर्धात्मक लँडस्केप शांतपणे बदलत आहे. हार्डवेअर, ओपन मॉडेल्स आणि इन्फ्रास्ट्रक्चरमधील नवीनतम AI घडामोडी साठी, आमच्या कव्हरेजमध्ये रहा.

अधिक AI बातम्या वाचा →