டீப்சீக்கின் V4 ஃப்ளாஷ் மாடல், 304 பில்லியன் அளவுருக் கலவை-நிபுணர் அமைப்பு, ஒரு AMD MI300X GPU இல் உற்பத்தியில் இயங்க முடியும் என்பதை ஒரு சுயாதீன டெவலப்பர் நிரூபித்துள்ளார். ஆகஸ்ட் 4, 2026 அன்று GitHub இல் வெளியிடப்பட்ட இந்த வேலை, ஹேக்கர் செய்திகளின் மேல் வெளிவருகிறது, AMD இன் ஹார்டுவேர் என்விடியாவை நம்பாமல் எல்லைப்புற அளவிலான திறந்த மாதிரியை வழங்க முடியும் என்பதற்கான தெளிவான ஆதாரத்தை வழங்குகிறது.
டெவலப்பர் Ryan Zhou ஆல் பராமரிக்கப்படும் களஞ்சியமானது, ஒரு MI300X இல் DeepSeek-V4-Flash-0731 சோதனைச் சாவடியை இயக்குவதற்கான முழுமையான டோக்கர் கம்போஸ் ஸ்டாக், பின் செய்யப்பட்ட கோப்பு மேலடுக்குகள் மற்றும் டியூனிங் டேபிள்களை உள்ளடக்கியது. AMD மற்றும் Nvidia இடையேயான சிப் போரில் பிரேக்கிங் AI செய்திகள் வாசகர்களுக்கு, முடிவு முக்கியமானது, ஏனெனில் இது எல்லைப்புற அனுமானத்திற்கு என்விடியாவின் சமீபத்திய மற்றும் மிகவும் விலையுயர்ந்த வன்பொருள் தேவை என்ற அனுமானத்தை சவால் செய்கிறது.
எண்கள்
VLLM இன் ROCm நைட்லி கட்டமைப்பைப் பயன்படுத்தி பின் செய்யப்பட்ட மென்பொருள் அடுக்கில் அளவிடப்பட்ட தரப்படுத்தப்பட்ட செயல்திறன், ஒரு AMD முடுக்கி என்ன செய்ய முடியும் என்பதைப் பற்றிய ஒரு அழுத்தமான கதையைச் சொல்கிறது:
- சிங்கிள் ஸ்ட்ரீம் டிகோட்: வினாடிக்கு 168.6 டோக்கன்கள், நிகழ்நேர அரட்டை மற்றும் ஏஜென்டிக் பணிச்சுமைகளுக்கு போதுமான வேகம்.
- ப்ரீஃபில் த்ரோபுட்: டியூன் செய்யப்பட்ட கர்னல்களுடன் ஒரு வினாடிக்கு தோராயமாக 7,900 முதல் 8,500 டோக்கன்கள்.
- எட்டு ஒத்திசைவு ஸ்ட்ரீம்கள்: ஒரு வினாடிக்கு மொத்தம் 542 டோக்கன்கள், ஒரு ஸ்ட்ரீமுக்கு வினாடிக்கு 90.3 டோக்கன்கள்.
- 64-ஸ்ட்ரீம் பர்ஸ்ட்: ஒரு நொடிக்கு 830 டோக்கன்கள், நினைவாற்றல் இல்லாத பிழைகள் மற்றும் எஞ்சின் செயலிழப்புகள் இல்லை.
- சூழல் நீளம்: 256,000 டோக்கன்கள் சோதனையில் சரிபார்க்கப்பட்டன, கட்டிடக்கலை ஒரு மில்லியன் வரை ஆதரிக்கிறது.
முழு மாடலும் 156.67 ஜிகாபைட் உயர் அலைவரிசை நினைவகத்தை ஆக்கிரமித்துள்ளது, இது MI300X இன் 192-ஜிகாபைட் HBM3 பூலுக்கு முழுமையாக பொருந்தும். கூடுதல் அளவீடு அல்லது எடை ஏற்றுதல் தேவையில்லை, இது மாதிரியின் முழுத் துல்லியத்தைப் பாதுகாக்கிறது.
MI300X ஏன் வேலை செய்கிறது
AMD MI300X இரண்டு பண்புக்கூறுகளைக் கொண்டுள்ளது, இது ஒரு மாதிரியின் ஒற்றை-GPU வரிசைப்படுத்தலை இவ்வளவு பெரியதாகச் சாத்தியமாக்குகிறது. இது 192 ஜிகாபைட் எச்பிஎம்3 நினைவகத்தையும், என்விடியா எச்100 எஸ்எக்ஸ்எம்5ஐ விட 2.4 மடங்கு திறன் கொண்டது, மேலும் ஒரு நொடிக்கு 5.3 டெராபைட் நினைவக அலைவரிசையையும் கொண்டுள்ளது. ஃபெர்கஸ் ஃபின் என அடையாளம் காணப்பட்ட ஒரு டெவலப்பர் எழுதிய ஒரு தனி பதிவு, இந்த வரிசைப்படுத்தலுக்கான அடித்தளத்தை அமைத்தது, MI300X ஆனது பட்டியல் விலையில் ஒப்பிடக்கூடிய Nvidia வன்பொருளை விட தோராயமாக பாதி செலவாகும் என்று மதிப்பிட்டுள்ளது.
இந்த குறிப்பிட்ட 304 பில்லியன் அளவுரு சோதனைச் சாவடிக்கு, நினைவகத் திறன் தீர்க்கமான காரணியாகும். இந்த மாடல் முழுவதுமாக ஆன்-சிப் நினைவகத்தில் பொருந்துகிறது, இது 20-ஜிகாபைட் GPU கீ-மதிப்பு கேச் பூல் மற்றும் வெளியேற்றப்பட்ட முன்னொட்டு-கேச் உள்ளீடுகளுக்கு 96-ஜிகாபைட் CPU அடுக்கு ஆகியவற்றிற்கு இடமளிக்கிறது. ஒரு கார்டு இரண்டு முதல் எட்டு பொதுவான ஒரே நேரத்தில் ஸ்ட்ரீம்கள் மற்றும் 64 ஸ்ட்ரீம்கள் வரை வெடிப்புகள் ஆகியவற்றைக் கையாள முடியும், இது பல உற்பத்தி அனுமானப் பணிச்சுமைகளுக்குப் போதுமானது.
பொறியியல் தடைகள்
MI300X இல் DeepSeek V4 Flashஐ இயக்குவது நேரடியானதல்ல. அதிகாரப்பூர்வ vLLM செய்முறையானது என்விடியா வன்பொருள் மற்றும் MI325X மற்றும் MI355X போன்ற புதிய AMD GPUகளை உள்ளடக்கியது, ஆனால் ஜூலை 31 சோதனைச் சாவடிக்கான ஒற்றை-MI300X தயாரிப்பு உள்ளமைவு அல்ல.
தீர்க்கப்பட வேண்டிய பல பொறியியல் சிக்கல்களை களஞ்சியம் ஆவணப்படுத்துகிறது. MI300X ஆனது FP8 எண் வடிவமைப்பின் மாறுபாட்டைப் பயன்படுத்துகிறது, இது புதிய AMD சில்லுகளால் பயன்படுத்தப்படும் தரநிலையிலிருந்து வேறுபடுகிறது, மேலும் தவறான சொற்பொருள்கள் இரண்டு மடங்கு முடிவுகளைத் தரும் என்று கருதும் கர்னல். டெவலப்பர், உயர் ஒத்திசைவு, காரண ஊக சரிபார்ப்பு மற்றும் CPU விசை-மதிப்பு ஒத்திசைவு ஆகியவற்றில் வல்லுநர்களின் கலவையை சரிசெய்ய வேண்டியிருந்தது, அவற்றில் பல அப்ஸ்ட்ரீம் vLLM இல் சரி செய்யப்படவில்லை.
களஞ்சியமானது சரியான மேலடுக்குகள், ஊக வரைவுடனான சரிபார்க்கப்பட்ட சேவை உள்ளமைவு, தொகுக்கப்பட்ட அட்டவணைகள் காணாமல் போன சிப் வடிவங்களுக்கான AITER GEMM டியூனிங் டேபிள்கள் மற்றும் CPU ஆஃப்லோடுடன் GPU தற்காலிக சேமிப்பை இணைக்கும் ஒரு கலப்பின விசை மதிப்பு உத்தி ஆகியவற்றைச் சேர்க்கிறது.
சிப் போருக்கு என்ன அர்த்தம்
AI இல் AMD இன் லட்சியங்களுக்கான ஒரு முக்கிய தருணத்தில் இந்த ஆர்ப்பாட்டம் வருகிறது. என்விடியா AI ஆக்சிலரேட்டர் சந்தையின் பெரும்பகுதியைக் கட்டுப்படுத்துகிறது, அதன் CUDA மென்பொருள் சுற்றுச்சூழலால் கட்டுப்படுத்தப்படுகிறது, பல டெவலப்பர்கள் AMD கடக்க சிரமப்பட்ட ஒரு அகழி என்று பார்க்கிறார்கள். "AMD CUDA அகழியை உடைக்க முடியுமா?" என்ற தலைப்பில் ஜூலை 2026 பகுப்பாய்வில் அந்தக் கேள்வியை SemiAnalysis நேரடியாக ஆய்வு செய்தது. மற்றும் பதில் போட்டியாக உள்ளது.
ஆனால் இது போன்ற ஓப்பன் சோர்ஸ் ப்ராஜெக்ட்கள் கருத்து இடைவெளியில் ஒரு சிப் தொலைவில் இருக்கும். ஒரு ஒற்றை MI300X ஒரு எல்லை-அளவிலான மாதிரியை போட்டி வேகத்தில் வழங்க முடிந்தால், AMDக்கான விலை வாதத்தை நிராகரிப்பது கடினமாகிறது. AMD தனது சொந்த ஓப்பன் மாடல் போர்ட்ஃபோலியோவை உருவாக்கி வருகிறது, Instella-MoE-16B ஐ வெளியிடுகிறது, இது அதன் சொந்த Instinct GPU களில் புதிதாக பயிற்சியளிக்கப்பட்ட ஒரு முழுமையான திறந்த மாதிரி, மற்றும் 15-மெகாவாட் MI355X இயங்குதளத்தில் Zyphra உடன் கூட்டு சேர்ந்துள்ளது.
இதற்கிடையில், DeepSeek தானே எல்லை AI இன் விலையை குறைத்து வருகிறது. V4 ஃப்ளாஷ் மாடல் ஏற்கனவே ஆராய்ச்சி நிறுவனத்தின் பகுப்பாய்வின்படி இயங்கும் மலிவான நன்கு அறியப்பட்ட மாடலாக இருந்தது, GPT-5.6 Luna உடன் 60 சதவீதம் குறைந்த செலவில் பொருந்துகிறது. மலிவான AMD வன்பொருளுடன் இணைந்து, என்விடியா சுற்றுச்சூழலுக்கு வெளியே பெரிய மாடல்களுக்கு சேவை செய்யும் பொருளாதாரம் வேகமாக மேம்பட்டு வருகிறது.
திறந்த மூல நன்மை
2026 AI மேம்பாட்டில் இந்த களஞ்சியம் ஒரு பரந்த கருப்பொருளை அடிக்கோடிட்டுக் காட்டுகிறது: திறந்த எடை மாதிரிகள் மற்றும் திறந்த மூல அனுமானக் கருவி ஆகியவை சுயாதீன பொறியாளர்களுக்கு நன்கு நிதியளிக்கப்பட்ட ஆய்வகங்களின் பிரத்யேக களமாக இருந்த வரிசைப்படுத்தல்களை நகலெடுத்து மேம்படுத்துவதை சாத்தியமாக்குகிறது. முழு உள்ளமைவு, ட்யூனிங் டேபிள்கள் மற்றும் குறிப்பிட்ட பிழைகள் ஆகியவற்றை வெளியிடுவதன் மூலம், தீவிர AI பணிச்சுமைகளுக்கு AMD வன்பொருளைக் கருத்தில் கொள்ளும் எவருக்கும் வேலை தடையை குறைக்கிறது.
AIக்கு முன்னால் இருங்கள்
AI அனுமானத்திற்காக AMD மற்றும் Nvidia இடையேயான போர் தீவிரமடைந்து வருகிறது, மேலும் இந்த வரிசைப்படுத்தல் போன்ற திறந்த மூல பங்களிப்புகள் போட்டி நிலப்பரப்பை அமைதியாக மாற்றுகின்றன. வன்பொருள், திறந்த மாதிரிகள் மற்றும் உள்கட்டமைப்பு ஆகியவற்றில் சமீபத்திய AI மேம்பாடுகளுக்கு எங்கள் கவரேஜுடன் இருங்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →