អ្នកអភិវឌ្ឍន៍ឯករាជ្យបានបង្ហាញថាគំរូ V4 Flash របស់ DeepSeek ដែលជាប្រព័ន្ធចម្រុះនៃអ្នកជំនាញចំនួន 304 ពាន់លានអាចដំណើរការក្នុងការផលិតនៅលើ AMD MI300X GPU តែមួយដោយសម្រេចបាន 168.6 ថូខឹនក្នុងមួយវិនាទីក្នុងការឌិកូដស្ទ្រីមតែមួយដោយមិនមានបរិមាណទម្ងន់ឬការផ្ទុកលើសទម្ងន់។ ការងារដែលត្រូវបានបោះពុម្ពផ្សាយនៅលើ GitHub និងឈានទៅដល់កំពូលនៃព័ត៌មាន Hacker នៅថ្ងៃទី 4 ខែសីហា ឆ្នាំ 2026 ផ្តល់នូវភស្តុតាងច្បាស់លាស់បំផុតដែលថាផ្នែករឹងរបស់ AMD អាចបម្រើគំរូបើកចំហរព្រំដែនដោយមិនពឹងផ្អែកលើ Nvidia ។

ឃ្លាំងដែលរក្សាដោយអ្នកអភិវឌ្ឍន៍ Ryan Zhou រួមមានជង់ Docker Compose ពេញលេញ ការបិទភ្ជាប់ឯកសារដែលបានដាក់ និងតារាងលៃតម្រូវសម្រាប់ដំណើរការចំណុចត្រួតពិនិត្យ DeepSeek-V4-Flash-0731 នៅលើ MI300X មួយ។ សម្រាប់អ្នកអានដែលតាមដាន [ព័ត៌មាន AI បែកធ្លាយ] (https://aibuzzwire.news) លើសង្រ្គាមបន្ទះឈីបរវាង AMD និង Nvidia លទ្ធផលគឺសំខាន់ព្រោះវាប្រឈមនឹងការសន្មត់ថាការសន្និដ្ឋានព្រំដែនទាមទារផ្នែករឹងចុងក្រោយបំផុត និងថ្លៃបំផុតរបស់ Nvidia ។

លេខ

ការអនុវត្តស្តង់ដារដែលត្រូវបានវាស់វែងនៅលើជង់កម្មវិធីដែលបានខ្ទាស់ដោយប្រើការស្ថាបនា ROCm នៅពេលយប់នៃ vLLM ប្រាប់រឿងគួរឱ្យចាប់អារម្មណ៍អំពីអ្វីដែលឧបករណ៍បង្កើនល្បឿន AMD តែមួយអាចធ្វើបាន:

  • ឌិកូដស្ទ្រីមតែមួយ៖ 168.6 ថូខឹនក្នុងមួយវិនាទី លឿនគ្រប់គ្រាន់សម្រាប់ការជជែកតាមពេលវេលាពិត និងបន្ទុកការងារភ្នាក់ងារ។
  • បញ្ចូលទឹកប្រាក់ជាមុន៖ ប្រហែល 7,900 ទៅ 8,500 ថូខឹនក្នុងមួយវិនាទីជាមួយនឹងខឺណែលដែលបានកែតម្រូវ មានន័យថាការជម្រុញដ៏វែងត្រូវបានដំណើរការក្នុងរយៈពេលមួយវិនាទី។
  • ប្រាំបីស្ទ្រីមស្របគ្នា: 542 សញ្ញាសម្ងាត់ក្នុងមួយវិនាទីសរុបជាមួយនឹង 90.3 ថូខឹនក្នុងមួយវិនាទីក្នុងមួយស្ទ្រីម។
  • 64-stream burst: 830 tokens ក្នុងមួយវិនាទីសរុប ដោយគ្មានកំហុសចេញពីអង្គចងចាំ និងមិនមានបញ្ហាម៉ាស៊ីន។
  • ប្រវែងបរិបទ៖ សញ្ញាសម្ងាត់ 256,000 ត្រូវបានធ្វើឱ្យមានសុពលភាពក្នុងការធ្វើតេស្ត ដោយស្ថាបត្យកម្មអាចគាំទ្រដល់ទៅមួយលាន។

ម៉ូដែលទាំងមូលកាន់កាប់ 156.67 ជីហ្គាបៃនៃអង្គចងចាំកម្រិតបញ្ជូនខ្ពស់ដែលសមទាំងស្រុងនៅក្នុងអាង HBM3 192 ជីហ្គាបៃរបស់ MI300X ។ មិនចាំបាច់មានការគណនាបរិមាណបន្ថែម ឬទម្ងន់លើសទេ ដែលរក្សាភាពត្រឹមត្រូវពេញលេញរបស់ម៉ូដែល។

ហេតុអ្វីបានជា MI300X ដំណើរការ

AMD MI300X មានគុណលក្ខណៈពីរដែលធ្វើឱ្យការដាក់ពង្រាយតែមួយ GPU នៃគំរូដែលអាចធ្វើទៅបាន។ វាមានអង្គចងចាំ HBM3 ចំនួន 192 ជីហ្គាបៃ ដែលមានសមត្ថភាព 2.4 ដងនៃ Nvidia H100 SXM5 និង 5.3 terabytes ក្នុងមួយវិនាទីនៃកម្រិតបញ្ជូននៃអង្គចងចាំ។ ការសរសេរដាច់ដោយឡែកមួយដោយអ្នកអភិវឌ្ឍន៍ដែលត្រូវបានកំណត់ថាជា Fergus Finn ដែលដាក់មូលដ្ឋានគ្រឹះសម្រាប់ការដាក់ពង្រាយនេះ បានប៉ាន់ប្រមាណថា MI300X មានតម្លៃប្រហែលពាក់កណ្តាលស្មើនឹងផ្នែករឹង Nvidia ដែលអាចប្រៀបធៀបបានក្នុងតម្លៃបញ្ជី។

សម្រាប់ចំណុចត្រួតពិនិត្យប៉ារ៉ាម៉ែត្រពិសេស 304 ពាន់លាន សមត្ថភាពអង្គចងចាំគឺជាកត្តាសម្រេចចិត្ត។ ម៉ូដែលនេះសមទាំងស្រុងនៅក្នុងអង្គចងចាំនៅលើបន្ទះឈីប ដោយទុកកន្លែងសម្រាប់ឃ្លាំងសម្ងាត់ GPU 20-gigabyte key-value cache និងថ្នាក់ CPU 96-gigabyte សម្រាប់ការបណ្តេញចេញ prefix-cache entries។ កាតមួយអាចគ្រប់គ្រងចរន្តស្របគ្នាធម្មតាពី 2 ទៅ 8 ដង និងការផ្ទុះរហូតដល់ 64 ស្ទ្រីម ដែលវាគ្រប់គ្រាន់សម្រាប់បន្ទុកការងារផលិតកម្មជាច្រើន។

ឧបសគ្គផ្នែកវិស្វកម្ម

ការដំណើរការ DeepSeek V4 Flash នៅលើ MI300X គឺមិនត្រង់ទេ។ រូបមន្ត vLLM ផ្លូវការគ្របដណ្តប់លើផ្នែករឹង Nvidia និង AMD GPUs ថ្មីៗដូចជា MI325X និង MI355X ប៉ុន្តែមិនមែនជាការកំណត់រចនាសម្ព័ន្ធផលិតកម្ម MI300X តែមួយសម្រាប់ចំណុចត្រួតពិនិត្យថ្ងៃទី 31 ខែកក្កដានោះទេ។

ឃ្លាំងផ្ទុកឯកសារបញ្ហាវិស្វកម្មជាច្រើនដែលត្រូវដោះស្រាយ។ MI300X ប្រើបំរែបំរួលនៃទម្រង់លេខ FP8 ដែលខុសពីស្តង់ដារដែលប្រើដោយបន្ទះឈីប AMD ថ្មី ហើយខឺណែលដែលសន្មត់ថាពាក្យខុសអាចបង្កើតលទ្ធផលដោយកត្តាពីរ។ អ្នកអភិវឌ្ឍន៍ក៏ត្រូវជួសជុលការបញ្ជូនអ្នកជំនាញចម្រុះដោយភាពស្របគ្នាខ្ពស់ ការផ្ទៀងផ្ទាត់ការប៉ាន់ស្មានមូលហេតុ និងការធ្វើសមកាលកម្មតម្លៃគ្រាប់ចុចស៊ីភីយូ ដែលភាគច្រើននៅតែមិនជួសជុលនៅក្នុង vLLM ខាងលើ។

ឃ្លាំងបន្ថែមការត្រួតលើគ្នាត្រឹមត្រូវ ការកំណត់រចនាសម្ព័ន្ធការបម្រើដែលមានសុពលភាពជាមួយនឹងសេចក្តីព្រាងការប៉ាន់ស្មាន តារាងលៃតម្រូវ AITER GEMM សម្រាប់រូបរាងបន្ទះឈីបដែលតារាងដែលបានខ្ចប់បានបាត់ និងយុទ្ធសាស្ត្រតម្លៃកូនកាត់ដែលរួមបញ្ចូលគ្នានូវឃ្លាំងសម្ងាត់ GPU ជាមួយនឹងការបិទដំណើរការស៊ីភីយូ។

តើវាមានន័យយ៉ាងណាសម្រាប់សង្គ្រាមឈីប

ការបង្ហាញមកដល់ពេលដ៏សំខាន់សម្រាប់មហិច្ឆតារបស់ AMD នៅក្នុង AI ។ Nvidia គ្រប់គ្រងទីផ្សារឧបករណ៍បង្កើនល្បឿន AI ភាគច្រើនលើសលប់ ដែលត្រូវបានសង្កត់ដោយប្រព័ន្ធអេកូសូហ្វវែរ CUDA របស់ខ្លួន ដែលអ្នកអភិវឌ្ឍន៍ជាច្រើនមើលឃើញថាជាស្នាមភ្លោះដែល AMD បានតស៊ូឆ្លងកាត់។ SemiAnalysis បានពិនិត្យមើលសំណួរនោះដោយផ្ទាល់នៅក្នុងការវិភាគខែកក្កដាឆ្នាំ 2026 ដែលមានចំណងជើងថា "តើ AMD អាចបំបែក CUDA moat បានទេ?" ហើយ​ចម្លើយ​នៅ​តែ​ជំទាស់។

ប៉ុន្តែគម្រោងប្រភពបើកចំហដូចជាបន្ទះឈីបមួយនេះនៅឆ្ងាយពីគម្លាតនៃការយល់ឃើញ។ ប្រសិនបើ MI300X តែមួយអាចបម្រើគំរូខ្នាតព្រំដែនក្នុងល្បឿនប្រកួតប្រជែង នោះអាគុយម៉ង់តម្លៃសម្រាប់ AMD កាន់តែពិបាកក្នុងការច្រានចោល។ AMD ក៏បាននិងកំពុងបង្កើតផលប័ត្រគំរូបើកចំហរបស់ខ្លួនផងដែរ ដោយបញ្ចេញ Instella-MoE-16B ដែលជាគំរូបើកចំហពេញលេញដែលត្រូវបានបណ្តុះបណ្តាលពីដំបូងនៅលើ Instinct GPUs របស់ខ្លួន និងចាប់ដៃគូជាមួយ Zyphra នៅលើវេទិកា MI355X កម្លាំង 15 មេហ្គាវ៉ាត់។

ទន្ទឹមនឹងនេះដែរ DeepSeek ខ្លួនវាបាននឹងកំពុងកាត់បន្ថយតម្លៃនៃ AI ព្រំដែន។ ម៉ូដែល V4 Flash គឺជាគំរូដ៏ល្បីដែលថោកបំផុតដែលដំណើរការយោងទៅតាមការវិភាគរបស់ក្រុមហ៊ុនស្រាវជ្រាវ ដោយត្រូវគ្នានឹង GPT-5.6 Luna ក្នុងការចំណាយទាបជាង 60 ភាគរយ។ រួមបញ្ចូលគ្នាជាមួយផ្នែករឹង AMD ដែលមានតម្លៃថោក សេដ្ឋកិច្ចនៃការបម្រើម៉ូដែលធំៗនៅខាងក្រៅប្រព័ន្ធអេកូ Nvidia កំពុងមានភាពប្រសើរឡើងយ៉ាងឆាប់រហ័ស។

អត្ថប្រយោជន៍ប្រភពបើកចំហ

ឃ្លាំងនេះគូសបញ្ជាក់ពីប្រធានបទដ៏ទូលំទូលាយនៅក្នុងការអភិវឌ្ឍន៍ AI ឆ្នាំ 2026៖ គំរូទម្ងន់បើកចំហ និងឧបករណ៍សន្និដ្ឋានប្រភពបើកចំហកំពុងធ្វើឱ្យវាអាចធ្វើទៅបានសម្រាប់វិស្វករឯករាជ្យក្នុងការចម្លង និងបង្កើនប្រសិទ្ធភាពការដាក់ពង្រាយដែលធ្លាប់ជាដែនផ្តាច់មុខនៃមន្ទីរពិសោធន៍ដែលទទួលបានមូលនិធិល្អ។ តាមរយៈការបោះផ្សាយការកំណត់រចនាសម្ព័ន្ធពេញលេញ តារាងលៃតម្រូវ និងកំហុសជាក់លាក់ដែលបានជួសជុលតាមផ្លូវ ការងារនេះបន្ថយរបាំងសម្រាប់អ្នកដែលពិចារណាលើផ្នែករឹងរបស់ AMD សម្រាប់បន្ទុកការងារ AI ធ្ងន់ធ្ងរ។

នាំមុខ AI

ការប្រយុទ្ធគ្នារវាង AMD និង Nvidia សម្រាប់ការសន្និដ្ឋានរបស់ AI កំពុងកាន់តែខ្លាំង ហើយការរួមចំណែកប្រភពបើកចំហដូចជាការដាក់ពង្រាយនេះកំពុងផ្លាស់ប្តូរទិដ្ឋភាពប្រកួតប្រជែងដោយស្ងប់ស្ងាត់។ សម្រាប់ [ការវិវឌ្ឍន៍ AI ចុងក្រោយបង្អស់] (https://aibuzzwire.news) នៅក្នុងផ្នែករឹង ម៉ូដែលបើកចំហ និងហេដ្ឋារចនាសម្ព័ន្ធ សូមរក្សាការគ្របដណ្តប់របស់យើង។

អានព័ត៌មាន AI បន្ថែម →