أظهر مطور مستقل أن نموذج DeepSeek V4 Flash، وهو نظام مكون من 304 مليار معلمة من الخبراء، يمكن تشغيله في الإنتاج على وحدة معالجة رسومات AMD MI300X واحدة، مما يحقق 168.6 رمزًا مميزًا في الثانية في فك التشفير أحادي التدفق دون أي تكميم للوزن أو تفريغ. يقدم العمل، المنشور على GitHub والذي ظهر في الجزء العلوي من Hacker News في 4 أغسطس 2026، أوضح دليل حتى الآن على أن أجهزة AMD يمكن أن تخدم نموذجًا مفتوحًا على نطاق حدودي دون الاعتماد على Nvidia.
يتضمن المستودع، الذي يحتفظ به المطور Ryan Zhou، مكدس Docker Compose كاملًا وتراكبات الملفات المثبتة وجداول الضبط لتشغيل نقطة تفتيش DeepSeek-V4-Flash-0731 على جهاز MI300X واحد. بالنسبة للقراء الذين يتتبعون [أخبار الذكاء الاصطناعي العاجلة] (https://aibuzzwire.news) حول حرب الرقائق بين AMD وNvidia، فإن النتيجة مهمة لأنها تتحدى الافتراض القائل بأن الاستدلال الحدودي يتطلب أحدث أجهزة Nvidia وأكثرها تكلفة.
الأرقام
يحكي الأداء المعياري، الذي تم قياسه على مجموعة برامج مثبتة باستخدام ROCm للإنشاء الليلي لـ vLLM، قصة مقنعة حول ما يمكن أن يفعله مسرع AMD واحد:
- فك التشفير أحادي الدفق: 168.6 رمزًا مميزًا في الثانية، وهو سريع بما يكفي للدردشة في الوقت الفعلي وأعباء عمل الوكلاء.
- إنتاجية التعبئة المسبقة: ما يقرب من 7,900 إلى 8,500 رمز مميز في الثانية باستخدام النواة المضبوطة، مما يعني معالجة المطالبات الطويلة في أقل من ثانية.
- ثمانية عمليات بث متزامنة: 542 رمزًا مميزًا في الثانية بشكل إجمالي، مع 90.3 رمزًا مميزًا في الثانية لكل بث.
- 64 دفقًا متتابعًا: 830 رمزًا مميزًا في الثانية الإجمالية، مع عدم وجود أخطاء في الذاكرة أو فشل في المحرك.
- طول السياق: تم التحقق من صحة 256000 رمز مميز في الاختبار، مع دعم البنية لما يصل إلى مليون رمز.
يحتل الطراز بأكمله 156.67 جيجابايت من الذاكرة ذات النطاق الترددي العالي، مما يتناسب تمامًا مع مجموعة HBM3 بسعة 192 جيجابايت الخاصة بجهاز MI300X. ولم تكن هناك حاجة إلى تكميم إضافي أو تفريغ الوزن، مما يحافظ على دقة النموذج الكاملة.
لماذا يعمل جهاز MI300X
تمتلك AMD MI300X سمتين تجعلان نشر وحدة معالجة الرسومات الفردية لنموذج بهذا الحجم ممكنًا. يحتوي على 192 جيجابايت من ذاكرة HBM3، أي 2.4 ضعف سعة Nvidia H100 SXM5، و5.3 تيرابايت في الثانية من عرض النطاق الترددي للذاكرة. قدرت مقالة منفصلة من قبل مطور تم تحديده باسم Fergus Finn، والذي وضع الأساس لهذا النشر، أن تكلفة MI300X تقريبًا نصف تكلفة أجهزة Nvidia المماثلة بقائمة الأسعار.
بالنسبة لنقطة التفتيش هذه التي تحتوي على 304 مليار معلمة، فإن سعة الذاكرة هي العامل الحاسم. يتلاءم النموذج بالكامل مع الذاكرة الموجودة على الشريحة، مما يترك مساحة لتجمع ذاكرة التخزين المؤقت لقيمة مفتاح GPU بسعة 20 جيجابايت وطبقة وحدة المعالجة المركزية بسعة 96 جيجابايت لإدخالات ذاكرة التخزين المؤقت للبادئة التي تم إخلاؤها. يمكن لبطاقة واحدة التعامل مع اثنين إلى ثمانية تدفقات متزامنة نموذجية ودفعات تصل إلى 64 تدفقًا، وهو ما يكفي للعديد من أعباء عمل استدلال الإنتاج.
العقبات الهندسية
لم يكن تشغيل DeepSeek V4 Flash على جهاز MI300X أمرًا سهلاً. تغطي وصفة vLLM الرسمية أجهزة Nvidia ووحدات معالجة الرسوميات AMD الأحدث مثل MI325X وMI355X، ولكن ليس تكوين إنتاج MI300X فرديًا لنقطة تفتيش 31 يوليو.
يوثق المستودع العديد من المشاكل الهندسية التي كان لا بد من حلها. يستخدم MI300X متغيرًا من تنسيق الأرقام FP8 الذي يختلف عن المعيار المستخدم بواسطة شرائح AMD الأحدث، ونواة تفترض أن الدلالات الخاطئة يمكن أن تنتج نتائج بعامل اثنين. كان على المطور أيضًا إصلاح توجيه خليط الخبراء بتزامن عالٍ، والتحقق السببي من المضاربة، ومزامنة قيمة مفتاح وحدة المعالجة المركزية، والتي يظل العديد منها غير مثبت في vLLM المنبع.
يضيف المستودع تراكبات صحيحة، وتكوين خدمة تم التحقق من صحته مع صياغة تخمينية، وجداول ضبط AITER GEMM لأشكال الرقائق التي كانت الجداول المعبأة مفقودة، واستراتيجية قيمة مفتاح مختلطة تجمع بين ذاكرة التخزين المؤقت لوحدة معالجة الرسومات وإلغاء تحميل وحدة المعالجة المركزية.
ماذا يعني ذلك بالنسبة لحرب الرقائق
يأتي العرض في لحظة محورية لطموحات AMD في مجال الذكاء الاصطناعي. تسيطر شركة Nvidia على الأغلبية الساحقة من سوق مسرعات الذكاء الاصطناعي، مدعومة بنظامها البيئي لبرامج CUDA، والذي يعتبره العديد من المطورين بمثابة خندق تكافح شركة AMD لعبوره. قامت شركة SemiAnalogy بفحص هذا السؤال مباشرة في تحليل صدر في يوليو 2026 بعنوان "هل تستطيع AMD كسر خندق CUDA؟" ويظل الجواب محل نزاع.
لكن المشاريع مفتوحة المصدر مثل هذه تعمل على سد فجوة الإدراك. إذا كان جهاز MI300X واحدًا يمكنه أن يخدم نموذجًا حدوديًا بسرعات تنافسية، يصبح من الصعب رفض حجة التكلفة الخاصة بشركة AMD. قامت AMD أيضًا ببناء محفظة النماذج المفتوحة الخاصة بها، حيث أطلقت Instella-MoE-16B، وهو نموذج مفتوح بالكامل تم تدريبه من الصفر على وحدات معالجة الرسوميات Instinct الخاصة بها، والشراكة مع Zyphra على منصة MI355X بقدرة 15 ميجاوات.
وفي الوقت نفسه، كان برنامج DeepSeek نفسه يعمل على خفض تكلفة الذكاء الاصطناعي الحدودي. كان طراز V4 Flash بالفعل هو أرخص طراز معروف تم تشغيله وفقًا لتحليل شركة الأبحاث، حيث كان يطابق GPT-5.6 Luna بتكلفة أقل بنسبة 60 بالمائة. إلى جانب أجهزة AMD الرخيصة، فإن اقتصاديات خدمة النماذج الكبيرة خارج النظام البيئي لـ Nvidia تتحسن بسرعة.
ميزة المصدر المفتوح
يؤكد المستودع على موضوع أوسع في تطوير الذكاء الاصطناعي لعام 2026: نماذج الوزن المفتوح وأدوات الاستدلال مفتوحة المصدر تتيح للمهندسين المستقلين تكرار وتحسين عمليات النشر التي كانت في السابق مجالًا حصريًا للمختبرات الممولة تمويلًا جيدًا. من خلال نشر التكوين الكامل وجداول الضبط والأخطاء المحددة التي تم إصلاحها على طول الطريق، يقلل العمل من الحاجز أمام أي شخص يفكر في أجهزة AMD لأحمال عمل الذكاء الاصطناعي الخطيرة.
ابق في صدارة الذكاء الاصطناعي
تشتد المعركة بين AMD وNvidia من أجل استدلال الذكاء الاصطناعي، وتعمل المساهمات مفتوحة المصدر مثل هذا النشر على تغيير المشهد التنافسي بهدوء. للاطلاع على أحدث تطورات الذكاء الاصطناعي في مجال الأجهزة والنماذج المفتوحة والبنية التحتية، تابع تغطيتنا.
اقرأ المزيد من أخبار الذكاء الاصطناعي →