یک توسعه‌دهنده مستقل نشان داده است که مدل V4 Flash DeepSeek، یک سیستم ترکیبی از متخصصان با 304 میلیارد پارامتر، می‌تواند روی یک واحد پردازشگر گرافیکی AMD MI300X تولید شود و به 168.6 توکن در ثانیه در رمزگشایی تک‌استریم بدون هیچ‌گونه کوانتیزاسیون یا تخلیه وزنی دست یابد. این کار که در GitHub منتشر شد و در 4 آگوست 2026 در بالای اخبار هکر قرار گرفت، واضح‌ترین شواهد را ارائه می‌کند که سخت‌افزار AMD می‌تواند بدون تکیه بر انویدیا یک مدل باز در مقیاس مرزی ارائه دهد.

این مخزن که توسط توسعه‌دهنده رایان ژو نگهداری می‌شود، شامل یک پشته کامل Docker Compose، همپوشانی فایل‌های پین‌شده، و جداول تنظیم برای اجرای پوینت بازرسی DeepSeek-V4-Flash-0731 در یک MI300X است. برای خوانندگانی که [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) را در مورد جنگ تراشه‌ها بین AMD و Nvidia دنبال می‌کنند، نتیجه قابل توجه است زیرا این فرض را به چالش می‌کشد که استنتاج مرزی به جدیدترین و گران‌ترین سخت‌افزار Nvidia نیاز دارد.

اعداد

عملکرد محک‌شده، که بر روی یک پشته نرم‌افزار پین‌شده با استفاده از ساخت شبانه ROCm vLLM اندازه‌گیری می‌شود، داستان متقاعدکننده‌ای در مورد کارهایی که یک شتاب‌دهنده AMD می‌تواند انجام دهد را بیان می‌کند:

  • رمزگشایی تک جریانی: 168.6 توکن در ثانیه، به اندازه کافی سریع برای چت بلادرنگ و بارهای کاری عاملی.
  • توان عملیاتی پیش پر: تقریباً 7900 تا 8500 توکن در ثانیه با هسته های تنظیم شده، به این معنی که درخواست های طولانی در کمتر از یک ثانیه پردازش می شوند.
  • هشت جریان همزمان: مجموع 542 توکن در ثانیه، با 90.3 توکن در ثانیه در هر جریان.
  • 64-stream burst: مجموع 830 توکن در ثانیه، بدون خطای خارج از حافظه و بدون خرابی موتور.
  • طول متن: 256000 توکن تایید شده در آزمایش، با معماری تا یک میلیون پشتیبانی می کند.

کل مدل 156.67 گیگابایت حافظه با پهنای باند بالا را اشغال می کند که کاملاً در استخر 192 گیگابایتی HBM3 MI300X قرار می گیرد. هیچ کوانتیزاسیون یا تخلیه وزن اضافی مورد نیاز نبود، که دقت کامل مدل را حفظ می کند.

چرا MI300X کار می کند

AMD MI300X دارای دو ویژگی است که استقرار تک GPU یک مدل را به این بزرگی ممکن می کند. دارای 192 گیگابایت حافظه HBM3، 2.4 برابر ظرفیت Nvidia H100 SXM5 و 5.3 ترابایت بر ثانیه پهنای باند حافظه است. یک نوشته جداگانه توسط توسعه‌دهنده‌ای به نام Fergus Finn که پایه‌های این استقرار را ایجاد کرد، تخمین زد که قیمت MI300X تقریباً نصف سخت‌افزار قابل مقایسه Nvidia در لیست قیمت است.

برای این ایست بازرسی خاص با 304 میلیارد پارامتر، ظرفیت حافظه عامل تعیین کننده است. این مدل به طور کامل در حافظه روی تراشه جا می‌شود و فضایی را برای یک حافظه پنهان GPU با مقدار کلید 20 گیگابایتی و یک ردیف CPU 96 گیگابایتی برای ورودی‌های پیشوند کش خارج شده باقی می‌گذارد. یک کارت می تواند دو تا هشت جریان معمولی همزمان و انفجارهای تا 64 جریان را مدیریت کند که برای بسیاری از بارهای کاری استنتاج تولید کافی است.

موانع مهندسی

اجرای DeepSeek V4 Flash روی MI300X ساده نبود. دستور رسمی vLLM سخت‌افزار انویدیا و پردازنده‌های گرافیکی جدیدتر AMD مانند MI325X و MI355X را پوشش می‌دهد، اما نه یک پیکربندی تولیدی تک MI300X برای ایست بازرسی 31 جولای.

مخزن چندین مشکل مهندسی را مستند می کند که باید حل می شد. MI300X از گونه‌ای از فرمت شماره FP8 استفاده می‌کند که با استاندارد مورد استفاده تراشه‌های AMD جدیدتر متفاوت است، و هسته‌ای که معنایی اشتباه را فرض می‌کند می‌تواند با ضریب دو نتیجه به دست آورد. توسعه‌دهنده همچنین مجبور شد مسیریابی ترکیبی از متخصصان را در همزمانی بالا، تأیید حدس‌زنی علّی و همگام‌سازی کلید-مقدار CPU را اصلاح کند، که تعدادی از آنها در vLLM بالادست ثابت باقی می‌مانند.

این مخزن پوشش‌های درستی، یک پیکربندی سرویس معتبر با پیش‌نویس گمانه‌زنی، جداول تنظیم AITER GEMM برای اشکال تراشه‌هایی که جداول بسته‌بندی‌شده وجود نداشتند، و یک استراتژی ترکیبی کلید-مقدار که یک حافظه پنهان GPU را با بارگذاری CPU ترکیب می‌کند، اضافه می‌کند.

چه معنایی برای جنگ چیپ دارد

این نمایش در لحظه ای مهم برای جاه طلبی های AMD در هوش مصنوعی می رسد. انویدیا اکثریت قریب به اتفاق بازار شتاب‌دهنده‌های هوش مصنوعی را کنترل می‌کند، که توسط اکوسیستم نرم‌افزاری CUDA تقویت شده است، که بسیاری از توسعه‌دهندگان آن را خندقی می‌دانند که AMD برای عبور از آن تلاش کرده است. SemiAnalysis این سوال را مستقیماً در تجزیه و تحلیل جولای 2026 با عنوان "آیا AMD می تواند خندق CUDA را بشکند؟" و پاسخ همچنان مورد بحث است.

اما پروژه های منبع باز مانند این یک تراشه از شکاف درک دور هستند. اگر یک MI300X منفرد بتواند به مدلی در مقیاس مرزی با سرعت رقابتی خدمت کند، رد استدلال هزینه برای AMD دشوارتر می شود. AMD همچنین در حال ساخت نمونه کارها از مدل های باز خود است، Instella-MoE-16B، یک مدل کاملا باز که از ابتدا بر روی پردازنده های گرافیکی Instinct خود آموزش داده شده است، و با Zyphra بر روی پلت فرم 15 مگاواتی MI355X شریک شده است.

در همین حال، خود DeepSeek هزینه هوش مصنوعی مرزی را کاهش داده است. مدل V4 Flash در حال حاضر ارزان‌ترین مدل شناخته شده برای اجرا بر اساس تجزیه و تحلیل شرکت تحقیقاتی بود که با GPT-5.6 Luna با 60 درصد هزینه کمتر مطابقت داشت. در ترکیب با سخت‌افزار ارزان‌تر AMD، اقتصاد ارائه‌دهی مدل‌های بزرگ خارج از اکوسیستم Nvidia به سرعت در حال بهبود است.

مزیت منبع باز

این مخزن بر موضوع گسترده‌تری در توسعه هوش مصنوعی در سال 2026 تأکید می‌کند: مدل‌های وزن باز و ابزار استنتاج منبع باز این امکان را برای مهندسان مستقل فراهم می‌کنند تا بکارگیری‌هایی را که زمانی حوزه انحصاری آزمایشگاه‌های دارای بودجه خوب بودند، تکرار و بهینه کنند. با انتشار پیکربندی کامل، جداول تنظیم، و باگ‌های خاصی که در طول مسیر برطرف شده‌اند، کار مانع هر کسی که سخت‌افزار AMD را برای بارهای کاری جدی هوش مصنوعی در نظر می‌گیرد، کاهش می‌دهد.

از هوش مصنوعی جلوتر بمانید

نبرد بین AMD و Nvidia برای استنباط هوش مصنوعی در حال تشدید است و مشارکت های منبع باز مانند این استقرار بی سر و صدا چشم انداز رقابت را تغییر می دهد. برای [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) در سخت‌افزار، مدل‌های باز و زیرساخت، با پوشش ما همراه باشید.

بیشتر بخوانید اخبار هوش مصنوعی →