یک توسعهدهنده مستقل نشان داده است که مدل V4 Flash DeepSeek، یک سیستم ترکیبی از متخصصان با 304 میلیارد پارامتر، میتواند روی یک واحد پردازشگر گرافیکی AMD MI300X تولید شود و به 168.6 توکن در ثانیه در رمزگشایی تکاستریم بدون هیچگونه کوانتیزاسیون یا تخلیه وزنی دست یابد. این کار که در GitHub منتشر شد و در 4 آگوست 2026 در بالای اخبار هکر قرار گرفت، واضحترین شواهد را ارائه میکند که سختافزار AMD میتواند بدون تکیه بر انویدیا یک مدل باز در مقیاس مرزی ارائه دهد.
این مخزن که توسط توسعهدهنده رایان ژو نگهداری میشود، شامل یک پشته کامل Docker Compose، همپوشانی فایلهای پینشده، و جداول تنظیم برای اجرای پوینت بازرسی DeepSeek-V4-Flash-0731 در یک MI300X است. برای خوانندگانی که [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) را در مورد جنگ تراشهها بین AMD و Nvidia دنبال میکنند، نتیجه قابل توجه است زیرا این فرض را به چالش میکشد که استنتاج مرزی به جدیدترین و گرانترین سختافزار Nvidia نیاز دارد.
اعداد
عملکرد محکشده، که بر روی یک پشته نرمافزار پینشده با استفاده از ساخت شبانه ROCm vLLM اندازهگیری میشود، داستان متقاعدکنندهای در مورد کارهایی که یک شتابدهنده AMD میتواند انجام دهد را بیان میکند:
- رمزگشایی تک جریانی: 168.6 توکن در ثانیه، به اندازه کافی سریع برای چت بلادرنگ و بارهای کاری عاملی.
- توان عملیاتی پیش پر: تقریباً 7900 تا 8500 توکن در ثانیه با هسته های تنظیم شده، به این معنی که درخواست های طولانی در کمتر از یک ثانیه پردازش می شوند.
- هشت جریان همزمان: مجموع 542 توکن در ثانیه، با 90.3 توکن در ثانیه در هر جریان.
- 64-stream burst: مجموع 830 توکن در ثانیه، بدون خطای خارج از حافظه و بدون خرابی موتور.
- طول متن: 256000 توکن تایید شده در آزمایش، با معماری تا یک میلیون پشتیبانی می کند.
کل مدل 156.67 گیگابایت حافظه با پهنای باند بالا را اشغال می کند که کاملاً در استخر 192 گیگابایتی HBM3 MI300X قرار می گیرد. هیچ کوانتیزاسیون یا تخلیه وزن اضافی مورد نیاز نبود، که دقت کامل مدل را حفظ می کند.
چرا MI300X کار می کند
AMD MI300X دارای دو ویژگی است که استقرار تک GPU یک مدل را به این بزرگی ممکن می کند. دارای 192 گیگابایت حافظه HBM3، 2.4 برابر ظرفیت Nvidia H100 SXM5 و 5.3 ترابایت بر ثانیه پهنای باند حافظه است. یک نوشته جداگانه توسط توسعهدهندهای به نام Fergus Finn که پایههای این استقرار را ایجاد کرد، تخمین زد که قیمت MI300X تقریباً نصف سختافزار قابل مقایسه Nvidia در لیست قیمت است.
برای این ایست بازرسی خاص با 304 میلیارد پارامتر، ظرفیت حافظه عامل تعیین کننده است. این مدل به طور کامل در حافظه روی تراشه جا میشود و فضایی را برای یک حافظه پنهان GPU با مقدار کلید 20 گیگابایتی و یک ردیف CPU 96 گیگابایتی برای ورودیهای پیشوند کش خارج شده باقی میگذارد. یک کارت می تواند دو تا هشت جریان معمولی همزمان و انفجارهای تا 64 جریان را مدیریت کند که برای بسیاری از بارهای کاری استنتاج تولید کافی است.
موانع مهندسی
اجرای DeepSeek V4 Flash روی MI300X ساده نبود. دستور رسمی vLLM سختافزار انویدیا و پردازندههای گرافیکی جدیدتر AMD مانند MI325X و MI355X را پوشش میدهد، اما نه یک پیکربندی تولیدی تک MI300X برای ایست بازرسی 31 جولای.
مخزن چندین مشکل مهندسی را مستند می کند که باید حل می شد. MI300X از گونهای از فرمت شماره FP8 استفاده میکند که با استاندارد مورد استفاده تراشههای AMD جدیدتر متفاوت است، و هستهای که معنایی اشتباه را فرض میکند میتواند با ضریب دو نتیجه به دست آورد. توسعهدهنده همچنین مجبور شد مسیریابی ترکیبی از متخصصان را در همزمانی بالا، تأیید حدسزنی علّی و همگامسازی کلید-مقدار CPU را اصلاح کند، که تعدادی از آنها در vLLM بالادست ثابت باقی میمانند.
این مخزن پوششهای درستی، یک پیکربندی سرویس معتبر با پیشنویس گمانهزنی، جداول تنظیم AITER GEMM برای اشکال تراشههایی که جداول بستهبندیشده وجود نداشتند، و یک استراتژی ترکیبی کلید-مقدار که یک حافظه پنهان GPU را با بارگذاری CPU ترکیب میکند، اضافه میکند.
چه معنایی برای جنگ چیپ دارد
این نمایش در لحظه ای مهم برای جاه طلبی های AMD در هوش مصنوعی می رسد. انویدیا اکثریت قریب به اتفاق بازار شتابدهندههای هوش مصنوعی را کنترل میکند، که توسط اکوسیستم نرمافزاری CUDA تقویت شده است، که بسیاری از توسعهدهندگان آن را خندقی میدانند که AMD برای عبور از آن تلاش کرده است. SemiAnalysis این سوال را مستقیماً در تجزیه و تحلیل جولای 2026 با عنوان "آیا AMD می تواند خندق CUDA را بشکند؟" و پاسخ همچنان مورد بحث است.
اما پروژه های منبع باز مانند این یک تراشه از شکاف درک دور هستند. اگر یک MI300X منفرد بتواند به مدلی در مقیاس مرزی با سرعت رقابتی خدمت کند، رد استدلال هزینه برای AMD دشوارتر می شود. AMD همچنین در حال ساخت نمونه کارها از مدل های باز خود است، Instella-MoE-16B، یک مدل کاملا باز که از ابتدا بر روی پردازنده های گرافیکی Instinct خود آموزش داده شده است، و با Zyphra بر روی پلت فرم 15 مگاواتی MI355X شریک شده است.
در همین حال، خود DeepSeek هزینه هوش مصنوعی مرزی را کاهش داده است. مدل V4 Flash در حال حاضر ارزانترین مدل شناخته شده برای اجرا بر اساس تجزیه و تحلیل شرکت تحقیقاتی بود که با GPT-5.6 Luna با 60 درصد هزینه کمتر مطابقت داشت. در ترکیب با سختافزار ارزانتر AMD، اقتصاد ارائهدهی مدلهای بزرگ خارج از اکوسیستم Nvidia به سرعت در حال بهبود است.
مزیت منبع باز
این مخزن بر موضوع گستردهتری در توسعه هوش مصنوعی در سال 2026 تأکید میکند: مدلهای وزن باز و ابزار استنتاج منبع باز این امکان را برای مهندسان مستقل فراهم میکنند تا بکارگیریهایی را که زمانی حوزه انحصاری آزمایشگاههای دارای بودجه خوب بودند، تکرار و بهینه کنند. با انتشار پیکربندی کامل، جداول تنظیم، و باگهای خاصی که در طول مسیر برطرف شدهاند، کار مانع هر کسی که سختافزار AMD را برای بارهای کاری جدی هوش مصنوعی در نظر میگیرد، کاهش میدهد.
از هوش مصنوعی جلوتر بمانید
نبرد بین AMD و Nvidia برای استنباط هوش مصنوعی در حال تشدید است و مشارکت های منبع باز مانند این استقرار بی سر و صدا چشم انداز رقابت را تغییر می دهد. برای [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) در سختافزار، مدلهای باز و زیرساخت، با پوشش ما همراه باشید.
بیشتر بخوانید اخبار هوش مصنوعی →