آزمایشگاه هوش مصنوعی چینی DeepSeek V4.1-Flash را منتشر کرده است، یک مدل وزن باز چندوجهی که یک ستون فقرات 552 میلیارد پارامتری را با برخی از تهاجمی ترین فشرده سازی حافظه که تاکنون در یک سیستم کلاس مرزی عرضه شده است، جفت می کند. رویترز گزارش داد که این مدل روز چهارشنبه با مجوز MIT در Hugging Face و یک گزارش فنی همراه آن منتشر شد و تیتر یک سری از تیترهای آزمایشگاه مستقر در هانگژو را به خود اختصاص داد.

انتشار بیش از یک نسخه معمولی است. DeepSeek به طور همزمان سطح V4 ​​Pro پرچم‌دار خود را بازنشسته کرده است و TechNode گزارش داد که درخواست‌های V4 Pro اکنون به V4.1-Flash ارسال می‌شود - بیانیه‌ای قابل توجه از اعتماد به مدلی که نام "Flash" را یدک می‌کشد و در عین حال اعداد بنچمارک را در یا بالاتر از مدلی که جایگزین کرده است ارسال می‌کند. For more context on this story, see our ongoing breaking AI news.

یک "فلش" بزرگتر با قبض حافظه کوچکتر

بر اساس کارت مدل رسمی، DeepSeek-V4.1-Flash یک مدل ترکیبی از متخصصان (MoE) با 552 میلیارد پارامتر ستون فقرات به اضافه یک جزء حافظه شرطی 196 میلیارد پارامتری "Engram" است که به طور پراکنده از طریق جستجوی مبتنی بر توکن قابل دسترسی است. علیرغم اندازه بسیار زیاد، این مدل تنها 8 میلیارد پارامتر در هر توکن در طول پر کردن اولیه و 16 میلیارد پارامتر در هنگام رمزگشایی فعال می کند - پارامترهای فعال کمتری نسبت به مدل قبلی با پارامتر 284B، که 13 میلیارد را ثابت می کرد.

محور معماری چیزی است که DeepSeek آن را طراحی رمزگشا-رمزگشای علتی (CED) می نامد: یک ترانسفورماتور 40 لایه به یک رمزگذار علّی 20 لایه و سپس یک رمزگشای 20 لایه تقسیم می شود. از آنجایی که حافظه نهان جهانی KV رمزگشا از حالت‌های پنهان رمزگذار نهایی به جای لایه به لایه انباشته شده، نمایش داده می‌شود، حافظه مورد نیاز برای حفظ مکالمات طولانی به طور چشمگیری کاهش می‌یابد.

اعداد فشرده سازی سرفصل هستند. با ذخیره سازی اصلی KV FP4 در قالب E2M1، ردپای حافظه کش جهانی KV به 890 بایت در هر توکن کاهش می یابد - تقریباً یک چهارم DeepSeek-V4-Flash. تکنیکی به نام SWA Bounded Replay حالت‌های توجه از دست رفته را با پخش مجدد تنها آخرین پنجره نشانه‌ها بازسازی می‌کند و حافظه پنهان KV پایدار را به حدود یک هشتم مدل قبلی Flash کاهش می‌دهد. بر اساس کارت مدل، کاهش تقریباً چهار برابر در برابر V4-Flash و 437 برابر در برابر DeepSeek-V1 است. اجزای اضافی عبارتند از Compressed Sparse Attention 2 (CSA2) که به هر لایه توجه یکی از سه حالت استاتیک را اختصاص می دهد و رمزگشایی گمانه زنی DSpark برای تولید سریعتر.

در زیر هود، هر لایه MoE یک متخصص مشترک با 384 متخصص مسیریابی را ترکیب می‌کند و شش متخصص مسیریابی را در هر توکن فعال می‌کند.

معیارها: جلوتر از پرچمدار بازنشسته

در ارزیابی های مدل پایه در گزارش فنی، لبه های V4.1-Flash در چندین آزمایش کلیدی از V4 Pro بسیار بزرگتر گذشت: 74.1 در MMLU-Pro در مقابل 73.5، 79.4 در HumanEval در مقابل 76.8، 60.6 در BigCodeBench، و GSM98.0. ساوت چاینا مورنینگ پست گزارش داد که DeepSeek می‌گوید مدل جدید **در معیارهای سایبری و کدنویسی Kimi K3 را شکست می‌دهد، یک ادعای قابل‌توجه در زمینه مدل باز چینی که شامل GLM-5.3 Z.ai و خط Qwen علی‌بابا نیز می‌شود.

در حداکثر تلاش استدلالی، مدل دستورالعمل امتیاز 90.9 را در GPQA Diamond کسب می‌کند - قابل توجه است، هرچند هنوز پشت سر سیستم‌های مرزی پیشرو که در جدول مقایسه خود DeepSeek، GPT-5.6 Sol با 94.1 و Claude Opus 5.0 با 93.4 به آنها اشاره شده است. Kimi K3 در 92.9 قرار دارد. صادق خواند: این یک مدل مجاور مرزی با قیمت های باز است، نه پاکسازی آزمایشگاه های بسته.

V4.1-Flash نیز واقعاً چند وجهی است. یک رمزگذار بینایی DeepSeek-ViT که از ابتدا آموزش داده شده است، تصاویر را از طریق یک پروژکتور دو لایه تغذیه می کند و این مدل از ابتدای آموزش به طور مشترک روی متن و تصاویر آموزش داده شده است. امتیاز 56.5 در MMMU-Pro و 95.6 در DocVQA.

ساخته شده برای نمایندگان، قیمت برای حجم

انتخاب‌های طراحی، مخاطبان هدف را واضح می‌سازد: بارهای کاری عاملی، که در آن مدل‌ها زمینه‌های عظیم را می‌خوانند و در افق‌های طولانی عمل می‌کنند. این مدل از پنجره‌های زمینه تا یک میلیون توکن پشتیبانی می‌کند، بر روی یک پیکره چندوجهی با 45 تریلیون نشانه آموزش داده شده است و یک شماره‌گیری تلاش استدلالی قابل کنترل از 1 تا 100 را ارائه می‌کند که هزینه استنتاج را در مقابل دقت معامله می‌کند. پوشش Decoder تأکید کرد که صرفه جویی در حافظه به طور خاص هزینه اجرای عوامل هوش مصنوعی را کاهش می دهد - حجم کاری که زمان بسیار بیشتری را صرف خواندن ورودی می کند تا تولید خروجی.

واکنش جامعه قاطعانه بوده است. موضوع راه اندازی در Hacker News بیش از 650 امتیاز را به خود اختصاص داد و موضوع قبلی با عنوان "DeepSeek راه اندازی فلش v4.1 ارزان تر و توانمندتر از v4 pro" نزدیک به 400 امتیاز بیشتر جمع آوری کرد. نظر دهندگانی که مدل‌ها را به صورت محلی اجرا می‌کنند، خاطرنشان کردند که پارامترهای Engram حتی می‌توانند در SSD‌های سریع بارگذاری شوند و مسیری را برای استنتاج نزدیک به مرز بر روی سخت‌افزار مصرف‌کننده باز کنند.

جستجوی آلفا به صراحت سهام تجاری را بررسی کرد و آن را یک مدل بسیار کم هزینه نامید که چالش هایی را برای آزمایشگاه های مرزی ایالات متحده ایجاد می کند - یادآوری این که جنگ قیمت در استنتاج هوش مصنوعی هیچ نشانه ای از خنک شدن نشان نمی دهد.

یک لحظه عمدی برای اعلام

زمان گویای آن است. یک روز قبل از راه‌اندازی، رویترز گزارش داد که DeepSeek از CITIC Securities برای ترتیب دادن IPO در بازار STAR شانگهای استفاده کرده است، پس از گزارش قبلی مبنی بر اینکه درآمد آزمایشگاه قبل از عرضه احتمالی ده برابر شده است. ارسال یک مدل باز پرطرفدار چند روز بعد این شتاب را حفظ می کند.

این انتشار همچنین در بحبوحه بررسی های شدید شرکت های چینی هوش مصنوعی منتشر می شود. در اوایل این هفته، آژانس‌های ایالات متحده از جمله NSA، CISA و FBI نام شش شرکت چینی هوش مصنوعی را در مشاوره‌ای درباره تقطیر مدل‌های صنعتی در مقیاس صنعتی معرفی کردند - یادآوری این که برنده‌های فنی DeepSeek اکنون در کنار بارهای ژئوپلیتیکی به دست می‌آیند.

هیچ کدام از اینها داستان مهندسی را کمرنگ نمی کند. با بازنشسته شدن V4 Pro و هدایت ترافیک آن به مدل ارزان‌تر و قوی‌تر، DeepSeek واضح‌ترین استدلال ممکن را مطرح کرده است که در سال 2026 مرز جالب هوش مصنوعی ممکن است نه تنها این باشد که چه کسی بزرگ‌ترین مدل را می‌سازد، بلکه چه کسی بیشترین قابلیت را به ازای هر گیگابایت حافظه دارد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →