DeepSeek DSpark را منتشر کرده است، یک چارچوب رمزگشایی گمانه‌زنی منبع باز که این شرکت می‌گوید استنتاج مدل زبان بزرگ (LLM) را تا 85 درصد تحت ترافیک زنده، بدون افت کیفیت خروجی، تسریع می‌کند. در مقاله جدیدی از DeepSeek-AI و دانشگاه پکن توضیح داده شده است، این سیستم در حال حاضر در زیرساخت سرویس دهی DeepSeek-V4 اجرا می شود که درخواست های واقعی کاربر را رسیدگی می کند.

این کار به یکی از سرسخت‌ترین مشکلات در تولید هوش مصنوعی می‌پردازد: استنتاج کند است زیرا مدل‌ها متنی را در یک زمان تولید می‌کنند که هر کدام نیاز به عبور کامل از شبکه دارند. رمزگشایی گمانه‌زنی یک راه‌حل محبوب است که در آن یک مدل کوچک و سریع بلوکی از نشانه‌ها را پیشنهاد می‌کند که مدل با اندازه کامل در یک پاس تأیید می‌کند و طولانی‌ترین پیشوند صحیح را می‌پذیرد. از آنجایی که تأیید موازی و از نظر ریاضی دقیق است، در عین حفظ توزیع مدل اصلی، کارها را سرعت می بخشد. DSpark که در کنار مخزن آموزشی DeepSpec در GitHub منتشر شد، به سرعت به یکی از بحث‌برانگیزترین داستان‌های مهندسی هوش مصنوعی در Hacker News تبدیل شد. For more context on this story, see our ongoing breaking AI news.

چرا رمزگشایی گمانه زنی موجود به دیوار برخورد می کند

تحقیقات رمزگشایی گمانه‌زنی اخیر به سمت «طرح‌نویس‌های موازی» حرکت کرده است که یک بلوک کامل از نشانه‌های کاندید را در یک پاس رو به جلو تولید می‌کنند و تأخیر پیش‌نویس را تقریباً مستقل از اندازه بلوک می‌کند. مقاله DSpark دو گلوگاه را شناسایی می‌کند که این روش‌ها را از تحقق وعده‌های خود در مقیاس بازمی‌دارد.

اولین مشکل کیفیت است. از آنجایی که پیش‌نویس‌های موازی هر موقعیت را به‌طور مستقل پیش‌بینی می‌کنند، نمی‌توانند نحوه وابستگی توکن‌های درون یک بلوک به یکدیگر را مدل کنند. محققان نشان می‌دهند که این منجر به "برخوردهای چند وجهی" و فروپاشی پذیرش سریع در موقعیت‌های بعدی در یک بلوک پیش‌رو می‌شود، پدیده‌ای که آن‌ها آن را فروپاشی پسوندی می‌نامند. هر چه بلوک موازی طولانی تر باشد، احتمال اشتباه دم آن بیشتر می شود.

مورد دوم یک مشکل در سطح سیستم است. در حالی که تولید بلوک‌های پیش‌نویس طولانی ارزان است، بررسی کورکورانه هر توکن پیشنهادی ظرفیت دسته‌ای کمیاب را در توکن‌هایی که احتمالاً رد می‌شوند، هدر می‌دهد. تحت همزمانی بالای یک سیستم سرویس واقعی، طول تأیید ایده‌آل در امتداد دو محور متفاوت است: درخواست‌های ساختاریافته مانند کد، نرخ پذیرش بالاتری نسبت به چت باز دارند، و تأیید توکن‌های اضافی تحت بار سبک تقریباً رایگان است، اما زمانی که سیستم اشباع شده است، گران است.

یک مدل پیش نویس نیمه خود رگرسیون

برای رفع پوسیدگی پسوند، DSpark از آنچه که نویسندگان آن را معماری نیمه خود رگرسیون می نامند استفاده می کند. این یک ستون فقرات موازی محاسباتی سنگین را جفت می‌کند، که می‌تواند توکن‌های زیادی را در یک زمان پیشنهاد کند، با یک ماژول متوالی سبک وزن که مدل‌سازی وابستگی درون بلوکی را معرفی می‌کند. هدف از این طراحی ترکیب ظرفیت بالای مدل‌های موازی در موقعیت‌های اولیه با پسوند انسجام پیش‌نویس‌های خودبازگشت سنتی است که توکن‌ها را یکی پس از دیگری تولید می‌کنند و به طور طبیعی به وابستگی‌ها احترام می‌گذارند.

در معیارهای آفلاین کنترل‌شده شامل استدلال ریاضی، تولید کد و چت روزانه، تیم گزارش می‌دهد که DSpark به‌طور قابل‌توجهی طول پذیرفته‌شده در هر چرخه تأیید را نسبت به خطوط پایه قوی بهبود می‌بخشد. به طور خاص، مقاله بیان می کند که DSpark طول پذیرفته شده را نسبت به پیش نویس اتورگرسیو Eagle3 به میزان 30.9٪، 26.7٪ و 30.0٪ در سه تنظیمات، و نسبت به پیش نویس موازی DFlash با 16.3٪، 18.4٪ و 18.3٪ بهبود می بخشد.

تأیید اعتبار برنامه ریزی شده، بارگذاری آگاهانه

نیمه جدیدتر DSpark رویکرد آن به تأیید است. به جای تأیید تعداد ثابتی از نشانه‌های پیش‌نویس برای هر درخواست، DSpark انتخاب طول تأیید را به عنوان یک مشکل به حداکثر رساندن توان عملیاتی جهانی فرموله می‌کند. این تخمین کالیبره شده از مدت زمانی که پیشوند پیش‌نویس احتمالاً زنده می‌ماند، چیزی که مقاله احتمال بقا می‌نامد، با زمان‌بندی سخت‌افزاری که بار موتور را در زمان واقعی می‌خواند، جفت می‌کند.

نتیجه تأیید زمان‌بندی اطمینان است: سیستم به‌طور پویا تعداد نشانه‌هایی را که برای هر درخواست تأیید می‌کند، بر اساس محتوای درخواست و وضعیت فعلی موتور خدمت‌رسانی تنظیم می‌کند. تحت بارهای سبک، می‌تواند سخاوتمندانه تأیید کند، در حالی که در شرایط همزمانی سنگین، بودجه تأیید مدل هدف را فقط به سمت توکن‌هایی با بالاترین بازده مورد انتظار هدایت می‌کند، و از فروپاشی توان عملیاتی ناشی از صرف ظرفیت دسته‌ای در توکن‌های با احتمال کم جلوگیری می‌کند.

نتایج تحت ترافیک کاربر زنده

مهم ترین اعداد از تولید به دست می آیند. این تیم DSpark را در سیستم سرویس دهی DeepSeek-V4 که به ترافیک کاربران زنده خدمات می دهد مستقر کرده و آن را با خط پایه تولید قبلی شرکت، یک روش پیش بینی چند توکن معروف به MTP-1، مقایسه کردند.

بر اساس این مقاله، DSpark به طور مداوم سرعت تولید هر کاربر را 60٪ تا 85٪ برای DeepSeek-V4-Flash و 57٪ تا 78٪ برای DeepSeek-V4-Pro در توان کل منطبق افزایش می دهد. تحت توافق نامه های سختگیرانه در سطح خدمات که ظرفیت خط پایه به شدت کاهش می یابد، معادل 120 توکن در ثانیه برای Flash و 50 توکن در ثانیه برای Pro، DSpark سربار تأیید را کاهش می دهد تا توان عملیاتی قوی را حفظ کند. با غلبه بر این صخره عملکرد، نویسندگان استدلال می‌کنند که سطوح تعاملی سخت‌گیرانه‌ای را که قبلاً دست نیافتنی بودند، باز می‌کند و به طور مؤثر مرز پارتو در خدمت LLM را به بیرون تغییر می‌دهد.

این تمایز برای اپراتورها مهم است. سرعت هر کاربر سریع‌تر در کل یکسان به معنای دستیارها و گردش‌های کاری فعال‌تر بدون خرید سخت‌افزار بیشتر است، در حالی که بقای SLA‌های تأخیر سخت تحت بار، چیزی است که یک نسخه آزمایشی تحقیقاتی را از سیستمی جدا می‌کند که می‌تواند در حین افزایش ترافیک مقاومت کند.

منبع باز برای انجمن

DeepSeek در حال انتشار پست های بازرسی آموزش دیده DSpark برای هر دو مدل DeepSeek-V4-Flash و DeepSeek-V4-Pro است. مخزن DeepSpec همراه، که تحت مجوز مجاز MIT منتشر شده است، به عنوان یک پایگاه کد آموزش و ارزیابی الگوریتم محور کامل پشته برای رمزگشایی حدسی توصیف شده است. این شامل ابزارهای آماده سازی داده ها، پیاده سازی مدل پیش نویس، اسکریپت های آموزشی، و مهارهای ارزیابی، و ارسال با سه الگوریتم مدل پیش نویس: DSpark، DFlash، و Eagle3 است.

این انتشار مانع دیگر آزمایشگاه‌ها و تیم‌های زیرساختی برای آموزش و ارزیابی مدل‌های پیش‌نویس خود در برابر خط لوله استاندارد شده را کاهش می‌دهد. مجموعه ارزیابی DeepSpec معیارهای تعیین شده از جمله GSM8K، MATH500، AIME 2025، HumanEval، MBPP، LiveCodeBench، MT-Bench، AlpacaEval و Arena-Hard-v2 را پوشش می دهد.

چرا مهم است

هزینه استنتاج و تأخیر در حال حاضر یکی از محدودیت‌های تعیین‌کننده صنعت هوش مصنوعی است که همه چیز را شکل می‌دهد، از نحوه استقرار تهاجمی عوامل هوش مصنوعی توسط شرکت‌ها تا اینکه آیا ارائه‌دهندگان کوچک‌تر می‌توانند با مقیاس‌کننده‌های بزرگ در اقتصاد واحد رقابت کنند. سهم DSpark کمتر یک الگوریتم جدید است تا نمایشی که طراحی دقیق مدل پیش نویس و زمانبندی تأیید، و در نظر گرفتن طول تأیید به عنوان تابعی از وضعیت سیستم زنده، می تواند به طور معناداری سوزن را در استقرار واقعی حرکت دهد.

برای DeepSeek، که شهرت خود را بر روی سیستم‌های کارآمد و آشکارا منتشر شده است، DSpark نقطه داده دیگری در بحثی است که آزمایشگاه بیش از یک سال است مطرح کرده است: اینکه عملکرد خدمات درجه مرزی را می‌توان از طریق مهندسی هوشمندتر به‌جای محاسبات خام به دست آورد. این واقعیت که سودها به‌جای یک معیار مصنوعی، تحت ترافیک زنده اندازه‌گیری می‌شوند، نتیجه را برای سایر اپراتورها آسان‌تر می‌کند تا با هضم مقاله و شروع بازتولید اعداد، جامعه منبع باز مقاله را جدی بگیرند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →