DeepSeek DSpark را منتشر کرده است، یک چارچوب رمزگشایی گمانهزنی منبع باز که این شرکت میگوید استنتاج مدل زبان بزرگ (LLM) را تا 85 درصد تحت ترافیک زنده، بدون افت کیفیت خروجی، تسریع میکند. در مقاله جدیدی از DeepSeek-AI و دانشگاه پکن توضیح داده شده است، این سیستم در حال حاضر در زیرساخت سرویس دهی DeepSeek-V4 اجرا می شود که درخواست های واقعی کاربر را رسیدگی می کند.
این کار به یکی از سرسختترین مشکلات در تولید هوش مصنوعی میپردازد: استنتاج کند است زیرا مدلها متنی را در یک زمان تولید میکنند که هر کدام نیاز به عبور کامل از شبکه دارند. رمزگشایی گمانهزنی یک راهحل محبوب است که در آن یک مدل کوچک و سریع بلوکی از نشانهها را پیشنهاد میکند که مدل با اندازه کامل در یک پاس تأیید میکند و طولانیترین پیشوند صحیح را میپذیرد. از آنجایی که تأیید موازی و از نظر ریاضی دقیق است، در عین حفظ توزیع مدل اصلی، کارها را سرعت می بخشد. DSpark که در کنار مخزن آموزشی DeepSpec در GitHub منتشر شد، به سرعت به یکی از بحثبرانگیزترین داستانهای مهندسی هوش مصنوعی در Hacker News تبدیل شد. For more context on this story, see our ongoing breaking AI news.
چرا رمزگشایی گمانه زنی موجود به دیوار برخورد می کند
تحقیقات رمزگشایی گمانهزنی اخیر به سمت «طرحنویسهای موازی» حرکت کرده است که یک بلوک کامل از نشانههای کاندید را در یک پاس رو به جلو تولید میکنند و تأخیر پیشنویس را تقریباً مستقل از اندازه بلوک میکند. مقاله DSpark دو گلوگاه را شناسایی میکند که این روشها را از تحقق وعدههای خود در مقیاس بازمیدارد.
اولین مشکل کیفیت است. از آنجایی که پیشنویسهای موازی هر موقعیت را بهطور مستقل پیشبینی میکنند، نمیتوانند نحوه وابستگی توکنهای درون یک بلوک به یکدیگر را مدل کنند. محققان نشان میدهند که این منجر به "برخوردهای چند وجهی" و فروپاشی پذیرش سریع در موقعیتهای بعدی در یک بلوک پیشرو میشود، پدیدهای که آنها آن را فروپاشی پسوندی مینامند. هر چه بلوک موازی طولانی تر باشد، احتمال اشتباه دم آن بیشتر می شود.
مورد دوم یک مشکل در سطح سیستم است. در حالی که تولید بلوکهای پیشنویس طولانی ارزان است، بررسی کورکورانه هر توکن پیشنهادی ظرفیت دستهای کمیاب را در توکنهایی که احتمالاً رد میشوند، هدر میدهد. تحت همزمانی بالای یک سیستم سرویس واقعی، طول تأیید ایدهآل در امتداد دو محور متفاوت است: درخواستهای ساختاریافته مانند کد، نرخ پذیرش بالاتری نسبت به چت باز دارند، و تأیید توکنهای اضافی تحت بار سبک تقریباً رایگان است، اما زمانی که سیستم اشباع شده است، گران است.
یک مدل پیش نویس نیمه خود رگرسیون
برای رفع پوسیدگی پسوند، DSpark از آنچه که نویسندگان آن را معماری نیمه خود رگرسیون می نامند استفاده می کند. این یک ستون فقرات موازی محاسباتی سنگین را جفت میکند، که میتواند توکنهای زیادی را در یک زمان پیشنهاد کند، با یک ماژول متوالی سبک وزن که مدلسازی وابستگی درون بلوکی را معرفی میکند. هدف از این طراحی ترکیب ظرفیت بالای مدلهای موازی در موقعیتهای اولیه با پسوند انسجام پیشنویسهای خودبازگشت سنتی است که توکنها را یکی پس از دیگری تولید میکنند و به طور طبیعی به وابستگیها احترام میگذارند.
در معیارهای آفلاین کنترلشده شامل استدلال ریاضی، تولید کد و چت روزانه، تیم گزارش میدهد که DSpark بهطور قابلتوجهی طول پذیرفتهشده در هر چرخه تأیید را نسبت به خطوط پایه قوی بهبود میبخشد. به طور خاص، مقاله بیان می کند که DSpark طول پذیرفته شده را نسبت به پیش نویس اتورگرسیو Eagle3 به میزان 30.9٪، 26.7٪ و 30.0٪ در سه تنظیمات، و نسبت به پیش نویس موازی DFlash با 16.3٪، 18.4٪ و 18.3٪ بهبود می بخشد.
تأیید اعتبار برنامه ریزی شده، بارگذاری آگاهانه
نیمه جدیدتر DSpark رویکرد آن به تأیید است. به جای تأیید تعداد ثابتی از نشانههای پیشنویس برای هر درخواست، DSpark انتخاب طول تأیید را به عنوان یک مشکل به حداکثر رساندن توان عملیاتی جهانی فرموله میکند. این تخمین کالیبره شده از مدت زمانی که پیشوند پیشنویس احتمالاً زنده میماند، چیزی که مقاله احتمال بقا مینامد، با زمانبندی سختافزاری که بار موتور را در زمان واقعی میخواند، جفت میکند.
نتیجه تأیید زمانبندی اطمینان است: سیستم بهطور پویا تعداد نشانههایی را که برای هر درخواست تأیید میکند، بر اساس محتوای درخواست و وضعیت فعلی موتور خدمترسانی تنظیم میکند. تحت بارهای سبک، میتواند سخاوتمندانه تأیید کند، در حالی که در شرایط همزمانی سنگین، بودجه تأیید مدل هدف را فقط به سمت توکنهایی با بالاترین بازده مورد انتظار هدایت میکند، و از فروپاشی توان عملیاتی ناشی از صرف ظرفیت دستهای در توکنهای با احتمال کم جلوگیری میکند.
نتایج تحت ترافیک کاربر زنده
مهم ترین اعداد از تولید به دست می آیند. این تیم DSpark را در سیستم سرویس دهی DeepSeek-V4 که به ترافیک کاربران زنده خدمات می دهد مستقر کرده و آن را با خط پایه تولید قبلی شرکت، یک روش پیش بینی چند توکن معروف به MTP-1، مقایسه کردند.
بر اساس این مقاله، DSpark به طور مداوم سرعت تولید هر کاربر را 60٪ تا 85٪ برای DeepSeek-V4-Flash و 57٪ تا 78٪ برای DeepSeek-V4-Pro در توان کل منطبق افزایش می دهد. تحت توافق نامه های سختگیرانه در سطح خدمات که ظرفیت خط پایه به شدت کاهش می یابد، معادل 120 توکن در ثانیه برای Flash و 50 توکن در ثانیه برای Pro، DSpark سربار تأیید را کاهش می دهد تا توان عملیاتی قوی را حفظ کند. با غلبه بر این صخره عملکرد، نویسندگان استدلال میکنند که سطوح تعاملی سختگیرانهای را که قبلاً دست نیافتنی بودند، باز میکند و به طور مؤثر مرز پارتو در خدمت LLM را به بیرون تغییر میدهد.
این تمایز برای اپراتورها مهم است. سرعت هر کاربر سریعتر در کل یکسان به معنای دستیارها و گردشهای کاری فعالتر بدون خرید سختافزار بیشتر است، در حالی که بقای SLAهای تأخیر سخت تحت بار، چیزی است که یک نسخه آزمایشی تحقیقاتی را از سیستمی جدا میکند که میتواند در حین افزایش ترافیک مقاومت کند.
منبع باز برای انجمن
DeepSeek در حال انتشار پست های بازرسی آموزش دیده DSpark برای هر دو مدل DeepSeek-V4-Flash و DeepSeek-V4-Pro است. مخزن DeepSpec همراه، که تحت مجوز مجاز MIT منتشر شده است، به عنوان یک پایگاه کد آموزش و ارزیابی الگوریتم محور کامل پشته برای رمزگشایی حدسی توصیف شده است. این شامل ابزارهای آماده سازی داده ها، پیاده سازی مدل پیش نویس، اسکریپت های آموزشی، و مهارهای ارزیابی، و ارسال با سه الگوریتم مدل پیش نویس: DSpark، DFlash، و Eagle3 است.
این انتشار مانع دیگر آزمایشگاهها و تیمهای زیرساختی برای آموزش و ارزیابی مدلهای پیشنویس خود در برابر خط لوله استاندارد شده را کاهش میدهد. مجموعه ارزیابی DeepSpec معیارهای تعیین شده از جمله GSM8K، MATH500، AIME 2025، HumanEval، MBPP، LiveCodeBench، MT-Bench، AlpacaEval و Arena-Hard-v2 را پوشش می دهد.
چرا مهم است
هزینه استنتاج و تأخیر در حال حاضر یکی از محدودیتهای تعیینکننده صنعت هوش مصنوعی است که همه چیز را شکل میدهد، از نحوه استقرار تهاجمی عوامل هوش مصنوعی توسط شرکتها تا اینکه آیا ارائهدهندگان کوچکتر میتوانند با مقیاسکنندههای بزرگ در اقتصاد واحد رقابت کنند. سهم DSpark کمتر یک الگوریتم جدید است تا نمایشی که طراحی دقیق مدل پیش نویس و زمانبندی تأیید، و در نظر گرفتن طول تأیید به عنوان تابعی از وضعیت سیستم زنده، می تواند به طور معناداری سوزن را در استقرار واقعی حرکت دهد.
برای DeepSeek، که شهرت خود را بر روی سیستمهای کارآمد و آشکارا منتشر شده است، DSpark نقطه داده دیگری در بحثی است که آزمایشگاه بیش از یک سال است مطرح کرده است: اینکه عملکرد خدمات درجه مرزی را میتوان از طریق مهندسی هوشمندتر بهجای محاسبات خام به دست آورد. این واقعیت که سودها بهجای یک معیار مصنوعی، تحت ترافیک زنده اندازهگیری میشوند، نتیجه را برای سایر اپراتورها آسانتر میکند تا با هضم مقاله و شروع بازتولید اعداد، جامعه منبع باز مقاله را جدی بگیرند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

