DeepSeek ने DSpark, एक मुक्त-स्रोत सट्टा डीकोडिंग फ्रेमवर्क जारी केले आहे जे कंपनी म्हणते की आउटपुट गुणवत्तेत कोणतीही हानी न होता, थेट रहदारी अंतर्गत मोठ्या भाषा मॉडेल (LLM) अनुमानांना 85% पर्यंत गती देते. डीपसीक-एआय आणि पेकिंग युनिव्हर्सिटीच्या नवीन पेपरमध्ये वर्णन केलेले, सिस्टम आधीच डीपसीक-व्ही 4 सर्व्हिंग इन्फ्रास्ट्रक्चरमध्ये कार्यरत आहे जी वास्तविक वापरकर्त्याच्या विनंत्या हाताळते.
हे काम उत्पादन AI मधील सर्वात हट्टी समस्यांपैकी एक हाताळते: अनुमान मंद आहे कारण मॉडेल एका वेळी एक टोकन मजकूर व्युत्पन्न करतात, प्रत्येकाला नेटवर्कमधून पूर्ण पास आवश्यक असतो. सट्टा डिकोडिंग हा एक लोकप्रिय उपाय आहे ज्यामध्ये एक लहान, वेगवान "मसुदा" मॉडेल टोकन्सचा एक ब्लॉक प्रस्तावित करतो जे पूर्ण-आकाराचे मॉडेल नंतर एका पासमध्ये सत्यापित करते, सर्वात लांब योग्य उपसर्ग स्वीकारून. पडताळणी समांतर आणि गणितीयदृष्ट्या अचूक असल्यामुळे, मूळ मॉडेलचे वितरण जतन करताना ते गोष्टींना गती देते. DSpark, GitHub वर DeepSpec ट्रेनिंग रिपॉजिटरीसोबत रिलीझ झाला, त्वरीत हॅकर न्यूजवर सर्वाधिक चर्चिल्या गेलेल्या AI अभियांत्रिकी कथांपैकी एक बनला. For more context on this story, see our ongoing breaking AI news.
विद्यमान सट्टा डीकोडिंग भिंतीवर का आदळते
अलीकडील सट्टा डीकोडिंग संशोधन "समांतर ड्राफ्टर्स" कडे वळले आहे जे एकाच फॉरवर्ड पासमध्ये उमेदवार टोकनचा संपूर्ण ब्लॉक तयार करतात, मसुदा लेटन्सी ब्लॉक आकारापेक्षा जवळजवळ स्वतंत्र बनवते. डीएसपार्क पेपर दोन अडथळे ओळखतो ज्याने या पद्धतींना त्यांचे वचन पूर्ण करण्यापासून रोखले आहे.
प्रथम गुणवत्ता समस्या आहे. कारण समांतर ड्राफ्टर्स प्रत्येक स्थानाचा स्वतंत्रपणे अंदाज लावतात, ब्लॉकमधील टोकन एकमेकांवर कसे अवलंबून असतात हे ते मॉडेल करू शकत नाहीत. संशोधक दाखवतात की यामुळे "मल्टी-मॉडल टक्कर" होते आणि ड्राफ्ट ब्लॉकमध्ये नंतरच्या स्थानांवर जलद स्वीकृती क्षय होते, या घटनेला ते प्रत्यय क्षय म्हणतात. समांतर ब्लॉक जितका लांब असेल तितकी त्याची शेपटी चुकीची असण्याची शक्यता जास्त असते.
दुसरी प्रणाली-स्तरीय समस्या आहे. लाँग ड्राफ्ट ब्लॉक्सची निर्मिती स्वस्त असली तरी, प्रत्येक प्रस्तावित टोकनची आंधळेपणाने पडताळणी केल्याने टोकन नाकारले जाण्याची शक्यता असलेली दुर्मिळ बॅच क्षमता वाया जाते. रिअल सर्व्हिंग सिस्टीमच्या उच्च संगती अंतर्गत, आदर्श पडताळणी लांबी दोन अक्षांमध्ये बदलते: कोड सारख्या संरचित विनंत्या ओपन-एंडेड चॅटपेक्षा उच्च स्वीकृती दर टिकवून ठेवतात आणि अतिरिक्त टोकन सत्यापित करणे हे हलके लोड अंतर्गत जवळजवळ विनामूल्य असते परंतु जेव्हा सिस्टम संतृप्त असते तेव्हा महाग असते.
एक सेमी-ऑटोरेग्रेसिव्ह मसुदा मॉडेल
प्रत्यय क्षय दुरुस्त करण्यासाठी, DSpark दत्तक घेते ज्याला लेखक अर्ध-ऑटोरेग्रेसिव्ह आर्किटेक्चर म्हणतात. हे संगणकीयदृष्ट्या जड समांतर पाठीचा कणा जोडते, जे एकाच वेळी अनेक टोकन प्रस्तावित करू शकते, एका हलक्या वजनाच्या अनुक्रमिक मॉड्यूलसह जे इंट्रा-ब्लॉक अवलंबित्व मॉडेलिंग सादर करते. डिझाईनचा उद्देश पारंपारिक ऑटोरेग्रेसिव्ह ड्राफ्टर्सच्या प्रत्यय सुसंगततेसह सुरुवातीच्या पोझिशन्सवर समांतर मॉडेल्सची उच्च क्षमता एकत्र करणे आहे, जे एकामागून एक टोकन तयार करतात आणि नैसर्गिकरित्या अवलंबनांचा आदर करतात.
गणितीय तर्क, कोड जनरेशन आणि दैनंदिन चॅटवर पसरलेल्या नियंत्रित ऑफलाइन बेंचमार्कवर, टीमने अहवाल दिला की DSpark मजबूत बेसलाइन्सवर प्रत्येक पडताळणी चक्रात स्वीकारलेली लांबी लक्षणीयरीत्या सुधारते. विशेषत:, पेपरमध्ये असे नमूद केले आहे की DSpark तीन सेटिंग्जमध्ये ऑटोरिग्रेसिव्ह Eagle3 ड्राफ्टरवर 30.9%, 26.7% आणि 30.0% ने आणि समांतर DFlash ड्राफ्टरवर 16.3%, 18.4% आणि 18.3% ने स्वीकृत लांबी सुधारते.
आत्मविश्वास-अनुसूचित, लोड-अवेअर सत्यापन
डीएसपार्कचा अर्धा भाग म्हणजे त्याची पडताळणी करण्याचा दृष्टीकोन. प्रत्येक विनंतीसाठी ठराविक संख्येच्या ड्राफ्ट टोकनची पडताळणी करण्याऐवजी, DSpark जागतिक थ्रुपुट जास्तीत जास्त समस्या म्हणून सत्यापन-लांबीची निवड तयार करते. हे ड्राफ्टचा उपसर्ग किती काळ टिकून राहण्याची शक्यता आहे, पेपर सर्व्हायव्हल संभाव्यता ज्याला म्हणतात, हार्डवेअर-जागरूक शेड्युलरसह जो रिअल-टाइम इंजिन लोड वाचतो याचे कॅलिब्रेट केलेले अंदाज जोडते.
याचा परिणाम आत्मविश्वास-अनुसूचित पडताळणी आहे: विनंतीची सामग्री आणि सर्व्हिंग इंजिनची सद्य स्थिती या दोन्हीच्या आधारावर सिस्टम प्रत्येक विनंतीसाठी किती टोकन सत्यापित करते हे डायनॅमिकपणे तयार करते. कमी-संभाव्यता टोकन्सवर बॅच क्षमता खर्च केल्यामुळे होणारे थ्रुपुट कोलॅप्स टाळून, हलक्या भारांत ते उदारतेने सत्यापित करणे परवडते, तर जास्त समांतरतेमध्ये ते लक्ष्य मॉडेलचे सत्यापन बजेट केवळ सर्वाधिक अपेक्षित परताव्यासह टोकन्सकडे पाठवते.
थेट वापरकर्ता रहदारी अंतर्गत परिणाम
सर्वात परिणामकारक संख्या उत्पादनातून येतात. टीमने DSpark ला DeepSeek-V4 सर्व्हिंग सिस्टममध्ये लाइव्ह यूजर ट्रॅफिकची सेवा दिली आणि कंपनीच्या आधीच्या उत्पादन बेसलाइनशी तुलना केली, MTP-1 म्हणून ओळखली जाणारी मल्टी-टोकन अंदाज पद्धत.
पेपरनुसार, डीएसपार्क सातत्याने डीपसीक-व्ही4-फ्लॅशसाठी 60% ते 85% आणि DeepSeek-V4-प्रोसाठी 57% ते 78% पर्यंत प्रति-वापरकर्ता जनरेशन वेग वाढवते. कठोर सेवा-स्तरीय करारांतर्गत जेथे बेसलाइनची क्षमता गंभीरपणे बिघडते, फ्लॅशसाठी 120 टोकन प्रति सेकंद आणि Pro साठी 50 टोकन प्रति सेकंद समतुल्य, DSpark मजबूत थ्रूपुट राखण्यासाठी सत्यापन ओव्हरहेड कमी करते. त्या परफॉर्मन्स क्लिफवर मात करून, लेखकांचा असा युक्तिवाद आहे की ते पूर्वी अप्राप्य असलेले कठोर परस्परसंवाद स्तर अनलॉक करते, प्रभावीपणे LLM च्या पेरेटो फ्रंटियरला बाहेरच्या दिशेने हलवते.
ऑपरेटरसाठी हा फरक महत्त्वाचा आहे. समान एकूण थ्रूपुटवर वेगवान प्रति-वापरकर्ता गती म्हणजे अधिक हार्डवेअर खरेदी न करता अधिक प्रतिसाद देणारे सहाय्यक आणि एजंटिक वर्कफ्लो, लोड अंतर्गत कठोर लेटेंसी SLA ला टिकून राहणे हेच संशोधन डेमोला ट्रॅफिक स्पाइक्स दरम्यान रोखू शकणाऱ्या सिस्टमपासून वेगळे करते.
समुदायासाठी मुक्त स्रोत
DeepSeek, DeepSeek-V4-Flash आणि DeepSeek-V4-Pro प्रिव्ह्यू मॉडेल्ससाठी प्रशिक्षित DSpark चेकपॉईंट्स सोडत आहे. अनुज्ञेय MIT परवान्याअंतर्गत प्रकाशित केलेल्या डीपस्पेक रेपॉजिटरीसह, सट्टा डिकोडिंगसाठी पूर्ण-स्टॅक, अल्गोरिदम-चालित प्रशिक्षण आणि मूल्यमापन कोडबेस म्हणून वर्णन केले आहे. यामध्ये डेटा तयार करण्याच्या उपयुक्तता, मसुदा मॉडेलची अंमलबजावणी, प्रशिक्षण स्क्रिप्ट आणि मूल्यमापन हार्नेस आणि तीन मसुदा मॉडेल अल्गोरिदमसह जहाजे समाविष्ट आहेत: DSpark, DFlash आणि Eagle3.
हे प्रकाशन इतर प्रयोगशाळा आणि पायाभूत सुविधा संघांना प्रमाणित पाइपलाइनच्या विरूद्ध त्यांच्या स्वतःच्या मसुदा मॉडेलचे प्रशिक्षण आणि बेंचमार्क करण्यासाठी अडथळा कमी करते. DeepSpec च्या मूल्यमापन सूटमध्ये GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval आणि Arena-Hard-v2 यासह स्थापित बेंचमार्क समाविष्ट आहेत.
हे महत्त्वाचे का आहे
अनुमान खर्च आणि लेटन्सी हे आता AI उद्योगाच्या निर्णायक मर्यादांपैकी एक आहेत, कंपन्या एआय एजंट किती आक्रमकपणे तैनात करतात ते लहान प्रदाते युनिट इकॉनॉमिक्सवर हायपरस्केलर्सशी स्पर्धा करू शकतात की नाही या सर्व गोष्टींना आकार देतात. DSpark चे योगदान हे प्रात्यक्षिकापेक्षा कमी एकल नवीन अल्गोरिदम आहे जे काळजीपूर्वक मसुदा मॉडेल आणि पडताळणी शेड्यूलरचे सह-डिझाइन करते आणि लाइव्ह सिस्टम स्थितीचे कार्य म्हणून पडताळणी लांबी हाताळते, वास्तविक उपयोजनांमध्ये सुईला अर्थपूर्णपणे हलवू शकते.
DeepSeek साठी, ज्याने कार्यक्षम, उघडपणे रिलीझ केलेल्या सिस्टीमवर आपली प्रतिष्ठा निर्माण केली आहे, DSpark हा लॅब एक वर्षाहून अधिक काळ करत असलेल्या युक्तिवादातील आणखी एक डेटा पॉइंट आहे: फ्रंटियर-ग्रेड सर्व्हिंग कामगिरी केवळ कच्च्या गणनेच्या ऐवजी हुशार अभियांत्रिकीद्वारे प्राप्त केली जाऊ शकते. सिंथेटिक बेंचमार्कच्या ऐवजी थेट ट्रॅफिक अंतर्गत नफा मोजला गेला या वस्तुस्थितीमुळे, इतर ऑपरेटरसाठी परिणाम गांभीर्याने घेणे सोपे होते कारण मुक्त-स्रोत समुदाय कागद पचवतो आणि संख्या पुनरुत्पादित करण्यास सुरवात करतो.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

