चायनीज AI लॅब DeepSeek ने V4.1-Flash जारी केले आहे, एक मल्टीमॉडल ओपन-वेट मॉडेल जे 552-अब्ज-पॅरामीटर बॅकबोनची जोडणी करते ज्यात काही सर्वात आक्रमक मेमरी कॉम्प्रेशन असूनही फ्रंटियर-क्लास सिस्टममध्ये पाठवले जाते. हगिंग फेसवर एमआयटी परवाना आणि सोबतच्या तांत्रिक अहवालासह मॉडेल बुधवारी लाइव्ह झाले, रॉयटर्सने अहवाल दिला, हँगझो-आधारित लॅबसाठी ठळक बातम्यांचा समावेश आहे.
रिलीझ हे नेहमीच्या आवृत्तीच्या धक्क्यापेक्षा जास्त आहे. DeepSeek ने एकाच वेळी त्याचे फ्लॅगशिप V4 Pro टियर निवृत्त केले आहे, आणि TechNode ने नोंदवले आहे की V4 Pro ला विनंत्या आता V4.1-Flash कडे पाठवल्या जात आहेत — "फ्लॅश" नाव असलेल्या मॉडेलवर विश्वासार्ह विधान, तरीही ते बदलत असलेल्या मॉडेलवर किंवा त्याहून वर बेंचमार्क क्रमांक पोस्ट करते. For more context on this story, see our ongoing breaking AI news.
लहान मेमरी बिलसह एक मोठा "फ्लॅश".
अधिकृत मॉडेल कार्डनुसार, DeepSeek-V4.1-Flash हे 552 बिलियन बॅकबोन पॅरामीटर्ससह एक मिश्रण-ऑफ-एक्सपर्ट (MoE) मॉडेल आहे आणि 196-बिलियन-पॅरामीटर "Engram" कंडिशनल मेमरी घटक आहे ज्यामध्ये टोकन-आधारित लुकअपद्वारे विरळ प्रवेश केला जातो. पूर्ण आकार असूनही, मॉडेल प्रीफिल दरम्यान प्रति टोकन केवळ 8 अब्ज पॅरामीटर्स आणि डीकोड दरम्यान 16 अब्ज ** सक्रिय करते — त्याच्या 284B-पॅरामीटर पूर्ववर्तीपेक्षा कमी सक्रिय पॅरामीटर्स, जे सतत 13 अब्ज चालवतात.
आर्किटेक्चरल केंद्रस्थान म्हणजे डीपसीक याला कॅझल एन्कोडर-डीकोडर (CED) डिझाइन म्हणतात: 40-लेयर ट्रान्सफॉर्मरला 20-लेयर कॉझल एन्कोडरमध्ये विभाजित केले जाते आणि त्यानंतर 20-लेयर डीकोडर असते. कारण डीकोडरचे ग्लोबल KV कॅशे अंतिम एन्कोडरच्या लपलेल्या स्थितींमधून प्रक्षेपित केले जाते, ऐवजी थरानुसार जमा केले जाते, दीर्घ संभाषणे टिकवून ठेवण्यासाठी आवश्यक असलेली मेमरी नाटकीयरित्या कमी होते.
कॉम्प्रेशन नंबर हे मथळे आहेत. E2M1 फॉरमॅटमध्ये FP4 मुख्य KV कॅशिंगसह, ग्लोबल KV कॅशे फूटप्रिंट 890 बाइट्स प्रति टोकनपर्यंत घसरतो — DeepSeek-V4-Flash च्या अंदाजे एक चतुर्थांश. SWA बाउंडेड रीप्ले नावाचे तंत्र टोकन्सची फक्त सर्वात अलीकडील विंडो रीप्ले करून, पर्सिस्टंट KV कॅशे मागील फ्लॅश मॉडेलच्या सुमारे एक अष्टमांश कापून हरवलेल्या लक्ष स्थितीची पुनर्रचना करते. मॉडेल कार्डनुसार, V4-फ्लॅशच्या तुलनेत अंदाजे चारपट आणि DeepSeek-V1 विरुद्ध 437-पट कपात आहे. अतिरिक्त घटकांमध्ये कॉम्प्रेस्ड स्पार्स अटेंशन 2 (CSA2) समाविष्ट आहे, जे प्रत्येक अटेंशन लेयरला तीन स्टॅटिक मोडपैकी एक नियुक्त करते आणि वेगवान जनरेशनसाठी DSpark सट्टा डिकोडिंग.
हुड अंतर्गत, प्रत्येक MoE स्तर 384 राउटेड तज्ञांसह एक सामायिक तज्ञ एकत्र करतो, प्रति टोकन सहा राउटेड तज्ञ सक्रिय करतो.
बेंचमार्क: सेवानिवृत्त फ्लॅगशिपच्या पुढे
तांत्रिक अहवालातील बेस-मॉडेल मूल्यमापनांवर, V4.1-फ्लॅश अनेक महत्त्वाच्या चाचण्यांवर खूप मोठ्या V4 प्रोच्या पुढे गेले आहेत: 74.1 MMLU-Pro वर विरुद्ध 73.5, 79.4 HumanEval वर विरुद्ध 76.8, 60.6 वर आणि BigCodeBench, 980 वर. साउथ चायना मॉर्निंग पोस्टने वृत्त दिले आहे की डीपसीकने म्हटले आहे की नवीन मॉडेल किमी K3 ला सायबर आणि कोडिंग बेंचमार्कवर मागे टाकते, चीनी ओपन-मॉडेल फील्डमध्ये एक उल्लेखनीय दावा ज्यामध्ये Z.ai चे GLM-5.3 आणि अलीबाबाची क्वेन लाइन देखील समाविष्ट आहे.
जास्तीत जास्त तर्कशक्तीच्या प्रयत्नात, इंस्ट्रक्ट मॉडेलने GPQA डायमंडवर 90.9 स्कोअर केले — प्रभावी, तरीही डीपसीकच्या स्वतःच्या तुलना सारणीमध्ये संदर्भित आघाडीच्या फ्रंटियर सिस्टमच्या मागे, GPT-5.6 सोल 94.1 आणि क्लॉड ओपस 5.0 93.4 वर. किमी K3 92.9 वर बसतो. प्रामाणिकपणे वाचा: हे ओपन-वेट किमतीत फ्रंटियर-लगतचे मॉडेल आहे, बंद लॅबचे क्लीन स्वीप नाही.
V4.1-फ्लॅश देखील खऱ्या अर्थाने मल्टीमोडल आहे. एक DeepSeek-ViT व्हिजन एन्कोडर, सुरवातीपासून प्रशिक्षित, द्वि-स्तर प्रोजेक्टरद्वारे प्रतिमा फीड करते आणि पूर्व-प्रशिक्षणाच्या प्रारंभापासून मॉडेलला मजकूर आणि प्रतिमांवर एकत्रितपणे प्रशिक्षण दिले गेले. तो MMMU-Pro वर 56.5 आणि DocVQA वर 95.6 गुण मिळवतो.
एजंटसाठी तयार केलेले, व्हॉल्यूमसाठी किंमत
डिझाइन निवडी लक्ष्यित प्रेक्षकांना स्पष्ट करतात: एजंटिक वर्कलोड, जेथे मॉडेल्स प्रचंड संदर्भ वाचतात आणि दीर्घ क्षितिजांवर कार्य करतात. मॉडेल एक दशलक्ष टोकन्स पर्यंतच्या संदर्भ विंडोला समर्थन देते, 45-ट्रिलियन-टोकन मल्टीमोडल कॉर्पसवर प्रशिक्षित होते आणि 1 ते 100 पर्यंत सतत नियंत्रण करण्यायोग्य तर्क-प्रयत्न डायल ऑफर करते जे अचूकतेच्या विरूद्ध अनुमान खर्चाचे व्यवहार करते. डिकोडरच्या कव्हरेजने यावर जोर दिला की मेमरी बचत विशेषत: एआय एजंट्स चालवण्यासाठी लागणारा खर्च कमी करते - वर्कलोड जे आउटपुट तयार करण्यापेक्षा इनपुट वाचण्यात जास्त वेळ घालवतात.
समाजाची प्रतिक्रिया तीव्र आहे. हॅकर न्यूजवरील लॉन्च थ्रेडने 650 हून अधिक गुण मिळवले आणि "डीपसीक लॉन्चिंग v4.1 फ्लॅश स्वस्त आणि v4 प्रो पेक्षा अधिक सक्षम" शीर्षकाच्या आधीच्या थ्रेडने सुमारे 400 अधिक गोळा केले. स्थानिक पातळीवर मॉडेल्स चालवणाऱ्या टिप्पणीकारांनी नोंदवले की एन्ग्राम पॅरामीटर्स अगदी वेगवान SSDs वर देखील ऑफलोड केले जाऊ शकतात, ज्यामुळे ग्राहक हार्डवेअरवर जवळ-सीमाच्या अंदाजाचा मार्ग उघडला जातो.
सीकिंग अल्फाने व्यावसायिक भागीदारी स्पष्टपणे तयार केली, त्याला अल्ट्रा-लो-कॉस्ट मॉडेल म्हटले जे यूएस फ्रंटियर लॅबसाठी आव्हाने सादर करते — एक स्मरणपत्र आहे की AI अनुमानातील किंमत युद्ध थंड होण्याचे कोणतेही चिन्ह दर्शवत नाही.
घोषणेसाठी एक मुद्दाम क्षण
वेळ सांगते. लाँचच्या एक दिवस आधी, रॉयटर्सने अहवाल दिला की डीपसीकने शांघायच्या स्टार मार्केटवर आयपीओची व्यवस्था करण्यासाठी CITIC सिक्युरिटीजला टॅप केले आहे, पूर्वीच्या अहवालानंतर लॅबचा महसूल संभाव्य सूचीच्या दहापटीने वाढला आहे. हेडलाइन ग्रॅबिंग ओपन मॉडेल दिवसांनंतर पाठवणे ही गती चालू ठेवते.
चायनीज एआय फर्म्सच्या वाढीव छाननीच्या दरम्यान रिलीझ देखील उतरले आहे. या आठवड्याच्या सुरुवातीला, NSA, CISA आणि FBI सह यूएस एजन्सींनी औद्योगिक-स्केल मॉडेल डिस्टिलेशन बद्दलच्या सल्लागारात सहा चीनी AI कंपन्यांची नावे दिली - एक स्मरणपत्र आहे की डीपसीकचे तांत्रिक विजय आता भू-राजकीय सामानाबरोबरच येतात.
यापैकी काहीही अभियांत्रिकी कथा अंधुक करत नाही. V4 Pro निवृत्त झाल्यामुळे आणि त्याची वाहतूक स्वस्त, मजबूत मॉडेलकडे राउट झाल्यामुळे, DeepSeek ने सर्वात स्पष्ट युक्तिवाद केला आहे की 2026 मध्ये AI ची मनोरंजक सीमा केवळ सर्वात मोठे मॉडेल कोण बनवते — परंतु मेमरी प्रति गीगाबाइट सर्वात जास्त क्षमता कोण देते हे असू शकते.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →