कंपनी के मॉडल कैटलॉग दस्तावेज़ीकरण के अनुसार, सेरेब्रस ने अपने सेरेब्रस इंफ़रेंस प्लेटफ़ॉर्म के सार्वजनिक एंडपॉइंट में क्वेन 3.8 27बी को जोड़ा है, जहां ओपन-वेट मॉडल लगभग 1,500 टोकन प्रति सेकंड पर चलता है। लिस्टिंग अलीबाबा के सबसे व्यापक रूप से उपयोग किए जाने वाले ओपन मॉडल परिवारों में से एक को उस गति पर उपलब्ध कराती है जो सामान्य जीपीयू-होस्टेड सेवा को बौना बनाती है।

घोषणा ने डेवलपर्स का तत्काल ध्यान आकर्षित किया: कहानी ने एक दिन के भीतर हैकर न्यूज पर 600 से अधिक अंक जुटाए, यह एक स्तर का आकर्षण है जो दर्शाता है कि तेज, सस्ते अनुमान की मांग कितनी गर्म हो गई है। अनुमान बाज़ार के व्यापक दृष्टिकोण के लिए, [ब्रेकिंग एआई न्यूज़] (https://aibuzzwire.news) डेस्क हर प्रमुख प्लेटफ़ॉर्म अपडेट पर नज़र रखता है।

कैटलॉग पर विवरण

सेरेब्रस के दस्तावेज़ के अनुसार, क्वेन 3.8 27बी में 27 बिलियन पैरामीटर हैं और फ्री टियर पर संदर्भ के 64K टोकन और पेड टियर पर 128K का समर्थन करता है, जो लगभग 1,500 टोकन प्रति सेकंड पर चलता है। यह OpenAI के ओपन-वेट GPT-OSS 120B मॉडल के साथ बैठता है, जो समान कैटलॉग में लगभग 3,000 टोकन प्रति सेकंड पर फ्री टियर पर 65K संदर्भ और पेड टियर पर 131K के साथ सूचीबद्ध है।

दोनों मॉडल दर सीमा के अधीन, सेरेब्रा के नि:शुल्क परीक्षण और पे-एज़-यू-गो स्तरों पर उपलब्ध हैं। आरक्षित क्षमता, उच्च थ्रूपुट या उत्पादन एसएलए की आवश्यकता वाले ग्राहकों को कंपनी के समर्पित एंडपॉइंट्स की पेशकश के लिए निर्देशित किया जाता है, जिसे दस्तावेज़ सार्वजनिक एंडपॉइंट्स पर दो से परे अतिरिक्त मॉडल परिवारों के मार्ग के रूप में भी सूचीबद्ध करता है।

गति के आंकड़ों के साथ-साथ संदर्भ विंडो भी ध्यान देने योग्य है। फ्री टियर पर चौंसठ हजार टोकन - और भुगतान पर 128,000 टोकन - बड़े कोडबेस, लंबे दस्तावेज़ या विस्तारित एजेंट ट्रांसक्रिप्ट को एक साथ मेमोरी में रखने के लिए पर्याप्त हैं, जो सटीक वर्कलोड के लिए मायने रखता है जहां तेजी से डिकोडिंग फायदेमंद होती है। सेरेब्रस के दस्तावेज़ में एक ओपनएआई संगतता गाइड भी शामिल है, जो उन टीमों के लिए स्विचिंग लागत को कम करता है जिनका मौजूदा कोड पहले से ही ओपनएआई एसडीके को लक्षित करता है: सिद्धांत रूप में, सेरेब्रस एंडपॉइंट पर मौजूदा क्लाइंट को इंगित करना एक पुनर्लेखन के बजाय एक कॉन्फ़िगरेशन परिवर्तन है।

बिना काटे गए मॉडल, पारदर्शी संपीड़न

दस्तावेज़ीकरण में ध्यान देने योग्य एक विवरण सेरेब्रस का यह खुलासा है कि यह मॉडल संपीड़न को कैसे संभालता है। कंपनी का कहना है कि उसके सार्वजनिक एंडपॉइंट पर सभी मॉडल मूल, बिना काटे गए संस्करण हैं, और यह गुणवत्ता को बनाए रखने के लिए भंडारण के दौरान केवल चयनात्मक वजन परिमाणीकरण का उपयोग करता है। संवेदनशील परतें पूर्ण परिशुद्धता पर रहती हैं, सक्रियण, ध्यान और केवी कैश अनियंत्रित रहते हैं, और डीक्वांटाइजेशन तुरंत होता है।

सेरेब्रस आरईएपी (राउटर-वेटेड एक्सपर्ट एक्टिवेशन प्रूनिंग) जैसी प्रूनिंग तकनीकों में अपने शोध का भी खुलासा करता है: काटे गए वेरिएंट को हगिंग फेस पर अनुसंधान समुदाय के साथ साझा किया जाता है लेकिन सार्वजनिक एपीआई के माध्यम से नहीं परोसा जाता है। डेवलपर्स के लिए यह चुनना कि खुले मॉडल कहां चलाने हैं, वास्तव में क्या परोसा जा रहा है, इसके बारे में पारदर्शिता असामान्य रूप से स्पष्ट है।

टोकन स्पीड क्यों मायने रखती है

इस तरह के थ्रूपुट नंबर एजेंटिक और कोडिंग वर्कलोड के लिए सबसे ज्यादा मायने रखते हैं। ऐसे एप्लिकेशन जो सैकड़ों मॉडल कॉलों की श्रृंखला बनाते हैं - कोडिंग एजेंट, स्वायत्त वर्कफ़्लो, वास्तविक समय सहायक - हर चरण में प्रति-टोकन विलंबता को बढ़ाते हैं, इसलिए 50 और 1,500 टोकन प्रति सेकंड के बीच का अंतर गुणात्मक रूप से अलग अनुभव में बदल जाता है। लंबे समय तक पूर्णता स्ट्रीम करने वाले इंटरएक्टिव एप्लिकेशन सबसे अधिक स्पष्ट रूप से लाभान्वित होते हैं।

व्यापार-बंद की गुंजाइश है. 27-बिलियन-पैरामीटर मॉडल सबसे कठिन तर्क कार्यों पर फ्रंटियर सिस्टम से मेल नहीं खाएगा, और सेरेब्रस के स्वयं के दस्तावेज़ भारी उत्पादन कार्यभार को समर्पित क्षमता की ओर ले जाते हैं। लेकिन कार्यों के बड़े मध्य मैदान के लिए जहां मध्यम आकार के खुले मॉडल पहले से ही काफी अच्छे हैं - संक्षेपण, वर्गीकरण, उपकरण का उपयोग, कोड संपादन - गति विभेदक बन जाती है।

एक मूल्य आयाम भी है जिसे डेवलपर्स तौलेंगे। सार्वजनिक समापन बिंदु मॉडल किसी भी प्रतिबद्धता से पहले नि:शुल्क परीक्षण पर प्रयोग करने योग्य होते हैं, जो टीम के स्वयं के कार्यभार के खिलाफ बेंचमार्किंग को अनिवार्य रूप से घर्षण-मुक्त बनाता है - एक जानबूझकर ऑन-रैंप जो उद्यम अनुबंधों के विपरीत होता है जिसके लिए पहले टोकन परोसने से पहले बिक्री वार्तालाप की आवश्यकता होती है। प्रलेखित दर सीमाएं देखने में बाधा हैं: गति को साबित करने के लिए फ्री-टियर पहुंच मौजूद है, न कि उत्पादन ट्रैफ़िक चलाने के लिए।

खुले मॉडलों के लिए एक व्यस्त खिंचाव

ओपन-वेट एआई के लिए भीड़-भाड़ वाले हिस्से के दौरान अतिरिक्त भूमि। संयुक्त अरब अमीरात स्थित लैब आईएफएम ने हाल ही में के2 होराइजन पेश किया है, जो छह पूरी तरह से खुले मॉडलों का एक कनेक्टेड बेड़ा है, और मेटा कोडिंग और एजेंटिक उपयोग के लिए अपने म्यूज़ परिवार को पुनरावृत्त करना जारी रखता है। इस बीच, चीन में ओपन-मॉडल इकोसिस्टम शिपिंग को ऐसी गति से रखता है जिससे पूरे उद्योग में रिलीज चक्र संकुचित हो जाता है।

डेवलपर्स के लिए, व्यावहारिक उपाय यह है कि ओपन-मॉडल स्टैक एक साथ दो मोर्चों पर परिपक्व हो रहा है: क्षमता, क्योंकि मध्यम आकार के मॉडल रोजमर्रा के कार्यों में फ्लैगशिप के साथ अंतराल को कम करते हैं, और अर्थशास्त्र की सेवा करते हैं, क्योंकि विशेष अनुमान प्रदाता कच्ची गति पर प्रतिस्पर्धा करते हैं। सेरेब्रस पर क्वेन 3.8 27बी दोनों रुझानों के लिए एक डेटा बिंदु है - एक वर्तमान पीढ़ी का खुला मॉडल जो एक साल पहले विदेशी गति पर काम करता था, जो काम के लिए हार्डवेयर उद्देश्य से बनाया गया था।

प्लेटफ़ॉर्म का मूल्यांकन करने वाले डेवलपर्स को अपने स्वयं के वर्कलोड को बेंचमार्क करना चाहिए: प्रकाशित गति कैटलॉग आंकड़े हैं, वास्तविक दुनिया थ्रूपुट शीघ्र लंबाई, समवर्ती और कॉन्फ़िगरेशन पर निर्भर करती है, और फ्री टियर की दर सीमाएं इसकी गति से पहले बंधेंगी।

एआई से आगे रहें

प्रत्येक मॉडल रिलीज़, अनुमान प्लेटफ़ॉर्म अपडेट और डेवलपर टूल लॉन्च को ट्रैक किया जाता है - अधिक AI समाचार पढ़ें →