Cerebras ने Qwen 3.8 27B त्याच्या सेरेब्रास इन्फरेन्स प्लॅटफॉर्मच्या पब्लिक एंडपॉइंट्समध्ये जोडले आहे, जेथे ओपन-वेट मॉडेल प्रति सेकंद अंदाजे 1,500 टोकन्सने चालते, कंपनीच्या मॉडेल कॅटलॉग दस्तऐवजीकरणानुसार. सूचीमुळे अलीबाबाच्या सर्वात मोठ्या प्रमाणात वापरल्या जाणाऱ्या ओपन मॉडेल कुटुंबांपैकी एक अशा वेगाने उपलब्ध आहे जे सामान्य GPU-होस्टेड सर्व्हिंगला कमी करते.

या घोषणेने विकसकांचे तात्काळ लक्ष वेधून घेतले: या कथेने एका दिवसात हॅकर न्यूजवर 600 हून अधिक गुण जमा केले, एक कर्षण पातळी जी जलद, स्वस्त अनुमानाची मागणी किती तीव्र झाली आहे हे दर्शवते. अनुमान बाजाराच्या विस्तृत दृश्यासाठी, ब्रेकिंग एआय न्यूज डेस्क प्रत्येक प्रमुख प्लॅटफॉर्म अद्यतनाचे अनुसरण करते जसे ते उतरते.

कॅटलॉगवरील चष्मा

प्रति सेरेब्रास दस्तऐवजीकरण, Qwen 3.8 27B मध्ये 27 अब्ज पॅरामीटर्स आहेत आणि विनामूल्य टियरवर संदर्भाच्या 64K टोकन आणि सशुल्क टियरवर 128K, प्रति सेकंद अंदाजे 1,500 टोकन्सचे समर्थन करते. हे OpenAI च्या ओपन-वेट GPT-OSS 120B मॉडेलच्या बाजूने बसते, जे समान कॅटलॉग फ्री टियरवर 65K संदर्भासह आणि सशुल्क टियरवर 131K प्रति सेकंद अंदाजे 3,000 टोकन सूचीबद्ध करते.

दोन्ही मॉडेल्स सेरेब्रासच्या मोफत चाचणीवर उपलब्ध आहेत आणि दर मर्यादेच्या अधीन राहून तुम्ही-जाता-जाता पे टियरवर उपलब्ध आहेत. राखीव क्षमता, उच्च थ्रूपुट किंवा उत्पादन SLA ची आवश्यकता असलेल्या ग्राहकांना कंपनीच्या समर्पित एंडपॉइंट्स ऑफरकडे निर्देशित केले जाते, जे दस्तऐवज सार्वजनिक एंडपॉइंट्सवरील दोन पलीकडे अतिरिक्त मॉडेल कुटुंबांसाठी मार्ग म्हणून देखील सूचीबद्ध करते.

स्पीड आकृत्यांसह संदर्भ विंडो लक्ष देण्यास पात्र आहेत. फ्री टियरवर चौसष्ट हजार टोकन — आणि सशुल्क 128,000 — एकाच वेळी मोठ्या प्रमाणात कोडबेस, लांब दस्तऐवज किंवा विस्तारित एजंट ट्रान्सक्रिप्ट मेमरीमध्ये ठेवण्यासाठी पुरेसे आहेत, जे अचूक वर्कलोड्ससाठी महत्त्वाचे आहे जेथे जलद डीकोडिंगचे पैसे मिळतात. सेरेब्रासच्या दस्तऐवजीकरणामध्ये OpenAI सुसंगतता मार्गदर्शक देखील समाविष्ट आहे, ज्या संघांचा विद्यमान कोड आधीच OpenAI SDK ला लक्ष्य करतो त्यांच्यासाठी स्विचिंग खर्च कमी करतो: तत्त्वतः, सेरेब्रास एंडपॉईंटवर विद्यमान क्लायंटला निर्देशित करणे हे पुनर्लेखनाऐवजी कॉन्फिगरेशन बदल आहे.

छाटणी न केलेले मॉडेल, पारदर्शक कॉम्प्रेशन

डॉक्युमेंटेशनमध्ये लक्षात घेण्यासारखे एक तपशील म्हणजे सेरेब्रासने मॉडेल कॉम्प्रेशन कसे हाताळले याचे प्रकटीकरण. कंपनीने असे म्हटले आहे की तिच्या सार्वजनिक एंडपॉइंट्सवरील सर्व मॉडेल मूळ, छाटणी न केलेल्या आवृत्त्या आहेत आणि गुणवत्ता टिकवून ठेवण्यासाठी ते केवळ स्टोरेज दरम्यान निवडक वजन-मात्र परिमाणीकरण वापरते. संवेदनशील स्तर पूर्ण अचूकतेवर राहतात, सक्रियता, लक्ष आणि केव्ही कॅशे अप्रमाणित राहतात, आणि माशीचे निर्मूलन होते.

सेरेब्रास REAP (राउटर-वेटेड एक्सपर्ट ॲक्टिव्हेशन प्रुनिंग) सारख्या छाटणीच्या तंत्रांवरील संशोधनाचा खुलासा देखील करतात: छाटणी केलेले प्रकार हगिंग फेसवरील संशोधन समुदायासोबत शेअर केले जातात परंतु सार्वजनिक API द्वारे दिले जात नाहीत. खुले मॉडेल कुठे चालवायचे हे निवडणाऱ्या विकसकांसाठी, नेमके काय दिले जात आहे याबद्दलची पारदर्शकता असामान्यपणे स्पष्ट आहे.

टोकन गती महत्त्वाची का आहे

एजंटिक आणि कोडिंग वर्कलोड्ससाठी यासारख्या थ्रूपुट संख्या सर्वात जास्त महत्त्वाच्या आहेत. शेकडो मॉडेल कॉलची साखळी असलेले अनुप्रयोग — कोडिंग एजंट, स्वायत्त कार्यप्रवाह, रीअल-टाइम असिस्टंट — प्रत्येक टप्प्यावर प्रति-टोकन विलंबता गुणाकार करतात, त्यामुळे गुणात्मक भिन्न अनुभवामध्ये प्रति सेकंद 50 आणि 1,500 टोकन्समधील फरक. इंटरएक्टिव्ह ॲप्लिकेशन्स जे दीर्घ पूर्णता प्रवाहित करतात ते सर्वात दृश्यमानपणे लाभ घेतात.

ट्रेड ऑफ स्कोप आहे. 27-अब्ज-पॅरामीटर मॉडेल सर्वात कठीण युक्तिवादाच्या कार्यांवर फ्रंटियर सिस्टमशी जुळत नाही आणि सेरेब्रासचे स्वतःचे डॉक्स समर्पित क्षमतेच्या दिशेने प्रचंड उत्पादन वर्कलोड करतात. परंतु कार्यांच्या मोठ्या मध्यम मैदानासाठी जेथे मध्यम आकाराचे खुले मॉडेल आधीच पुरेसे आहेत — सारांशीकरण, वर्गीकरण, साधन वापरणे, कोड संपादन — वेग भिन्नता बनतो.

एक किंमत परिमाण देखील आहे विकासक वजन करतील. सार्वजनिक एंडपॉईंट मॉडेल कोणत्याही वचनबद्धतेपूर्वी विनामूल्य चाचणीवर वापरण्यायोग्य असतात, जे संघाच्या स्वतःच्या वर्कलोडच्या विरूद्ध बेंचमार्किंग अनिवार्यपणे घर्षण-मुक्त बनवते — एक मुद्दाम ऑन-रॅम्प जो एंटरप्राइझ करारांशी विरोधाभास करतो ज्यात प्रथम टोकन सादर करण्यापूर्वी विक्री संभाषण आवश्यक असते. दस्तऐवजीकरण केलेल्या दर मर्यादा पाहण्यासाठी मर्यादा आहेत: मुक्त-स्तरीय प्रवेश वेग सिद्ध करण्यासाठी अस्तित्वात आहे, उत्पादन रहदारी चालविण्यासाठी नाही.

खुल्या मॉडेल्ससाठी एक व्यस्त ताण

ओपन-वेट एआयसाठी गर्दीच्या वेळी जोडणी केली जाते. UAE-आधारित लॅब IFM ने नुकतेच K2 Horizon सादर केले आहे, जो सहा पूर्णपणे उघडलेल्या मॉडेल्सचा एक कनेक्टेड फ्लीट आहे आणि मेटा कोडिंग आणि एजंटिक वापरासाठी त्याच्या म्युझ कुटुंबाची पुनरावृत्ती करत आहे. दरम्यान, चीनमधील ओपन-मॉडेल इकोसिस्टम्स अशा वेगाने शिपिंग सुरू ठेवतात ज्याने संपूर्ण उद्योगात रिलीझ चक्र संकुचित केले आहे.

विकसकांसाठी, व्यावहारिक टेकअवे हे आहे की ओपन-मॉडेल स्टॅक एकाच वेळी दोन आघाड्यांवर परिपक्व होत आहे: क्षमता, मध्यम आकाराचे मॉडेल दैनंदिन कामांमध्ये फ्लॅगशिपसह अंतर बंद करतात आणि अर्थशास्त्र सेवा देतात, कारण विशेष अनुमान प्रदाते कच्च्या गतीवर स्पर्धा करतात. सेरेब्रासवरील Qwen 3.8 27B हा दोन्ही ट्रेंडसाठी डेटा पॉईंट आहे — सध्याच्या पिढीतील ओपन मॉडेल जे एका वर्षापूर्वी विदेशी गतीने दिले जाते, हार्डवेअरच्या उद्देशाने जॉबसाठी तयार केलेले.

प्लॅटफॉर्मचे मूल्यमापन करणाऱ्या विकसकांनी त्यांच्या स्वतःच्या वर्कलोडचे बेंचमार्क केले पाहिजे: प्रकाशित वेग हे कॅटलॉग आकृत्या आहेत, वास्तविक-जागतिक थ्रूपुट हे प्रॉम्प्ट लांबी, समांतरता आणि कॉन्फिगरेशनवर अवलंबून असते आणि फ्री टियरच्या दर मर्यादा त्याच्या वेगाच्या आधी बांधल्या जातील.

AI च्या पुढे रहा

प्रत्येक मॉडेल रिलीज, अनुमान प्लॅटफॉर्म अपडेट आणि डेव्हलपर टूल लॉन्च, जसे घडते तसे ट्रॅक केले जाते — अधिक एआय बातम्या वाचा →