Strata नावाच्या अल्प-ज्ञात मुक्त-स्रोत प्रकल्पाला एक क्षण येत आहे. MIT-परवानाधारक इंजिन, जे Alibaba चे Qwen3.8-Flash-Next चालवते — 125-अब्ज-पॅरामीटर मिश्रण-ऑफ-एक्सपर्ट मॉडेल — सामान्य गेमिंग पीसीवर, 4 ऑक्टोबर रोजी 640 पेक्षा जास्त गुणांसह हॅकर न्यूजच्या पहिल्या पानावर शूट केले गेले आणि त्याचे GitHub रिपॉझिटरी 01 सप्टेंबरपासून तयार झाले. २४.

खेळपट्टी सोपी आहे: 125-अब्ज-पॅरामीटर मॉडेल जे सर्वसाधारणपणे सर्व्हरवर राहतात ते चॅट करू शकते, कोड लिहू शकते, प्रतिमा वाचू शकते आणि पूर्णपणे ग्राहक ग्राफिक्स कार्डवर कोडिंग एजंट चालवू शकते, मशीनमधून काहीही न सोडता.

स्तर प्रत्यक्षात काय करतो

स्ट्रॅटा हे एक अनुमान इंजिन आणि Windows आणि Linux साठी एक-क्लिक इंस्टॉलर दोन्ही आहे. त्याच्या दस्तऐवजीकरणानुसार, फ्रंटियर-मॉडेल मानकांनुसार आवश्यकता माफक आहेत: NVIDIA च्या RTX 20, 30, 40 किंवा 50 मालिकेतील VRAM च्या किमान 12GB सह GPU किंवा AMD च्या Radeon RX 6000, 7000 किंवा 9000 मालिका, किमान 32GB RAM आणि 8GB ची मोकळी SSD प्रणाली.

इंजिन Qwen3.8-Flash-Next च्या क्वांटाइज्ड आवृत्त्या Q2_0 पासून IQ3_S पर्यंत अनेक कॉम्प्रेशन स्तरांवर पाठवते, तसेच कोड-स्पेशलाइज्ड व्हेरियंट. हे लोकलहोस्टवर OpenAI आणि Anthropic-compatible APIs उघड करते, म्हणजे ChatGPT किंवा Claude साठी तयार केलेली साधने — क्लॉड कोड, कर्सर आणि कोडेक्स सारख्या कोडिंग एजंट्ससह — कमीत कमी बदलांसह स्थानिक सर्व्हरकडे निर्देशित केले जाऊ शकतात. पर्यायी प्रतिमा इनपुट आणि मल्टी-जीपीयू समर्थन समाविष्ट केले आहे, आणि इंस्टॉलर एआय-सहाय्यित सेटअप मोड देखील ऑफर करतो जो कोडिंग असिस्टंटला एकाच पेस्ट केलेल्या प्रॉम्प्टवरून मशीन कॉन्फिगर करू देतो.

गती क्रमांक

प्रकल्पाचे प्रकाशित बेंचमार्क, दोन ग्राहक डेस्कटॉपवर मोजले गेले, हे रिलीज पसरण्याचे कारण आहे. NVIDIA RTX 5070 वर 12GB VRAM सह Ryzen 5 7600 आणि 64GB RAM सह जोडलेले, Strata अहवाल:

  • Q2_0 क्वांटायझेशन: पिढीसाठी 94 टोकन प्रति सेकंद आणि 32K-टोकन दस्तऐवजावर त्वरित प्रक्रियेसाठी 2,650 टोकन प्रति सेकंद
  • IQ3_S: प्रति सेकंद ५३ टोकन, प्रति सेकंद १,६२० टोकन प्रॉम्प्ट प्रोसेसिंग
  • कोडर प्रकार: प्रति सेकंद ५५ टोकन

AMD बाजूला, 16GB VRAM सह RX 9070 XT Q2_0 वर प्रति सेकंद 60 टोकन व्यवस्थापित करते. दस्तऐवजाचा अंदाज आहे की 24GB VRAM सह RTX 3090 100 ते 140 टोकन प्रति सेकंदापर्यंत पोहोचले पाहिजे — जे बहुतेक लोक वाचू शकतील त्यापेक्षा जलद.

तुलनेसाठी, सहा महिन्यांपूर्वी, स्थानिक पातळीवर वापरण्यायोग्य वेगाने ७०-अब्ज-पॅरामीटर दाट मॉडेल चालवण्यासाठी शेकडो गीगाबाइट्स युनिफाइड मेमरी किंवा आक्रमक सट्टा डीकोडिंग युक्त्या असलेले वर्कस्टेशन आवश्यक होते.

125B मॉडेल गेमिंग कार्डवर का बसते

तंत्रज्ञानाच्या दोन तुकड्यांमुळे हे शक्य होते. प्रथम मॉडेल स्वतः आहे. AI Buzz Wire ने त्याच्या प्रकाशनात कव्हर केल्याप्रमाणे, Qwen3.8-Flash-Next हे तज्ञांचे मिश्रण आहे ज्यामध्ये अंदाजे 125 अब्ज एकूण पॅरामीटर्स आहेत परंतु प्रति टोकन फक्त 6 अब्ज सक्रिय आहेत — त्यामुळे प्रत्येक व्युत्पन्न केलेला शब्द नेटवर्कच्या छोट्या तुकड्याला स्पर्श करतो, नाटकीयरित्या प्रति टोकन गणना कमी करतो.

दुसरे म्हणजे परिमाणीकरण. स्ट्रॅटाचे सर्वात वेगवान प्रीसेट मॉडेलचे वजन दोन किंवा तीन बिट्स प्रति पॅरामीटरपर्यंत संकुचित करतात, 12GB GPU आणि सिस्टम RAM मध्ये बसणाऱ्या फूटप्रिंटसाठी काही अचूकतेचा व्यापार करतात. ते ट्रेडऑफ मुख्य चेतावणी आहे: Q2-वर्ग आणि IQ2-क्लास क्वांट्स तर्कसंगत-जड कार्यांवर गुणवत्ता कमी करतात आणि खरेदीदारांनी प्रत्येक वर्कलोडसाठी गॅरंटीऐवजी हेडलाइन स्पीड क्रमांकांना प्रारंभिक बिंदू मानावे. रेपॉजिटरीमधील सामुदायिक बेंचमार्क पृष्ठे सर्व आकारांमध्ये गुणवत्तेचा मागोवा घेतात.

मोठ्या स्थानिक-एआय वेव्हचा भाग

स्थानिक अनुमानासाठी वेग वाढवण्याच्या गतीमध्ये स्ट्राटा येत आहे. Alibaba चे Qwen कुटुंब सर्वात जास्त डाउनलोड केलेले ओपन-वेट मॉडेल लाइन बनले आहे, Meta आणि Google कडे त्यांचे स्वतःचे मुक्त-स्रोत स्पर्धात्मक मॉडेल आहेत, आणि टूल्सची लाट आता ग्राहकांना त्यांच्या डिव्हाइसेस सोडून सदस्यत्व किंवा डेटाशिवाय सक्षम सहाय्यक चालवू देते.

प्रकल्प "ग्राहक हार्डवेअर" ची व्याख्या कशी बदलत आहे हे देखील प्रतिबिंबित करते. 12GB VRAM सह मिड-रेंज 2026 ग्राफिक्स कार्ड, जे प्रामुख्याने गेमिंगसाठी पाठवले जाते, आता फक्त दोन वर्षांपूर्वी फ्रंटियर सिस्टम परिभाषित केलेल्या आकार वर्गातील मॉडेलसाठी एक व्यवहार्य अनुमान प्रवेगक आहे.

स्ट्रॅटा सुरुवातीचे सॉफ्टवेअर राहिले आहे — जुन्या GPUs आणि नॉन-AVX2 प्रोसेसरवर रेपॉजिटरी जारी करणारे ट्रॅकर दस्तऐवज रफ एज देते — परंतु हा प्रकल्प MIT-परवानाकृत, विनामूल्य आणि उघड्यावर विकसित केलेला आहे, Intel Arc, जुन्या Tesla आणि Radeon कार्ड्ससाठी प्रायोगिक समर्थनासह आणि समुदाय सदस्यांद्वारे दस्तऐवजीकरण केलेल्या मल्टी-GPU रिग.

विकसकांसाठी, लोकलहोस्ट API सुसंगतता ही सर्वात व्यावहारिक गोष्ट असू शकते: OpenAI किंवा Anthropic SDK विरुद्ध लिहिलेली कोणतीही स्क्रिप्ट किंवा एजंट बेस URL बदलून, Strata ला गोपनीयता-संवेदनशील प्रोटोटाइपिंग, ऑफलाइन वापरासाठी किंवा API खर्च कॅपिंगसाठी कमी-घर्षण पर्याय बनवून स्थानिक Qwen उपयोजनाकडे पुनर्निर्देशित केले जाऊ शकते.

हे कसे वापरायचे

प्रारंभ करण्यासाठी मॅन्युअलसह टर्मिनल सत्राची आवश्यकता नाही. इंस्टॉलर एका पासमध्ये ड्रायव्हर्स, मॉडेल वजन आणि स्थानिक सर्व्हरची तरतूद करतो आणि रेपॉजिटरीमध्ये थेट एआय कोडिंग असिस्टंटमध्ये पेस्ट करण्यासाठी डिझाइन केलेली सेटअप फाइल समाविष्ट असते, जी नंतर मशीनला स्वायत्तपणे कॉन्फिगर करते. डिस्कवरून वजन लोड होत असताना प्रथम प्रक्षेपण हळू होते; दस्तऐवजीकरण SSD ची शिफारस करते आणि चेतावणी देते की दीर्घ संभाषणे सिस्टम RAM वर अधिक कार्य करतात.

एआयच्या पुढे राहा

ओपन-सोर्स मॉडेल्स, स्थानिक एआय टूल्स आणि अनुमान हार्डवेअरवरील नवीनतम माहितीसाठी AI Buzz Wire फॉलो करा.

अधिक एआय बातम्या वाचा →