Google ने मंगलवार को जेमिनी 3.8 फ्लैश लॉन्च किया, इसका नवीनतम वर्कहॉर्स मॉडल कंपनी के सबसे अच्छे तर्क और कोडिंग सिस्टम के रूप में स्थित है, जो कि अपने पूर्ववर्ती के समान कीमत पर है, साथ ही रक्षात्मक साइबर सुरक्षा कार्य के लिए निर्मित जेमिनी 3.8 फ्लैश साइबर नामक एक विशेष संस्करण भी है। उत्पाद प्रबंधन के वरिष्ठ निदेशक तुलसी दोशी और Google डीपमाइंड में जेमिनी सुरक्षा प्रमुख रालुका एडा पोपा द्वारा Google के आधिकारिक ब्लॉग पर प्रकाशित घोषणा, केवल छह सप्ताह में Google की तीसरी फ़्लैश रिलीज़ को चिह्नित करती है।
लॉन्च असामान्य रूप से भीड़-भाड़ वाले रिलीज़ सीज़न के बीच में हुआ, और यह Google की मॉडल लाइन पर प्रतिद्वंद्वियों द्वारा डाले गए मूल्य-और-प्रदर्शन दबाव का सीधा जवाब है। फ्रंटियर लैब्स किस तरह कारोबार कर रही हैं, इसके व्यापक दृष्टिकोण के लिए, [ब्रेकिंग एआई न्यूज] (https://aibuzzwire.news) टीम हर प्रमुख मॉडल रिलीज को ट्रैक करती है।
दो वेरिएंट, एक फाउंडेशन
जेमिनी 3.8 एक ही मूलभूत बुद्धिमत्ता पर निर्मित दो संस्करणों में आता है। जेमिनी 3.8 फ्लैश सामान्य प्रयोजन का वर्कहॉर्स है: Google का कहना है कि यह सॉफ्टवेयर इंजीनियरिंग, एजेंटिक कार्यों और विशेष डोमेन में मल्टी-स्टेप रीजनिंग में 3.7 फ्लैश की तुलना में महत्वपूर्ण सुधार प्रदान करता है, $0.75 प्रति मिलियन इनपुट टोकन और $3.75 प्रति मिलियन आउटपुट टोकन के समान प्रारंभिक मूल्य पर।
जेमिनी 3.8 फ्लैश साइबर को Google के सबसे सक्षम साइबर सुरक्षा मॉडल के रूप में वर्णित किया गया है, जिसे कंपनी भेद्यता का पता लगाने और स्वचालित पैचिंग में फ्रंटियर-स्तरीय प्रदर्शन कहती है। मानक फ़्लैश मॉडल के विपरीत, यह व्यापक रूप से उपलब्ध नहीं है - Google इसे फेयरविंड नामक एक नए कार्यक्रम के माध्यम से विश्वसनीय रक्षकों के एक समूह में वितरित कर रहा है।
ब्लॉग पोस्ट के अनुसार, साझा कोर में कोडिंग और तर्क लाभ आंशिक रूप से साइबर सुरक्षा के मांग वाले क्षेत्र में कठोर प्रशिक्षण द्वारा संचालित थे, और दोनों मॉडलों को अंतर्निहित मॉडलों का पुनरावर्ती मूल्यांकन और परिष्कृत करने के लिए डिज़ाइन किए गए लंबे समय तक चलने वाले एजेंटिक लूप द्वारा त्वरित किया गया था।
बेंचमार्क: कड़ी मेहनत करना, न कि सिर्फ बड़ा होना
Google का बेंचमार्क दावा एक डिज़ाइन दर्शन पर केंद्रित है जिसे कंपनी स्पष्ट रूप से बताती है: 3.8 फ़्लैश "अधिक मेहनत करता है।" जटिल कार्यों पर, मॉडल अतिरिक्त तर्क चरणों को निष्पादित करता है और टूल को पुनरावृत्त रूप से कॉल करता है, कभी-कभी उच्च प्रयास स्तरों पर प्रदर्शन को अधिकतम करने के लिए अधिक टोकन का उपभोग करता है। डेवलपर्स टोकन ओवरहेड में कटौती करने के लिए प्रयास को कम कर सकते हैं, या जेमिनी 3.7 फ्लैश पर बने रह सकते हैं, जो दक्षता-प्रथम वर्कलोड के लिए पूरी तरह से समर्थित है।
Google द्वारा उद्धृत शीर्षक परिणाम:
- डीपएसडब्ल्यूई वी1.1 (लॉन्ग-हॉराइजन सॉफ्टवेयर इंजीनियरिंग): 3.8 फ्लैश जटिल इंजीनियरिंग समस्याओं को स्वायत्त रूप से हल करने में सबसे बड़े फ्रंटियर मॉडल से बेहतर प्रदर्शन करता है, जिसे Google लागत के एक अंश के रूप में वर्णित करता है।
- वैल्स फाइनेंस एजेंट V2 और हार्वे के लीगल एजेंट बेंचमार्क: 3.8 फ्लैश उन्नत विश्लेषण और रिपोर्टिंग की आवश्यकता वाले मात्रात्मक और पेशेवर क्षेत्रों में 3.7 फ्लैश और अन्य फ्रंटियर मॉडल से बेहतर प्रदर्शन करता है।
- एचएलई-सत्यापित: 3.8 फ्लैश 54.9% हासिल करता है, जिसे Google एसटीईएम, मानविकी और पेशेवर क्षेत्रों में बहु-चरणीय तर्क के प्रमाण के रूप में प्रस्तुत करता है।
फ़्लैश साइबर: अपराध पर बचाव
साइबर संस्करण अधिक असामान्य रिलीज़ है। Google का कहना है कि उसने जानबूझकर शोषण जैसी आक्रामक क्षमताओं पर भेद्यता निर्धारण को प्राथमिकता दी है। सीडब्ल्यूई-बेंच पर, कोलिनियर द्वारा संचालित एक बाहरी पैचिंग बेंचमार्क, जेमिनी 3.8 फ्लैश साइबर ने 47.2% का पास@1 स्कोर किया - Google के अनुसार, अग्रणी फ्रंटियर मॉडल 47.8% के ठीक पीछे, लेकिन काफी कम लागत पर, इसे बेंचमार्क के पैरेटो फ्रंटियर पर रखा गया।
कमजोरियों को खोजने के लिए एक मानक उद्योग बेंचमार्क, साइबरजिम पर, Google का कहना है कि साइबर मॉडल फ्रंटियर-स्तरीय स्वायत्त भेद्यता खोज को प्रदर्शित करता है, जो अपने पूर्ववर्ती 3.5 फ्लैश साइबर के साथ-साथ काफी बड़े फ्रंटियर मॉडल को भी पीछे छोड़ देता है। 20 प्रोग्रामिंग भाषाओं में जटिल कोडबेस वाले Google के आंतरिक बेंचमार्क पर, मॉडल 70% से अधिक की सफलता दर तक पहुंच गया।
पहले से ही Google का अपना कोड सुरक्षित कर रहा है
Google का कहना है कि साइबर मॉडल पहले से ही आंतरिक रूप से तैनात है, और इसके द्वारा प्रदान किए गए उदाहरण विशिष्ट हैं:
- क्रोम सुरक्षा टीम ने पाया कि 3.8 फ्लैश साइबर ने सर्वोत्तम व्यावसायिक मॉडलों की तुलना में क्रोम कमजोरियों के लिए 2.6 गुना अधिक सही पैच तैयार किए, जो बहुत बड़े हैं।
- सुरक्षा फर्म विज़ में, मॉडल ने अन्य प्रमुख सीमांत मॉडलों की तुलना में 2.3 से 5.2 गुना कम लागत पर आंतरिक प्रवेश-परीक्षण बेंचमार्क पर 7.5 से 9.7 प्रतिशत अंक अधिक रिकॉल हासिल किया।
- Google की क्लाउड भेद्यता अनुसंधान टीम ने दो घंटे से कम समय में एक महत्वपूर्ण मूलभूत भेद्यता का पता लगाने के लिए मॉडल का उपयोग किया - भेद्यता का एक वर्ग जिसके अनुसंधान और खोज में, Google नोट करता है, आमतौर पर महीनों लगते हैं।
डेवलपर्स और बाज़ार के लिए इसका क्या अर्थ है
डेवलपर्स के लिए, व्यावहारिक उपाय सीमा के निचले सिरे पर मूल्य स्थिरता है। 3.8 फ्लैश को 3.7 के प्रारंभिक मूल्य पर रखने से प्रतिस्पर्धी कोडिंग-और-एजेंट मॉडल की लागत $0.75/$3.75 प्रति मिलियन टोकन पर बनी रहती है, एक ऐसा खंड जहां ओपन-वेट चुनौती देने वाले और प्रतिद्वंद्वी प्रयोगशालाएं पूरे वर्ष पदधारियों को कम कर रही हैं। Google का संदेश यह है कि खरीदारों को अब वर्कहॉर्स स्तर में लागत और क्षमता के बीच चयन करने की आवश्यकता नहीं है।
फ्लैश साइबर के लिए फेयरविंड प्रोग्राम वितरण मॉडल समान रूप से बता रहा है। फ्रंट-टियर प्रयोगशालाएं तेजी से विशिष्ट साइबर सुरक्षा क्षमता को व्यापक रूप से भेजे जाने के बजाय गेट किए जाने वाली चीज़ के रूप में मान रही हैं - आक्रामक दुरुपयोग की संभावना को सीमित करते हुए जांचे गए रक्षकों को अत्याधुनिक रक्षात्मक उपकरण प्रदान करती हैं। मॉडल के प्रशिक्षण में शोषण क्षमताओं पर पैचिंग बेंचमार्क को प्राथमिकता देने का Google का निर्णय उसी तर्क का पालन करता है।
ताल भी उल्लेखनीय है. छह सप्ताह में तीन फ़्लैश रिलीज़ - तीन सप्ताह पहले 3.7 फ़्लैश, अब 3.8 - दिखाता है कि Google दो साल पहले के वार्षिक-शैली रिलीज़ चक्रों की तुलना में अपनी मध्य-स्तरीय लाइन को कहीं अधिक तेज़ी से दोहरा रहा है। OpenAI के GPT-6 रोलआउट के प्रतिस्पर्धी दबाव और चीन से तेजी से आगे बढ़ने वाले ओपन-वेट मॉडल की लहर ने हर किसी की समयसीमा को संकुचित कर दिया है, और Google स्पष्ट रूप से वर्कहॉर्स स्तर पर गति का चयन कर रहा है, जबकि इसके फ्रंटियर मॉडल अनुसंधान ध्वज ले जाते हैं।
क्या 3.8 फ्लैश का "कड़ी मेहनत करता है" दृष्टिकोण - मेहनती बहु-चरणीय तर्क पर अधिक टोकन खर्च करना - कच्चे मॉडल पैमाने की तुलना में व्यवहार में अधिक कुशल साबित होता है जो आने वाले महीनों में डेवलपर्स के बिलों में दिखाई देगा। Google के स्वयं के बेंचमार्क सुझाव देते हैं कि व्यापार परिश्रम का पक्ष ले सकता है; बाज़ार एक समय में एक एपीआई बिल पर अपना फैसला सुनाएगा।
एआई से आगे रहें
हर मॉडल लॉन्च, बेंचमार्क और कीमत में बदलाव को ट्रैक किया जाता है - [अधिक एआई समाचार पढ़ें →] (https://aibuzzwire.news)
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →