Google ने Gemini 3.8 Live आणि Gemini 3.8 Live Extended Thinking लाँच केले आहे, लाइव्ह डायलॉग मॉडेल्सची एक जोडी, ज्याचे वर्णन कंपनीने नैसर्गिक आवाज संभाषणासाठी सर्वात प्रगत असे केले आहे. जेमिनी एपीआय, Google AI स्टुडिओ, सर्च लाइव्ह, जेमिनी लाइव्ह आणि गुगल वर्कस्पेसवर 15 सप्टेंबर रोजी जेमिनी एंटरप्राइझद्वारे खाजगी पूर्वावलोकनामध्ये एंटरप्राइझ ऍक्सेससह मॉडेल्स आणण्यास सुरुवात झाली.
टॉम औयांग, मुख्य अभियंता आणि जेमिनी ऑडिओ टीमच्या वतीने लेखन करणाऱ्या तांत्रिक कर्मचाऱ्यांच्या सदस्य मालिनी जगनाथन यांच्याकडून ही घोषणा आली. हे फ्लॅश आणि फ्लॅश सायबर मॉडेल्ससह या महिन्याच्या सुरुवातीला डेब्यू केलेल्या जेमिनी 3.8 कुटुंबाचा विस्तार करते, आणि हे Google च्या रीअल-टाइम, मल्टीमॉडल व्हॉईस सहाय्यामध्ये अद्याप सर्वात आक्रमक पुश चिन्हांकित करते — एक बाजार जिथे OpenAI चा व्हॉइस मोड आणि स्पीच स्टार्टअपची लाट समान दैनंदिन-वापर केससाठी स्पर्धा करत आहेत.
लाँच Google च्या मॉडेल लाइनसाठी एक उल्लेखनीय गर्दीच्या भागामध्ये बसते; नवीनतम AI घडामोडींचे कव्हरेज दाखवते की कंपनी आता काही आठवड्यांच्या कालावधीत वारंवार पाठवली आहे कारण ती किंमत, कोडिंग आणि आता व्हॉइसवर प्रतिस्पर्ध्यांशी लढत आहे.
रिअल-टाइम संभाषणासाठी तयार केलेले
लाइव्ह मॉडेल्सना मायक्रोफोन जोडलेल्या मानक चॅट मॉडेलपासून वेगळे करते ते म्हणजे विलंब आणि स्थिती. Google चे लाइव्ह API दस्तऐवजीकरण कमी-विलंब इंटरफेसचे वर्णन करते जे ऑडिओ, प्रतिमा आणि मजकूराच्या सतत प्रवाहावर स्टेटफुल वेबसॉकेट कनेक्शनवर प्रक्रिया करते, रॉ 16kHz PCM ऑडिओ स्वीकारते, प्रति सेकंद एक फ्रेम पर्यंत JPEG प्रतिमा आणि मजकूर, आणि रिअल टाइममध्ये स्पोकन ऑडिओ परत करते.
मॉडेल जवळच्या रिअल टाइममध्ये व्हिज्युअल इनपुटवर प्रक्रिया करतात, सहाय्यकाला वापरकर्ता काय पाहतो ते पाहू देतो — Google चे प्रात्यक्षिक व्हिडिओ जेमिनी 3.8 लाइव्ह दाखवतात जे व्हिज्युअल संदर्भ वापरून कर्मचाऱ्याला ऑनबोर्डिंग सत्राचे मार्गदर्शन करतात, रिअल टाइममध्ये बुद्धिबळ खेळतात आणि नैसर्गिक भाषणाद्वारे संपूर्ण व्यवसाय योजना आणि कस्टम मार्केटिंग टूलकिट तयार करतात. मॉडेल 97 समर्थित भाषांमध्ये स्वयंचलितपणे, संभाषणाच्या मध्यभागी, वापरकर्ता स्विचिंग सेटिंग्जशिवाय शोधू शकतात आणि संक्रमण देखील करू शकतात.
व्यावहारिक वापरासाठी कदाचित सर्वात महत्त्वपूर्ण: संभाषण सुरू असताना मॉडेल्स बॅकग्राउंडमध्ये टूल्स आणि API कॉल्स कार्यान्वित करतात, विनंत्या मान्य करतात आणि कार्ये पूर्ण होत असताना संवाद चालू ठेवतात. हे काटेकोरपणे वळणावर आधारित प्रतिसादकर्त्यापासून सहाय्यकाला बोलण्यासाठी घडणाऱ्या एजंटच्या जवळ वळवते.
द नंबर्स गुगल टाउटिंग करत आहे
Google ने अहवाल दिला आहे की जेमिनी 3.8 लाइव्ह एक्स्टेंडेड थिंकिंगने कृत्रिम विश्लेषणाच्या स्पीच-टू-स्पीच क्वालिटी इंडेक्समध्ये 82.6 गुणांसह अव्वल स्थान मिळवले आहे. एजंटिक कार्य पूर्ण झाल्यावर, कंपनीने बिग बेंच ऑडिओवर 97.7% स्कोअरसह τ-व्हॉइस बेंचमार्कवर 68.6% आणि सिएराच्या τ-व्हॉइस-बँकिंग मूल्यांकनावर 35.1% उद्धृत केले.
हे Google चे स्वतःचे अहवाल दिलेले आकडे आहेत आणि स्वतंत्र पडताळणीला वेळ लागेल — परंतु कृत्रिम विश्लेषणाच्या चार्टच्या शीर्षस्थानी दावा, जर तो धरला तर, संपूर्ण संभाषण गुणवत्तेवर ओपनएआय आणि समर्पित व्हॉइस एआय कंपन्यांच्या स्पीच-ऑप्टिमाइझ ऑफरमध्ये Google ला पुढे ठेवेल. Google असेही म्हणते की एक्सटेंडेड थिंकिंग अत्यंत स्पर्धात्मक किंमत बिंदू राखते, 3.8 जनरेशन परिभाषित केलेल्या किंमतीच्या दबावाला एक गर्भित होकार देते.
मॉडेल्सद्वारे व्युत्पन्न केलेले सर्व ऑडिओ SynthID, Google च्या अगोचर वॉटरमार्कसह वॉटरमार्क केलेले आहेत, त्यामुळे AI-व्युत्पन्न केलेले भाषण शोधण्यायोग्य राहते - एक अनुपालन आणि चुकीची माहिती सुरक्षितता जी Google च्या जनरेटिव्ह उत्पादनांमध्ये मानक बनत आहे.
तुम्ही ते कुठे वापरू शकता
दोन मॉडेल्समध्ये उपलब्धता भिन्न आहे. मिथुन 3.8 लाइव्ह Google च्या रिअल-टाइम व्हिज्युअल शोध मोड, सर्च लाइव्हमध्ये प्रत्येकासाठी उपलब्ध आहे. विस्तारित विचारसरणी Gemini Live मध्ये, Google AI Pro आणि Ultra सदस्यांसाठी Docs मध्ये Workspace द्वारे आणि Gmail आणि Keep मध्ये सर्व Google वापरकर्त्यांसाठी उपलब्ध आहे.
विकसकांना जेमिनी API आणि Google AI स्टुडिओ द्वारे मॉडेल्स मिळतात आणि Google म्हणते की लाइव्ह API आधीच Google च्या रिअल-टाइम इन्फ्रास्ट्रक्चरच्या शीर्षस्थानी व्हॉइस-चालित इंटरफेस तयार करण्यासाठी Agora, Fishjam, LiveKit, Pipecat, Vercel आणि Vision एजंट्ससह प्लॅटफॉर्मद्वारे वापरले जाते. नवीन मॉडेल्ससाठी सेल्सफोर्स, जेन्सपार्क आणि लुमेरिस लाँच भागीदार म्हणून नाव देण्यात आले आहे.
गर्दीचा आवाज एआय मार्केट
व्हॉईस हे 2026 चे इंटरफेस रणांगण बनत आहे कारण तेथूनच AI शेवटी कीबोर्डपासून सुटतो. एक मॉडेल जे बोलत असताना पाहू शकते, ऐकू शकते, भाषा बदलू शकते आणि साधने चालवू शकते ते इतर चॅटबॉट्सशी नाही तर फोन कॉल, ग्राहक समर्थन लाइन आणि वैयक्तिक सहाय्यकाशी स्पर्धा करत आहे.
Google चा फायदा म्हणजे वितरण: Search, Android, Workspace आणि Chrome लाइव्ह मॉडेल्सना कोणताही प्रतिस्पर्धी जुळू शकत नाही असा स्थापित आधार देतात. कंपनी सट्टेबाजी करत आहे की वापरकर्त्याच्या दिवसाच्या प्रत्येक कोपऱ्यात उपस्थित राहणे — आता त्याच्या सर्वोत्कृष्ट व्हॉइस मॉडेल्ससह — कोणत्याही एका बेंचमार्कच्या विजयापेक्षा जास्त महत्त्वाचे आहे. प्रतिस्पर्ध्यांना प्रतिसाद देण्याची संधी मिळेल, परंतु Google ने स्पष्ट केले आहे की आवाज, एकेकाळी डेमो वैशिष्ट्य, आता प्रथम श्रेणी उत्पादन लाइन आहे.
विकसकांसाठी, संदेश असाच थेट आहे. अचूक इनपुट फॉरमॅट प्रकाशित करून, बॅकग्राउंड टूल एक्झिक्यूशनचे दस्तऐवजीकरण करून आणि लाइव्ह API प्लॅटफॉर्मसह इकोसिस्टम सीडिंग करून, Google ग्राहक समर्थन बॉट्सपासून वेअरेबल असिस्टंटपर्यंत - स्पोकन इंटरफेस बनवणाऱ्या प्रत्येकासाठी त्याचा स्टॅक डीफॉल्ट सब्सट्रेट बनवण्याचा प्रयत्न करत आहे. जेमिनी 3.8 लाइव्हचे गुणवत्तेचे दावे स्वतंत्र चाचणी अंतर्गत टिकून राहतात की नाही, उपलब्धता प्ले आधीच चालू आहे.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →