Google ने जेमिनी 3.8 लाइव और जेमिनी 3.8 लाइव एक्सटेंडेड थिंकिंग लॉन्च किया है, जो लाइव डायलॉग मॉडल की एक जोड़ी है जिसे कंपनी प्राकृतिक आवाज वार्तालाप के लिए अब तक का सबसे उन्नत बताती है। ये मॉडल 15 सितंबर को जेमिनी एपीआई, गूगल एआई स्टूडियो, सर्च लाइव, जेमिनी लाइव और गूगल वर्कस्पेस पर शुरू हुए, जिसमें जेमिनी एंटरप्राइज के माध्यम से निजी पूर्वावलोकन में एंटरप्राइज़ एक्सेस शामिल था।

यह घोषणा जेमिनी ऑडियो टीम की ओर से लिखने वाले प्रमुख इंजीनियर टॉम ओयांग और तकनीकी स्टाफ की सदस्य मालिनी जगनाथन की ओर से की गई। यह जेमिनी 3.8 परिवार का विस्तार करता है जो इस महीने की शुरुआत में फ्लैश और फ्लैश साइबर मॉडल के साथ शुरू हुआ था, और यह वास्तविक समय, मल्टीमॉडल वॉयस सहायता में Google के अब तक के सबसे आक्रामक धक्का को चिह्नित करता है - एक ऐसा बाजार जहां ओपनएआई का वॉयस मोड और स्पीच स्टार्टअप की एक लहर समान दैनिक उपयोग के मामले के लिए प्रतिस्पर्धा कर रही है।

यह लॉन्च Google की मॉडल लाइन के लिए उल्लेखनीय रूप से भीड़-भाड़ वाले क्षेत्र में फिट बैठता है; [नवीनतम एआई विकास] (https://aibuzzwire.news) के कवरेज से पता चलता है कि कंपनी ने अब कुछ हफ्तों के अंतराल में बार-बार शिपमेंट किया है क्योंकि यह मूल्य निर्धारण, कोडिंग और अब आवाज पर प्रतिद्वंद्वियों से लड़ती है।

वास्तविक समय की बातचीत के लिए निर्मित

लाइव मॉडल को माइक्रोफ़ोन संलग्न मानक चैट मॉडल से जो अलग करता है वह विलंबता और स्थिति है। Google का लाइव एपीआई दस्तावेज़ एक कम-विलंबता इंटरफ़ेस का वर्णन करता है जो एक स्टेटफुल वेबसॉकेट कनेक्शन पर ऑडियो, छवियों और टेक्स्ट की निरंतर धाराओं को संसाधित करता है, कच्चे 16kHz पीसीएम ऑडियो, जेपीईजी छवियों को प्रति सेकंड एक फ्रेम तक स्वीकार करता है, और टेक्स्ट, और वास्तविक समय में बोले गए ऑडियो को लौटाता है।

मॉडल दृश्य इनपुट को वास्तविक समय में संसाधित करते हैं, जिससे सहायक को यह देखने में मदद मिलती है कि उपयोगकर्ता क्या देखता है - Google के प्रदर्शन वीडियो में जेमिनी 3.8 लाइव एक कर्मचारी को दृश्य संदर्भ का उपयोग करके ऑनबोर्डिंग सत्र का मार्गदर्शन करते हुए, वास्तविक समय में शतरंज खेलते हुए, और प्राकृतिक भाषण के माध्यम से संपूर्ण व्यावसायिक योजनाओं और कस्टम मार्केटिंग टूलकिट का निर्माण करते हुए दिखाया गया है। मॉडल उपयोगकर्ता द्वारा सेटिंग बदलने के बिना, बातचीत के बीच में 97 समर्थित भाषाओं के बीच स्वचालित रूप से पता लगा सकते हैं और उनमें बदलाव कर सकते हैं।

शायद व्यावहारिक उपयोग के लिए सबसे महत्वपूर्ण: जब बातचीत जारी रहती है तो मॉडल पृष्ठभूमि में टूल और एपीआई कॉल निष्पादित करते हैं, अनुरोधों को स्वीकार करते हैं और कार्य समाप्त होने तक संवाद जारी रखते हैं। यह सहायक को सख्ती से बारी-आधारित प्रतिवादी से बात करने वाले एजेंट के करीब में बदल देता है।

Google जिन नंबरों का प्रचार कर रहा है

Google की रिपोर्ट है कि जेमिनी 3.8 लाइव एक्सटेंडेड थिंकिंग ने 82.6 के स्कोर के साथ आर्टिफिशियल एनालिसिस के स्पीच-टू-स्पीच क्वालिटी इंडेक्स पर शीर्ष समग्र स्थान हासिल किया। एजेंटिक कार्य पूरा होने पर, कंपनी τ-वॉयस बेंचमार्क पर 68.6% और सिएरा के τ-वॉयस-बैंकिंग मूल्यांकन पर 35.1%, साथ ही बिग बेंच ऑडियो पर 97.7% स्कोर का हवाला देती है।

ये Google के स्वयं रिपोर्ट किए गए आंकड़े हैं, और स्वतंत्र सत्यापन में समय लगेगा - लेकिन कृत्रिम विश्लेषण चार्ट के शीर्ष पर दावा, अगर यह कायम रहता है, तो Google को समग्र वार्तालाप गुणवत्ता पर OpenAI और समर्पित वॉयस AI कंपनियों से भाषण-अनुकूलित पेशकशों से आगे रखा जाएगा। Google यह भी कहता है कि विस्तारित सोच एक अत्यधिक प्रतिस्पर्धी मूल्य बिंदु को बनाए रखती है, जो मूल्य दबाव के लिए एक अंतर्निहित संकेत है जिसने 3.8 पीढ़ी को परिभाषित किया है।

मॉडलों द्वारा उत्पन्न सभी ऑडियो SynthID, Google के अगोचर वॉटरमार्क के साथ वॉटरमार्क किए गए हैं, इसलिए AI-जनित भाषण का पता लगाया जा सकता है - एक अनुपालन और गलत सूचना सुरक्षा जो Google के जेनरेटर उत्पादों में मानक बन रही है।

आप इसका उपयोग कहां कर सकते हैं

उपलब्धता दोनों मॉडलों के बीच भिन्न है। जेमिनी 3.8 लाइव, Google के वास्तविक समय दृश्य खोज मोड, सर्च लाइव के अंदर सभी के लिए उपलब्ध है। एक्सटेंडेड थिंकिंग जेमिनी लाइव में, वर्कस्पेस के माध्यम से Google AI प्रो और अल्ट्रा सब्सक्राइबर्स के लिए डॉक्स में और सभी Google उपयोगकर्ताओं के लिए Gmail और Keep में उपलब्ध है।

डेवलपर्स को जेमिनी एपीआई और गूगल एआई स्टूडियो के माध्यम से मॉडल मिलते हैं, और गूगल का कहना है कि लाइव एपीआई का उपयोग पहले से ही गूगल के वास्तविक समय के बुनियादी ढांचे के शीर्ष पर आवाज-संचालित इंटरफेस बनाने के लिए एगोरा, फिशजैम, लाइवकिट, पिपेकैट, वर्सेल और विजन एजेंटों सहित प्लेटफार्मों द्वारा किया जाता है। सेल्सफोर्स, जेनस्पार्क और लुमेरिस को नए मॉडलों के लिए लॉन्च पार्टनर के रूप में नामित किया गया है।

एक भीड़भाड़ वाला वॉयस एआई बाज़ार

वॉयस 2026 का इंटरफ़ेस युद्धक्षेत्र बन रहा है क्योंकि यही वह जगह है जहां एआई अंततः कीबोर्ड से बच जाता है। एक मॉडल जो बात करते समय देख, सुन, भाषा बदल सकता है और टूल चला सकता है, वह अन्य चैटबॉट्स के साथ नहीं बल्कि फोन कॉल, ग्राहक सहायता लाइन और व्यक्तिगत सहायक के साथ प्रतिस्पर्धा कर रहा है।

Google का लाभ वितरण है: सर्च, एंड्रॉइड, वर्कस्पेस और क्रोम लाइव मॉडल को एक स्थापित आधार देते हैं जिसका कोई प्रतिद्वंद्वी मुकाबला नहीं कर सकता। कंपनी शर्त लगा रही है कि उपयोगकर्ता के दिन के हर कोने में मौजूद रहना - अब अपने सर्वश्रेष्ठ वॉयस मॉडल के साथ - किसी भी एकल बेंचमार्क जीत से अधिक मायने रखेगा। प्रतिद्वंद्वियों को जवाब देने का मौका मिलेगा, लेकिन Google ने स्पष्ट कर दिया है कि वॉयस, जो एक बार डेमो सुविधा थी, अब प्रथम श्रेणी की उत्पाद श्रृंखला है।

डेवलपर्स के लिए, संदेश समान रूप से सीधा है। सटीक इनपुट प्रारूप प्रकाशित करके, पृष्ठभूमि टूल निष्पादन का दस्तावेजीकरण करके और लाइव एपीआई प्लेटफार्मों के साथ पारिस्थितिकी तंत्र को जोड़कर, Google ग्राहक सहायता बॉट से लेकर पहनने योग्य सहायकों तक - स्पोकन इंटरफेस बनाने वाले किसी भी व्यक्ति के लिए अपने स्टैक को डिफ़ॉल्ट सब्सट्रेट बनाने की कोशिश कर रहा है। स्वतंत्र परीक्षण के तहत जेमिनी 3.8 लाइव के गुणवत्ता दावे सही हैं या नहीं, उपलब्धता का खेल पहले से ही चालू है।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →