Google ने जेमिनी 3.8 लाइव के लिए एक नई क्षमता, लाइव अवतार पेश किया है जो कंपनी के वार्तालाप एआई को लगभग वास्तविक समय का वीडियो चेहरा देता है। WERSM द्वारा विस्तार से वर्णित अपनी आधिकारिक घोषणा में, Google इस सुविधा को एक एंटरप्राइज़ एजेंट के रूप में प्रस्तुत करता है जो एक गतिशील दृश्य व्यक्तित्व को बनाए रखते हुए सुन, देख और बोल सकता है - जो कंपनी की व्यावसायिक AI पेशकश जेमिनी एंटरप्राइज के माध्यम से उपलब्ध है।

रोलआउट लगभग एक सप्ताह से कवरेज जुटा रहा है: उद्योग आउटलेट्स ने पिछले सप्ताह के अंत में जेमिनी 3.8 लाइव में दृश्य-उपस्थिति सुविधा की रिपोर्ट करना शुरू कर दिया था, और डेक्कन हेराल्ड ने सोमवार को खबर को आगे बढ़ाया, यह देखते हुए कि यह सुविधा "एआई चैटबॉट पर एक चेहरा डालती है"। [एआई उपकरण और सहायक] (https://aibuzzwire.news) का मूल्यांकन करने वाले व्यवसायों के लिए, घोषणा संकेत देती है कि एंटरप्राइज़ वार्तालाप एआई किस ओर जा रहा है: कम चैट विंडो, अधिक हमेशा चालू सेवा प्रतिनिधि।

लाइव अवतार वास्तव में क्या करता है

लाइव अवतार जेमिनी की लाइव संवाद क्षमताओं के साथ वास्तविक समय की वीडियो पीढ़ी को जोड़ता है। Google सटीक लिप-सिंकिंग, प्राकृतिक अभिव्यक्ति और तरल टर्न-टेकिंग पर प्रकाश डालता है - ऐसी यांत्रिकी जो बात करने वाले को अलौकिक के बजाय वर्तमान का एहसास कराती है।

लेकिन अधिक परिणामी विवरण चेहरे के पीछे छिपे रहते हैं। घोषणा के अनुसार:

  • एक साथ मल्टीमॉडल इनपुट। एजेंट दृश्य और ऑडियो इनपुट को अलग-अलग मोड़ के रूप में संभालने के बजाय एक ही समय में संसाधित कर सकता है।
  • एसिंक्रोनस टूल कॉल। बातचीत जारी रहने के दौरान लाइव अवतार पृष्ठभूमि में जानकारी प्राप्त कर सकता है। Google का उदाहरण एक होटल चेक-इन है, जहां एजेंट अतिथि को लोडिंग स्थिति में देखे बिना एक जटिल कार्य संभालता है।
  • 97-भाषा कवरेज। Google का कहना है कि अवतार लिप-सिंक और अभिव्यक्तियों को दृश्यमान बहाव के बिना अनुकूलित करते हुए 97 भाषाओं के बीच घूम सकता है - वही ब्रांडेड एजेंट अपनी बोली जाने वाली डिलीवरी को बदलते हुए बाजारों में लगातार पहचान रखता है।

वह अंतिम बिंदु फीचर का व्यावसायिक रूप से सबसे महत्वपूर्ण हो सकता है। एक पारंपरिक चैटबॉट उपयोगकर्ता को उत्तर के लिए प्रतीक्षा करवाता है; लाइव अवतार को सिस्टम के नीचे काम करते समय बातचीत को चालू रखने के लिए डिज़ाइन किया गया है। चेहरा निरंतरता बनाता है, लेकिन अंतर्निहित व्यवहार एक सेवा वर्कफ़्लो के करीब है जो संवादात्मक बना रहता है।

चैटबॉट से ब्रांडेड उपस्थिति तक

Google की फ़्रेमिंग ब्रांडों को टॉगल सक्षम करने के अलावा और भी बहुत कुछ करने के लिए कहती है। लाइव अवतार तैनात करने वाली कंपनियों को एक चरित्र डिजाइन करने के लिए आमंत्रित किया जा रहा है - एक दृश्य पहचान, बोलने का एक तरीका, एक ऐसा व्यक्तित्व जिसे उनके ग्राहक टचप्वाइंट और भाषाओं में पहचान सकें।

यह एंटरप्राइज़ एआई को उपयोगकर्ताओं द्वारा सहन की जाने वाली उपयोगिता से उस उपस्थिति में स्थानांतरित कर देता है जिससे उपयोगकर्ता संबंधित हैं, और यह डिज़ाइन निर्णय लेता है - एजेंट कैसा दिखता है, यह कैसे प्रतिक्रिया करता है, जब यह मुस्कुराता है - नीचे दिए गए मॉडल की गुणवत्ता के समान स्तर पर। यह निरंतरता पर भी दांव लगाता है: एक अवतार जो विभिन्न भाषाओं में खुद का खंडन करता है, या विभिन्न चैनलों पर अलग-अलग व्यवहार करता है, उस विश्वास को कमजोर करता है जिसे चेहरे पर बनाना चाहिए।

उद्यम पहले, अभी के लिए

कई रिपोर्टों के अनुसार, प्रारंभिक उपलब्धता जेमिनी एंटरप्राइज तक सीमित है, और Google ने उपभोक्ता रोलआउट के लिए किसी समयसीमा की घोषणा नहीं की है। यह लाइव अवतार को Google की AI सुविधाओं के लिए एक परिचित पैटर्न में रखता है: व्यावसायिक उत्पाद पहले शिप होते हैं, जहां तैनाती नियंत्रित होती है और मुद्रीकरण प्रत्यक्ष होता है, क्षमताएं सार्वजनिक सहायक तक पहुंचने से पहले।

उद्यम-प्रथम दृष्टिकोण यह भी दर्शाता है कि सुविधा क्या मांग करती है। लाइव संवाद के शीर्ष पर स्तरित वास्तविक समय वीडियो पीढ़ी कम्प्यूटेशनल रूप से महंगी है, और एंटरप्राइज़ वर्कलोड - ग्राहक सेवा डेस्क, बुकिंग प्रवाह, व्यक्तिगत कियोस्क - परिभाषित स्कोप के साथ आते हैं जहां लागत को प्रतिस्थापित या संवर्धित कर्मचारियों के समय के मुकाबले उचित ठहराया जा सकता है।

विश्वास का समीकरण

एक चेहरा बदल देता है कि उपयोगकर्ता क्या नोटिस करते हैं और क्या माफ कर देते हैं। सटीक लिप-सिंकिंग, प्राकृतिक अभिव्यक्ति और तरल टर्न-टेकिंग पर Google का जोर कॉस्मेटिक नहीं है: ये बिल्कुल वे जोड़ हैं जहां एक कृत्रिम व्यक्तित्व टूटता है, और उपयोगकर्ता किसी रुके हुए वाक्य की तुलना में विलंबित प्रतिक्रिया या गलत समय पर की गई अभिव्यक्ति को पहचानने में कहीं अधिक तेज होते हैं।

यह व्यवसायों के लिए दोनों तरह से कटौती करता है। एक अच्छी तरह से क्रियान्वित अवतार एक स्वचालित सेवा में उपस्थिति का एहसास करा सकता है; एक खराब ढंग से निष्पादित स्वचालन उसी स्वचालन को भ्रामक बना सकता है - एक ऐसा चेहरा जो ध्यान आकर्षित करता है जो अंतर्निहित प्रणाली के पास नहीं है। Google जिस एसिंक्रोनस टूल कॉल का वर्णन करता है, वह उस अर्थ में, एक विश्वास तंत्र भी है: जब सिस्टम काम करता है तो अवतार बातचीत को स्पष्ट रूप से जीवित रखता है, न कि यह दिखावा करता है कि उत्तर पहले से ही तैयार है।

लाइव अवतार को तैनात करने वाले उद्यमों को प्रभावी ढंग से कोरियोग्राफी के आधार पर आंका जाएगा - व्यक्तित्व कैसे रुकावटों, सुधारों और रुकावटों को संभालता है। घोषणा से पता चलता है कि Google ने उन क्षणों को चमकाने के बजाय मुख्य इंजीनियरिंग समस्याओं के रूप में माना है, जो कि किसी भी ग्राहक-सामना वाली तैनाती की मांग होगी।

यह क्यों मायने रखता है

वॉयस असिस्टेंट ने एआई को संवादात्मक बनाया; अवतार इसे प्रस्तुतिकरणात्मक बनाते हैं। यदि लाइव अवतार वर्णित के अनुसार प्रदर्शन करता है - समकालिक दृष्टि और ध्वनि, पृष्ठभूमि उपकरण का उपयोग, बहुभाषी लिप-सिंक - एंटरप्राइज़ एआई के लिए इंटरफ़ेस एक टेक्स्ट बॉक्स बनना बंद कर देता है और एक कंपनी द्वारा नियंत्रित चरित्र बनना शुरू हो जाता है।

खुला प्रश्न गोद लेने का है: क्या व्यवसाय वास्तव में चाहते हैं कि उनके एआई का एक चेहरा हो, या क्या यह सुविधा डेमो-फ्लोर शोपीस बनी रहे। Google पूर्व पर दांव लगा रहा है। 97 भाषाओं और बैकग्राउंड टूल के उपयोग के साथ, कंपनी ने वैश्विक ब्रांडों के लिए पता लगाना आसान बना दिया है।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →