Google ने जेमिनी 3.5 ट्रांसक्राइब लॉन्च किया है, जो वास्तविक समय ट्रांसक्रिप्शन के लिए बनाया गया एक नया स्पीच-टू-टेक्स्ट मॉडल है जो 85 से अधिक भाषाओं को स्वचालित रूप से पहचानता है - और रास्ते में आउटपुट को पॉलिश करता है, फिलर शब्दों को अलग करता है और बिना पूछे मौखिक गड़बड़ी को ठीक करता है।
यह लॉन्च Google के स्पीच स्टैक को तेजी से बढ़ते ट्रांसक्रिप्शन बाजार में एक प्रत्यक्ष चुनौतीकर्ता के रूप में रखता है, जहां सटीकता और विलंबता तेजी से तय करती है कि डेवलपर्स कॉल, मीटिंग, कैप्शन और वॉयस इंटरफेस के लिए कौन सी सेवाएं अपनाते हैं। For more context on this story, see our ongoing AI industry coverage.
मॉडल क्या कर सकता है
Google की घोषणा के अनुसार, जिसका कवरेज द डिकोडर द्वारा प्रकाशित किया गया था, जेमिनी 3.5 ट्रांसक्राइब बोले गए शब्दों को पाठ में परिवर्तित करने से कहीं आगे जाता है:
- 85 से अधिक भाषाओं में स्वचालित भाषा पहचान, बिना किसी कॉन्फ़िगरेशन की आवश्यकता के
- भराव शब्द हटाना, "उम," "उह," और इसी तरह की विसंगतियों को साफ करना
- जुबान की फिसलन को सुधारना, शब्दशः शोर के बजाय पठनीय गद्य का निर्माण करना
- विराम चिह्न और संरचना सहित स्वायत्त पाठ स्वरूपण
कंपनी अपने पूर्ववर्ती चिरप 3 की तुलना में स्ट्रीमिंग ऑडियो के लिए 4.0 प्रतिशत और रिकॉर्ड किए गए ऑडियो के लिए 2.6 प्रतिशत की शब्द त्रुटि दर के साथ-साथ विलंबता में लगभग 70 प्रतिशत की कमी की रिपोर्ट करती है - लाइव कैप्शनिंग परिदृश्यों में पर्याप्त मार्जिन जहां देरी से बातचीत बाधित होती है।
दो नौकरियों के लिए दो इंटरफ़ेस
डेवलपर्स को दो अलग-अलग एप्लिकेशन प्रोग्रामिंग इंटरफेस के माध्यम से पहुंच मिलती है:
लाइव एपीआई - `जेमिनी-3.5-ट्रांसक्राइब-लाइव`
बहुत कम विलंबता के साथ वास्तविक समय की स्ट्रीमिंग को संभालता है, लाइव कैप्शन, वॉयस एजेंटों और इंटरैक्टिव सहायकों को लक्षित करता है जहां प्रतिक्रिया समय सबसे अधिक मायने रखता है।इंटरैक्शन एपीआई - `जेमिनी-3.5-ट्रांसक्राइब`
रिकॉर्ड किए गए ऑडियो को संसाधित करता है और स्पीकर एट्रिब्यूशन और टाइमस्टैम्प के साथ ट्रांसक्रिप्ट लौटाता है - मीटिंग, साक्षात्कार, पॉडकास्ट और मीडिया पोस्ट-प्रोडक्शन के लिए विशिष्ट वर्कफ़्लो।प्रतिलेखन से परे, मॉडल फ़ंक्शन कॉलिंग का समर्थन करता है, जिसका अर्थ है कि यह जेमिनी परिवार में अन्य मॉडलों को अनुवर्ती कार्य सौंप सकता है - उदाहरण के लिए एक सत्र के दौरान कही गई किसी बात के आधार पर छवि निर्माण अनुरोध या वेब खोज को ट्रिगर करना। यह एक ट्रांसक्रिप्ट इंजन को आवाज-संचालित अनुप्रयोगों के लिए एक नियंत्रणीय इंटरफ़ेस परत में बदल देता है।
Google उत्पादों पर पहले से ही शिपिंग
यह मॉडल आज डेवलपर्स के लिए Google AI स्टूडियो और जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म पर लाइव है। Google ने इसे उपभोक्ता सतहों पर भी जोड़ा है: Android पर Gboard इसे श्रुतलेख के लिए Rambler नामक एक आंतरिक घटक के माध्यम से उपयोग करता है, macOS पर जेमिनी ऐप इसे ध्वनि इनपुट पर लागू करता है, और Chrome एकीकरण का अनुसरण करने की उम्मीद है।
वह वितरण मायने रखता है. वाक् पहचान अपने पैमाने पर बनाए रखती है, और मॉडल को कीबोर्ड, डेस्कटॉप ऐप और ब्राउज़र में एम्बेड करने से यह प्रतिदिन अरबों इनपुट इंटरैक्शन के सामने आता है - जबकि उच्चारण, बोलियों और शोर वाले वातावरण में त्रुटि दर को कम रखने के लिए आवश्यक मूल्यांकन लूप को फीड किया जाता है।
भाषण एआई में प्रतिस्पर्धी दांव
प्रतिलेखन चुपचाप सीमांत प्रयोगशालाओं और विशेषज्ञ विक्रेताओं के बीच एक प्रतिस्पर्धी युद्ध का मैदान बन गया है। सटीक, कम-विलंबता भाषण समझ एजेंटिक उत्पादों के लिए प्रवेश टिकट है जो बोले गए आदेशों, एंटरप्राइज़ मीटिंग इंटेलिजेंस, एक्सेसिबिलिटी सुविधाओं और बहुभाषी ग्राहक सेवा स्वचालन पर कार्य करती है।
स्व-सुधार आउटपुट के साथ आक्रामक विलंबता सुधारों को जोड़कर, Google यह शर्त लगा रहा है कि डेवलपर्स उन प्रतिलेखों को पसंद करते हैं जो कच्चे ध्वन्यात्मक कैप्चर के बजाय संपादित पाठ की तरह पढ़ते हैं - प्रयोज्य के लिए सख्त शब्दशः निष्ठा का व्यापार करते हैं। टीमों को सटीक रिकॉर्ड की आवश्यकता होती है, जैसे कि कानूनी या मेडिकल प्रतिलेखक, अभी भी शब्दशः मोड चाहते हैं; बाकी सभी के लिए, किसी को सुनने और उन्हें समझने के बीच व्यावहारिक अंतर कम होता जा रहा है।
जेमिनी 3.5 ट्रांसक्राइब अब आम तौर पर एआई स्टूडियो और एंटरप्राइज टूलिंग में उपलब्ध है, पहला सार्थक परीक्षण वॉयस-एजेंट डेवलपर्स से अपनाए जाने वाले मेट्रिक्स होगा - एक बाजार खंड इतनी तेजी से बढ़ रहा है कि वृद्धिशील सटीकता लाभ भी बड़े पैमाने पर स्विचिंग निर्णयों में तब्दील हो जाता है।
विलंबता वास्तविक युद्ध का मैदान क्यों है
त्रुटि दरें सुर्खियां बनती हैं, लेकिन विलंबता चुपचाप यह निर्धारित करती है कि कौन से उत्पाद व्यवहार्य हैं। लाइव कैप्शन ओवरले को फीड करने वाले एक ट्रांसक्रिप्शन इंजन को बातचीत के साथ तालमेल बनाए रखने की जरूरत होती है, अन्यथा दर्शक अलग हो जाते हैं। ग्राहक सहायता कॉल पर बातचीत करने वाला एक वॉयस एजेंट अजीब तरह से रुक नहीं सकता है, जबकि उसकी भाषण परत पकड़ में आ जाती है। Google ने बताया कि Chirp 3 की तुलना में देरी में 70 प्रतिशत की कमी आई है, जो सटीक रूप से उस अंतर को लक्षित करता है - एक वाक्य को पूरा करने वाले वक्ता और उस पर कार्य करने वाले डाउनस्ट्रीम सिस्टम के बीच की दूरी को कम करता है।
एजेंटिक अनुप्रयोगों के लिए यह यौगिक: बोले गए संवाद के प्रत्येक मोड़ में मान्यता, तर्क और प्रतिक्रिया शामिल होती है। मान्यता चरण से मिलीसेकेंड शेविंग करने से बिल्डरों को बातचीत के समय के बजट का उल्लंघन किए बिना अधिक सक्षम - और धीमी गति से तर्क करने वाले मॉडल पर खर्च करने का मौका मिलता है।
शब्दशः व्यापार-बंद
एक डिज़ाइन विकल्प जांच का पात्र है। डिफ़ॉल्ट रूप से, जेमिनी 3.5 ट्रांसक्राइब आउटपुट क्यूरेट करता है: फिलर शब्द गायब हो जाते हैं, गड़बड़ी ठीक हो जाती है, और फ़ॉर्मेटिंग स्वचालित रूप से लागू हो जाती है। अधिकांश व्यावसायिक उपयोगों के लिए - मिनट, कैप्शन, खोजने योग्य संग्रह - यह वही है जो उपयोगकर्ता चाहते हैं।
लेकिन कुछ वर्कफ़्लो शब्दशः रिकॉर्ड पर निर्भर करते हैं। कानूनी बयान, अनुपालन समीक्षा और पत्रकारीय तथ्य-जाँच के लिए कभी-कभी यह जानने की आवश्यकता होती है कि क्या कहा गया था, जिसमें झिझक भी शामिल है। विनियमित उद्योगों में संगठन नए मॉडल पर संवेदनशील पाइपलाइनों को स्थानांतरित करने से पहले इस बात पर स्पष्टता चाहेंगे कि कितनी स्मूथिंग वैकल्पिक और कॉन्फ़िगर करने योग्य है। Google के दस्तावेज़ीकरण और एपीआई पैरामीटर प्रभावी रूप से यह निर्धारित करेंगे कि उद्योग के लिए शब्दशः-बनाम-पॉलिश लाइन कहां बैठती है।
खाई के रूप में एक बहुभाषी पदचिह्न
स्वचालित पहचान के साथ 85 से अधिक भाषाओं का कवरेज केवल एक फीचर चेकलिस्ट आइटम नहीं है। बहुभाषी पहुंच उन बाजारों में मूल्य को केंद्रित करती है जहां प्रतिस्पर्धी ऐतिहासिक रूप से पिछड़ गए हैं: क्षेत्रीय लहजे, मध्य-वाक्य की भाषाओं के बीच कोड-स्विचिंग, और कम-संसाधन वाली भाषाएं अंग्रेजी-भारी कॉर्पोरा पर संकीर्ण रूप से प्रशिक्षित मॉडल को दंडित करती हैं।
दर्जनों देशों में समर्थन केंद्र चलाने वाले वैश्विक उद्यमों के लिए, भाषा का पता लगाने वाला एक एकल मॉडल पारदर्शी रूप से एकीकरण जटिलता को कम करता है - कई प्रति-बाज़ार कॉन्फ़िगरेशन के बजाय एक पाइपलाइन। जीबोर्ड के अरबों एंड्रॉइड इंस्टॉलेशन के माध्यम से वितरण के साथ, Google ट्रांसक्राइब-गुणवत्ता बहुभाषावाद को प्रीमियम क्षमता के बजाय बुनियादी ढांचे के रूप में स्थापित कर रहा है।
क्या देखना है
तीन संकेत बताएंगे कि जेमिनी 3.5 ट्रांस्क्राइब बाजार हिस्सेदारी बदलता है या केवल उम्मीदें बढ़ाता है: आने वाले महीनों में तीसरे पक्ष के बेंचमार्क में डेवलपर प्रवासन; प्रतिद्वंद्वी सटीकता के दावों के बजाय कितनी जल्दी विलंबता संख्याओं से मेल खाते हैं; और क्या फ़ंक्शन-कॉलिंग हुक मिथुन राशि पर मूल रूप से निर्मित वॉयस-फर्स्ट एजेंटों की एक लहर पैदा करते हैं। लॉन्च अभी लाइव है, और एआई स्टूडियो के माध्यम से मूल्य निर्धारण स्तरों को प्रयोग को इतना सस्ता बनाना चाहिए कि स्विचिंग लागत लगभग शून्य हो जाए।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →