Google ने इस सप्ताह 48 घंटों के भीतर चुपचाप दो महत्वपूर्ण जेमिनी मॉडल अपडेट भेज दिए, और दोनों का उद्देश्य सीधे तौर पर उत्पादन एप्लिकेशन बनाने वाले डेवलपर्स पर है। Google के आधिकारिक ब्लॉग के अनुसार, 26 अगस्त को पेश किया गया जेमिनी 3.5 ट्रांसक्राइब, कंपनी का अब तक का सबसे सटीक स्पीच-टू-टेक्स्ट मॉडल है। 27 अगस्त को घोषित जेमिनी ओमनी 1.1 फ्लैश, जेनरेटिव वीडियो में पेशेवर-ग्रेड नियंत्रण लाता है, जिसमें 40 सेकंड तक दृश्य विस्तार और 4K अपस्केलिंग शामिल है। दोनों मॉडल Google AI स्टूडियो और जेमिनी एंटरप्राइज एजेंट प्लेटफ़ॉर्म में जेमिनी एपीआई के माध्यम से उपलब्ध हैं।
मिथुन 3.5 प्रतिलेख: भाषण-से-पाठ जो स्वयं को साफ़ करता है For more context on this story, see our ongoing latest AI developments.
Google का कहना है कि जेमिनी 3.5 ट्रांसक्राइब को पारंपरिक वाक् पहचान से जो अलग करता है, वह यह है कि यह कच्चे ऑडियो को कच्चे ट्रांसक्रिप्ट के बजाय सीधे पॉलिश, स्वरूपित पाठ में परिवर्तित करता है। मॉडल पृष्ठभूमि शोर, जटिल शब्दजाल और असंतोष सफाई को मूल रूप से संभालता है - यह "उम्स" और "आह" जैसे पूरक शब्दों को हटा देता है, "चलो मंगलवार को मिलते हैं - नहीं, बुधवार" जैसे स्व-सुधार को हल करता है और आउटपुट को स्वचालित रूप से प्रारूपित करता है।
Google द्वारा उद्धृत बेंचमार्क संख्याएँ उल्लेखनीय हैं। जैसा कि कृत्रिम विश्लेषण द्वारा मापा गया है, मॉडल स्ट्रीमिंग उपयोग के मामलों के लिए 4.0 प्रतिशत की औसत शब्द त्रुटि दर (डब्ल्यूईआर) और गैर-स्ट्रीमिंग ऑडियो के लिए 2.6 प्रतिशत प्राप्त करता है। शीर्ष भाषाओं में FLEURS बहुभाषी बेंचमार्क पर, यह स्ट्रीमिंग मोड में 5.50 प्रतिशत WER और 5.04 प्रतिशत गैर-स्ट्रीमिंग पोस्ट करता है, जो Google के पिछले ट्रांसक्रिप्शन मॉडल, Chirp 3 में सुधार करता है। अंतिम ट्रांसक्रिप्शन के समय में Chirp 3 की तुलना में 70 प्रतिशत सुधार होता है, जैसा कि फिर से कृत्रिम विश्लेषण द्वारा मापा गया है।
मॉडल दो वर्कफ़्लो के लिए दो वेरिएंट में उपलब्ध है। लाइव अनुप्रयोगों के लिए, `जेमिनी-3.5-ट्रांसक्राइब-लाइव` लाइव एपीआई के माध्यम से उप-सेकंड विलंबता के साथ निरंतर द्विदिश स्ट्रीमिंग प्रदान करता है, वॉयस एजेंटों और वास्तविक समय कैप्शनिंग को लक्षित करता है। रिकॉर्ड किए गए ऑडियो के लिए - मीटिंग, कॉल लॉग, अभिलेखागार - `जेमिनी-3.5-ट्रांसक्राइब` तीन स्पीकर तक स्पीकर एट्रिब्यूशन (प्रयोगात्मक मोड में अधिक के लिए समर्थन के साथ) और इंटरेक्शन एपीआई के माध्यम से वर्ड-स्तरीय टाइमस्टैम्प प्रदान करता है।
अन्य क्षमताओं में उच्चारण और बोली प्रबंधन के साथ 85 से अधिक भाषाओं में स्वचालित पहचान और प्रतिलेखन, और कस्टम शब्दावली समर्थन शामिल है ताकि मॉडल विशेष शब्दजाल और अद्वितीय वर्तनी के अनुकूल हो सके। Google ने मॉडल को एक प्रकार की आंखें भी दीं: फ़ंक्शन कॉलिंग के माध्यम से, यह छवि निर्माण या फ़ाइल विश्लेषण जैसे कार्यों को अन्य जेमिनी मॉडल को सौंप सकता है - एक सुविधा जो वर्तमान में macOS पर जेमिनी ऐप में उपलब्ध है।
जेमिनी ओमनी 1.1 फ्लैश: वीडियो जेनरेशन एक टाइमलाइन बढ़ाता है
दूसरा लॉन्च एआई वीडियो के बारे में सबसे आम शिकायत को संबोधित करता है: नियंत्रण। जेमिनी ओमनी 1.1 फ्लैश एक उत्पादन-केंद्रित अद्यतन है जो जेनरेटिव वीडियो को उन तरीकों से चलाने योग्य बनाता है जो उसके पूर्ववर्ती नहीं थे, Google डीपमाइंड उत्पाद प्रबंधक अनीश नांगिया और अलीसा फोर्टिन ने रिलीज को ओमनी 1.1 को "व्यावसायिक उपयोग के लिए उत्पादन-तैयार" बनाने के रूप में वर्णित किया है।
दृश्य विस्तार मुख्य विशेषता है. डेवलपर्स अब मौजूदा क्लिप से निर्बाध रूप से फुटेज तैयार करना जारी रख सकते हैं, मॉडल पिछले संदर्भ के 10 सेकंड तक का विश्लेषण करता है - पिछले मॉडल से एक छलांग जो केवल अंतिम सेकंड को संदर्भित करता है। वीडियो को 10-सेकंड की वृद्धि में 40 सेकंड की संचयी लंबाई तक बढ़ाया जा सकता है, जिससे लंबी कहानियों के लिए दृश्य स्थिरता और कथा पालन में सुधार होता है।
अपडेट में प्रथम-और-अंतिम-फ़्रेम इंटरपोलेशन भी जोड़ा गया है, जिससे डेवलपर्स को शॉट्स के बीच सुचारू, जानबूझकर कैमरा मूवमेंट और ट्रांज़िशन बनाने के लिए स्टार्ट और एंड फ़्रेम निर्दिष्ट करने की सुविधा मिलती है। डिलीवरी के लिए, तैयार परियोजनाओं को 4K रिज़ॉल्यूशन तक बढ़ाया जा सकता है, जबकि 360p पूर्वावलोकन मोड रचनाकारों को अंतिम रेंडर करने से पहले जल्दी और सस्ते में संकेतों पर पुनरावृत्ति करने देता है।
एपीआई से लेकर रोजमर्रा की सतहों तक
Google दोनों मॉडलों को अपने उपभोक्ता उत्पादों में भी शामिल कर रहा है, जो कि इसके वितरण लाभ को दर्शाता है। एंड्रॉइड पर, Gboard में नया "रैम्बलर" फीचर फिलर शब्दों को फ़िल्टर करते समय बोले गए विचारों को अच्छी तरह से प्रारूपित पाठ में बदलने के लिए 3.5 ट्रांसक्राइब का उपयोग करता है - उपयोगकर्ता आवाज द्वारा संपादन भी कर सकते हैं। यह मॉडल macOS पर जेमिनी ऐप में डिक्टेशन को भी पावर देता है, Google एंटीग्रेविटी में स्क्रीन संदर्भ के साथ काम करता है और इसे क्रोम में एकीकृत किया जा रहा है।
डेवलपर्स के लिए, दो लॉन्च एक रणनीति के रूप में पढ़े जाते हैं: Google जेमिनी को उस चैटबॉट से धकेल रहा है जिससे आप बात करते हैं जो मीडिया को देखता, सुनता और तैयार करता है। OpenAI, ElevenLabs और एक ही क्षेत्र में प्रतिस्पर्धा करने वाले वीडियो स्टार्टअप के एक समूह के साथ, 2.6 प्रतिशत शब्द त्रुटि दर और 40-सेकंड के सुसंगत दृश्य उत्पादन कार्यभार के लिए Google की शुरुआती बोली हैं जो वास्तव में राजस्व उत्पन्न करते हैं - वॉयस एजेंट, कैप्शनिंग पाइपलाइन और रचनात्मक उपकरण। डेवलपर्स आज Google AI स्टूडियो में दोनों मॉडलों के साथ निर्माण शुरू कर सकते हैं।
शब्द त्रुटि दर अभी भी क्यों मायने रखती है
शब्द त्रुटि दर एक अकादमिक आँकड़े की तरह लगती है, लेकिन उत्पादन में यह एक ध्वनि उत्पाद के बीच का अंतर है जो काम करता है और जो निराश करता है। वॉइस एजेंट में प्रत्येक गलत समझा गया उच्चारण एक कार्य को बाधित करता है: एक गलत सुनाई गई ऑर्डर आईडी एक असफल लुकअप को ट्रिगर करती है, एक विकृत पता गलत शहर में एक पैकेज भेजता है। यही कारण है कि गैर-स्ट्रीमिंग ऑडियो पर 2.6 प्रतिशत WER और उच्च-एकल-अंकीय दरों के बीच का अंतर, जो कि एक पीढ़ी पहले मॉडलों की आम बात थी, प्रयोज्य में परिमाण के क्रम में अंतर को जोड़ता है।
Google द्वारा बताए गए दो मोड के बीच का अंतर आर्किटेक्ट्स के लिए भी मायने रखता है। स्ट्रीमिंग ट्रांसक्रिप्शन - 4.0 प्रतिशत WER का आंकड़ा - उप-सेकंड विलंबता के लिए कुछ सटीकता का व्यापार करता है, जिसके लिए लाइव वॉयस एजेंटों जैसे इंटरैक्टिव उपयोग के मामलों की आवश्यकता होती है। रिकॉर्ड किए गए ऑडियो का बैच ट्रांसक्रिप्शन धीमा चलता है लेकिन 2.6 प्रतिशत तक पहुंच जाता है, यही कारण है कि पोस्ट-कॉल एनालिटिक्स और आर्काइव प्रोसेसिंग अधिक मांग वाली हो सकती है। एक समायोज्य सेटिंग के बजाय दोनों को अलग-अलग मॉडल एंडपॉइंट के रूप में प्रदर्शित करने का Google का निर्णय यह स्वीकार करता है कि डेवलपर्स उस ट्रेडऑफ़ के दोनों ओर अलग-अलग उत्पाद बनाते हैं।
वीडियो उत्पादन के लिए एक स्तरीय वर्कफ़्लो
ओमनी 1.1 फ्लैश अपडेट इस बारे में समान रूप से व्यावहारिक है कि रचनात्मक कार्य वास्तव में कैसे होता है। जेनरेटिव वीडियो को दोहराना महंगा रहा है: प्रत्येक त्वरित प्रयोग का मतलब पूर्ण रेंडर होता है। नया 360p पूर्वावलोकन मोड अन्वेषण को डिलीवरी से अलग करता है, जिससे रचनाकारों को त्वरित विविधताओं के माध्यम से सस्ते में चक्र करने की सुविधा मिलती है और समीक्षा से बचने वाले शॉट्स पर केवल 4K अपस्केलिंग के लिए भुगतान करना पड़ता है।
दृश्य विस्तार यांत्रिकी सुसंगतता की समस्या का समाधान करती है जिसने एआई वीडियो को क्लिप-आकार के यहूदी बस्ती में रखा है। केवल अंतिम फ्रेम के बजाय 10 सेकंड के पूर्व संदर्भ का विश्लेषण करके, मॉडल पात्रों, प्रकाश व्यवस्था और दृश्य शैली को सुसंगत रखते हुए एक दृश्य को 10-सेकंड की वृद्धि में 40 सेकंड तक बढ़ा सकता है। प्रथम-और-अंतिम-फ़्रेम इंटरपोलेशन के साथ संयुक्त - जो संपादकों को नियतात्मक नियंत्रण बिंदु देता है, जिस तरह से पारंपरिक संपादन में अंदर और बाहर मार्कर काम करते हैं - एआई-जनित फुटेज उन्हें थोक में बदलने के बजाय वास्तविक पोस्ट-प्रोडक्शन पाइपलाइनों में फिट होना शुरू कर देता है।
प्रतिस्पर्धी तस्वीर
दोनों लॉन्च Google को गंतव्य के बजाय बुनियादी ढांचे के रूप में स्थान देते हैं। भाषण में, Google अपने डेवलपर्स द्वारा पहले से उपयोग किए जाने वाले जेमिनी एपीआई में अत्याधुनिक सटीकता को बंडल करके विशेष ट्रांसक्रिप्शन विक्रेताओं और अपने क्लाउड प्रतिद्वंद्वियों के वॉयस स्टैक को ले रहा है। वीडियो में, यह कच्चे तमाशे पर नियंत्रण और वर्कफ़्लो एकीकरण पर जोर देकर अच्छी तरह से वित्त पोषित स्टार्टअप्स से भरे बाजार में प्रतिस्पर्धा कर रहा है।
वितरण लाभ निर्णायक कारक हो सकता है। वही ट्रांसक्रिप्शन मॉडल जिसे डेवलपर्स जेमिनी एपीआई से कॉल कर सकते हैं, पहले से ही एंड्रॉइड पर जीबोर्ड के रैम्बलर डिक्टेशन, मैकओएस, गूगल एंटीग्रेविटी और क्रोम पर जेमिनी ऐप को पावर देता है - जिसका अर्थ है कि Google विविध वास्तविक दुनिया के ऑडियो को इकट्ठा करते हुए अरबों उपयोगकर्ता इंटरैक्शन में मॉडल विकास को संशोधित कर सकता है जो इसे बेहतर बनाता रहता है। 2026 में भाषण या वीडियो स्टैक चुनने वाले डेवलपर्स के लिए, वह फ्लाईव्हील अब पिच का हिस्सा है।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →