Google ने शांतपणे या आठवड्यात 48 तासांच्या आत दोन महत्त्वपूर्ण मिथुन मॉडेल अद्यतने पाठवली आणि दोन्ही उत्पादन अनुप्रयोग तयार करणाऱ्या विकासकांना उद्देशून आहेत. Google च्या अधिकृत ब्लॉगनुसार, Gemini 3.5 Transcribe, 26 ऑगस्ट रोजी सादर करण्यात आले, हे कंपनीचे आजपर्यंतचे सर्वात अचूक स्पीच-टू-टेक्स्ट मॉडेल आहे. जेमिनी ओम्नी 1.1 फ्लॅश, 27 ऑगस्ट रोजी जाहीर केले आहे, जनरेटिव्ह व्हिडिओवर प्रोफेशनल-ग्रेड नियंत्रणे आणते, ज्यात 40 सेकंदांपर्यंतचा सीन एक्स्टेंशन आणि 4K अपस्केलिंगचा समावेश आहे. दोन्ही मॉडेल्स Google AI स्टुडिओ आणि Gemini Enterprise Agent Platform मध्ये Gemini API द्वारे उपलब्ध आहेत.
मिथुन 3.5 लिप्यंतरण: स्पीच-टू-टेक्स्ट जो स्वतःच स्वच्छ होतो For more context on this story, see our ongoing AI industry coverage.
जेमिनी 3.5 ट्रान्स्क्राइबला पारंपारिक स्पीच रेकग्निशनपासून वेगळे करते, Google म्हणते की, ते कच्च्या प्रतिलिपीऐवजी थेट पॉलिश, फॉरमॅट केलेल्या मजकुरात कच्चा ऑडिओ रूपांतरित करते. मॉडेल पार्श्वभूमीचा आवाज, जटिल शब्दजाल आणि डिस्फ्लुएन्सी क्लीनअप हाताळते — ते "ums" आणि "ahs" सारखे फिलर शब्द काढून टाकते, "चला मंगळवार-नाही, बुधवारला भेटू" यासारख्या स्व-सुधारणा सोडवते आणि आउटपुट स्वयं-स्वरूपित करते.
Google ने उद्धृत केलेले बेंचमार्क क्रमांक लक्षणीय आहेत. कृत्रिम विश्लेषणाद्वारे मोजल्याप्रमाणे, मॉडेल स्ट्रीमिंग वापर प्रकरणांसाठी 4.0 टक्के आणि नॉन-स्ट्रीमिंग ऑडिओसाठी 2.6 टक्के सरासरी शब्द त्रुटी दर (WER) प्राप्त करते. शीर्ष भाषांमधील FLEURS बहुभाषिक बेंचमार्कवर, ते स्ट्रीमिंग मोडमध्ये 5.50 टक्के WER पोस्ट करते आणि 5.04 टक्के नॉन-स्ट्रीमिंग, Google च्या मागील ट्रान्सक्रिप्शन मॉडेल, Chirp 3 मध्ये सुधारणा करते. Chirp 3 च्या तुलनेत अंतिम ट्रान्सक्रिप्शनचा वेळ 70 टक्क्यांनी सुधारतो, पुन्हा कृत्रिम विश्लेषणाद्वारे मोजले जाते.
दोन वर्कफ्लोसाठी मॉडेल दोन प्रकारांमध्ये पाठवले जाते. लाइव्ह ॲप्लिकेशन्ससाठी, `जेमिनी-३.५-ट्रान्सक्राइब-लाइव्ह` लाइव्ह एपीआयद्वारे सब-सेकंड लेटन्सीसह सतत द्विदिशात्मक प्रवाह वितरीत करते, व्हॉईस एजंट्स आणि रिअल-टाइम कॅप्शनिंग. रेकॉर्ड केलेल्या ऑडिओसाठी — मीटिंग्ज, कॉल लॉग, संग्रहण — `जेमिनी-३.५-ट्रान्सक्राइब` तीन स्पीकर्ससाठी स्पीकर विशेषता (प्रायोगिक मोडमध्ये अधिक समर्थनासह) आणि इंटरॅक्शन API द्वारे शब्द-स्तरीय टाइमस्टँप ऑफर करते.
इतर क्षमतांमध्ये उच्चारण आणि बोली हाताळणीसह 85 हून अधिक भाषांमध्ये स्वयंचलित शोध आणि प्रतिलेखन आणि सानुकूल शब्दसंग्रह समर्थन समाविष्ट आहे जेणेकरून मॉडेल विशेष शब्दजाल आणि अद्वितीय शब्दलेखनांशी जुळवून घेते. Google ने मॉडेलला एक प्रकारचे डोळे देखील दिले: फंक्शन कॉलिंगद्वारे, ते इतर जेमिनी मॉडेल्सना प्रतिमा निर्मिती किंवा फाइल विश्लेषण यासारखी कार्ये सोपवू शकते - हे वैशिष्ट्य सध्या जेमिनी ॲपमध्ये macOS वर उपलब्ध आहे.
Gemini Omni 1.1 Flash: व्हिडिओ जनरेशन एक टाइमलाइन वाढवते
दुसरे लाँच AI व्हिडिओ: नियंत्रण बद्दलची सर्वात सामान्य तक्रार संबोधित करते. जेमिनी ओम्नी 1.1 फ्लॅश हे उत्पादन-केंद्रित अद्यतन आहे जे जनरेटिव्ह व्हिडिओ ज्या प्रकारे त्याचे पूर्ववर्ती नव्हते त्या प्रकारे चालविण्यायोग्य बनवते, Google DeepMind उत्पादन व्यवस्थापक अनिश नांगिया आणि अलिसा फोर्टिन यांनी रिलीजचे वर्णन Omni 1.1 "व्यावसायिक वापरासाठी उत्पादन-तयार" असे केले आहे.
दृश्य विस्तार हे शीर्षक वैशिष्ट्य आहे. डेव्हलपर आता विद्यमान क्लिपमधून अखंडपणे फुटेज निर्माण करणे सुरू ठेवू शकतात, मॉडेलने 10 सेकंदांपर्यंतच्या आधीच्या संदर्भाचे विश्लेषण केले आहे - मागील मॉडेलमधील एक झेप ज्याने केवळ अंतिम सेकंदाचा संदर्भ दिला. व्हिडिओ 10-सेकंदाच्या वाढीमध्ये 40 सेकंदांच्या संचित लांबीपर्यंत वाढवले जाऊ शकतात, व्हिज्युअल सुसंगतता आणि दीर्घ कथांसाठी वर्णनात्मक पालन सुधारते.
अपडेट फर्स्ट-आणि-लास्ट-फ्रेम इंटरपोलेशन देखील जोडते, ज्यामुळे विकसकांना सुरळीत, जाणूनबुजून कॅमेरा हालचाली आणि शॉट्स दरम्यान संक्रमणे तयार करण्यासाठी स्टार्ट आणि एंड फ्रेम निर्दिष्ट करू देते. वितरणासाठी, पूर्ण झालेले प्रकल्प 4K रिझोल्यूशनपर्यंत वाढवले जाऊ शकतात, तर 360p पूर्वावलोकन मोड निर्मात्यांना अंतिम रेंडर करण्यासाठी वचनबद्ध होण्यापूर्वी त्वरित आणि स्वस्तपणे प्रॉम्प्टवर पुनरावृत्ती करू देतो.
API पासून दररोजच्या पृष्ठभागापर्यंत
Google देखील दोन्ही मॉडेल्सना त्याच्या ग्राहक उत्पादनांमध्ये वायरिंग करत आहे, जिथे त्याचा वितरण फायदा दिसून येतो. Android वर, Gboard मधील नवीन "Rambler" वैशिष्ट्य फिलर शब्द फिल्टर करताना बोललेले विचार चांगल्या स्वरूपित मजकुरात बदलण्यासाठी 3.5 ट्रान्स्क्राइब वापरते — वापरकर्ते आवाजाद्वारे संपादने देखील करू शकतात. हे मॉडेल मॅकओएसवरील जेमिनी ॲपमध्ये श्रुतलेखन देखील देते, Google अँटिग्रॅव्हिटीमध्ये स्क्रीन संदर्भासोबत काम करते आणि क्रोममध्ये समाकलित केले जात आहे.
डेव्हलपरसाठी, दोन लाँच एक धोरण म्हणून वाचले जातात: Google आपण बोलत असलेल्या चॅटबॉटमधून मिथुनला मीडिया पाहतो, ऐकतो आणि तयार करतो अशा पायाभूत सुविधांमध्ये ढकलत आहे. OpenAI, ElevenLabs, आणि व्हिडिओ स्टार्टअप्सचा एक समूह याच प्रदेशात स्पर्धा करत आहे, 2.6 टक्के शब्द त्रुटी दर आणि 40-सेकंद सुसंगत दृश्ये ही Google ची सुरुवातीची बोली आहे जी उत्पादन वर्कलोड्स जे प्रत्यक्षात कमाई करतात — व्हॉइस एजंट्स, कॅप्शनिंग पाइपलाइन आणि क्रिएटिव्ह टूल्स. डेव्हलपर आज Google AI स्टुडिओमध्ये दोन्ही मॉडेलसह बिल्डिंग सुरू करू शकतात.
शब्द त्रुटी दर अद्याप महत्त्वाचा का आहे
शब्द त्रुटी दर शैक्षणिक आकडेवारीसारखा वाटतो, परंतु उत्पादनामध्ये ते कार्य करणारे आवाज उत्पादन आणि निराश करणारे एक फरक आहे. व्हॉइस एजंटमधील प्रत्येक गैरसमज झालेल्या उच्चारामुळे कार्य खंडित होते: चुकीचा ऑर्डर आयडी अयशस्वी लुकअप ट्रिगर करतो, चुकीचा पत्ता चुकीच्या शहरात पॅकेज पाठवतो. म्हणूनच नॉन-स्ट्रीमिंग ऑडिओवरील 2.6 टक्के WER आणि उच्च-एकल-अंकी दरांमधील अंतर जे मॉडेलच्या एका पिढीच्या आधी सामान्य होते ते वापरण्यातील क्रम-परिमाणात फरक करते.
Google ने नोंदवलेल्या दोन पद्धतींमधील फरक आर्किटेक्टसाठी देखील महत्त्वाचा आहे. स्ट्रीमिंग ट्रान्सक्रिप्शन — 4.0 टक्के WER आकृती — सब-सेकंद लेटेंसीसाठी काही अचूकतेचा व्यापार करते, जी थेट व्हॉईस एजंट्स सारख्या संवादात्मक वापराच्या प्रकरणांमध्ये आवश्यक असते. रेकॉर्ड केलेल्या ऑडिओचे बॅच ट्रान्सक्रिप्शन धीमे चालते परंतु 2.6 टक्क्यांपर्यंत पोहोचते, म्हणूनच कॉल-पोस्ट ॲनालिटिक्स आणि आर्काइव्ह प्रोसेसिंग अधिक मागणीसाठी परवडते. एका समायोज्य सेटिंगऐवजी दोन्ही स्वतंत्र मॉडेल एंडपॉईंट म्हणून उघड करण्याचा Googleचा निर्णय हे मान्य करतो की डेव्हलपर त्या ट्रेडऑफच्या दोन्ही बाजूला भिन्न उत्पादने तयार करतात.
व्हिडिओ निर्मितीसाठी एक टायर्ड वर्कफ्लो
Omni 1.1 Flash अपडेट हे सर्जनशील कार्य प्रत्यक्षात कसे घडते याबद्दल तितकेच व्यावहारिक आहे. जनरेटिव्ह व्हिडिओ यासह पुनरावृत्ती करणे महाग आहे: प्रत्येक प्रॉम्प्ट प्रयोग म्हणजे संपूर्ण प्रस्तुतीकरण. नवीन 360p पूर्वावलोकन मोड डिलिव्हरीपासून एक्सप्लोरेशन वेगळे करतो, निर्मात्यांना प्रॉम्प्ट व्हेरिएशनमधून स्वस्तात सायकल चालवू देतो आणि पुनरावलोकन टिकून राहिलेल्या शॉट्सवर केवळ 4K अपस्केलिंगसाठी पैसे देतो.
सीन एक्स्टेंशन मेकॅनिक्स सुसंगत समस्येचे निराकरण करतात ज्याने क्लिप-आकाराच्या घेट्टोमध्ये AI व्हिडिओ ठेवला आहे. केवळ अंतिम फ्रेमच्या ऐवजी 10 सेकंदांच्या आधीच्या संदर्भाचे विश्लेषण करून, मॉडेल वर्ण, प्रकाश आणि दृश्य शैली सुसंगत ठेवताना 10-सेकंदांच्या वाढीमध्ये 40 सेकंदांपर्यंत दृश्य वाढवू शकते. फर्स्ट-आणि-लास्ट-फ्रेम इंटरपोलेशनसह एकत्रित — जे संपादकांना निर्धारवादी नियंत्रण बिंदू देते, मार्कर ज्या पद्धतीने पारंपारिक संपादनामध्ये काम करतात — AI-व्युत्पन्न केलेले फुटेज घाऊक बदलण्याऐवजी वास्तविक पोस्ट-प्रॉडक्शन पाइपलाइनमध्ये बसू लागतात.
स्पर्धात्मक चित्र
दोन्ही लॉन्च Google ला गंतव्यस्थान ऐवजी पायाभूत सुविधा म्हणून स्थान देतात. स्पीचमध्ये, Google त्याच्या डेव्हलपर आधीपासूनच वापरत असलेल्या Gemini API मध्ये अत्याधुनिक अचूकता एकत्रित करून त्याच्या क्लाउड प्रतिस्पर्ध्यांचे स्पेशलाइज्ड ट्रान्सक्रिप्शन विक्रेते आणि व्हॉइस स्टॅक घेत आहे. व्हिडिओमध्ये, कच्च्या तमाशावर नियंत्रण आणि वर्कफ्लो एकत्रीकरणावर भर देऊन चांगल्या अर्थसहाय्यित स्टार्टअप्सच्या गर्दीच्या बाजारपेठेत स्पर्धा करत आहे.
वितरणाचा फायदा हा निर्णायक घटक असू शकतो. डेव्हलपर जेमिनी API वरून कॉल करू शकतात तेच ट्रान्स्क्रिप्शन मॉडेल आधीपासून Android वर Gboard च्या Rambler dictation, macOS वरील Gemini ॲप, Google Antigravity आणि Chrome ला सामर्थ्य देते — म्हणजे Google अब्जावधी वापरकर्त्यांच्या परस्परसंवादांमध्ये मॉडेल डेव्हलपमेंटमध्ये सुधारणा करू शकते जे त्यात सुधारणा करत राहते. 2026 मध्ये भाषण किंवा व्हिडिओ स्टॅक निवडणाऱ्या विकसकांसाठी, ते फ्लायव्हील आता खेळपट्टीचा भाग आहे.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →