Meta ने सोमवारी एक नवीन ऑडिओ AI मॉडेलचे अनावरण केले जे एकापेक्षा जास्त स्पीकर्समध्ये फरक करू शकते आणि रिअल टाइममध्ये एकाधिक भाषांचे लिप्यंतरण करू शकते, Engadget नुसार, कंपनीला स्पीच AI साठी वाढत्या गर्दीच्या बाजारपेठेमध्ये खोलवर ढकलत आहे. माहितीने प्रथम ऑडिओ मॉडेलच्या घोषणेचा अहवाल दिला, तर एक सहयोगी उत्पादन — म्यूज व्हॉइस ट्रान्स्क्राइब, मॅकवर रिअल-टाइम व्हॉईस डिक्टेशन आणत — 9to5Mac द्वारे तपशीलवार.
मेटा त्याच्या AI स्टॅकसाठी व्हॉईसला प्रथम श्रेणी इनपुट म्हणून हाताळत आहे, असे ट्विन रिलीझ सिग्नल करते, नंतरचा विचार नाही. रिअल-टाइम ट्रान्सक्रिप्शन जे ओव्हरलॅपिंग स्पीकर हाताळू शकते, संभाषणाच्या मध्यभागी भाषा बदलू शकते आणि सिस्टम-व्यापी श्रुतलेखन या क्षमता आहेत जे नवीन वैशिष्ट्यातून आवाज दैनंदिन वापराच्या इंटरफेसमध्ये बदलतात. For more context on this story, see our ongoing AI news.
एक मॉडेल, अनेक आवाज, अनेक भाषा
हेडलाइन क्षमता, एन्गॅजेटने नोंदवल्याप्रमाणे, रिअल टाइममध्ये एकाधिक स्पीकर आणि एकाधिक भाषांमध्ये फरक करण्याची मॉडेलची क्षमता आहे. हे संयोजन व्यावहारिक लिप्यंतरणातील दोन कठीण समस्यांना एकाच वेळी संबोधित करते: स्पीकर डायराइझेशन — कोण काय म्हणाले हे शोधणे — आणि बहुभाषिक ओळख, जिथे संभाषण विराम न देता भाषांमध्ये फिरते.
बऱ्याच विद्यमान ट्रान्सक्रिप्शन पाइपलाइन याला स्वतंत्र टप्पे मानतात: प्रथम डायरायझेशन मॉडेल स्पीकर विभाजित करते, नंतर एक ओळख मॉडेल प्रत्येक विभागाचे लिप्यंतरण करते. त्यांना एकाच रीअल-टाइम मॉडेलमध्ये जोडणे हे तंत्रज्ञान थेट वापराच्या प्रकरणांसाठी व्यवहार्य बनवते — मीटिंग्ज, मुलाखती, ग्राहक कॉल्स, थेट भाषांतर आच्छादन — जिथे पोस्ट-प्रोसेसिंगची वाट पाहणे हा उद्देश नष्ट करते.
म्युझ व्हॉइस ट्रान्स्क्राइब प्रत्येक Mac ॲपवर श्रुतलेख आणते
मॉडेलच्या बरोबरीने, मेटाने मॅकओएससाठी म्यूज व्हॉइस ट्रान्स्क्राइब लाँच केले. 9to5Mac ने अहवाल दिल्याप्रमाणे, टूल रीअल-टाइम व्हॉइस डिक्टेशन प्रदान करते जे संपूर्ण मॅक ऍप्लिकेशन्सवर कार्य करते - एक स्वतंत्र ॲप ऐवजी प्रभावीपणे सिस्टम-व्यापी डिक्टेशन लेयर. गॅझेट रिव्ह्यूच्या कव्हरेजने प्रत्येक मॅक ॲपवर रिअल-टाइम डिक्टेशन आणत असल्याचे वर्णन केले आहे.
ते डिझाइन दत्तक घेण्यासाठी महत्त्वाचे आहे. श्रुतलेखन साधने घर्षणावर जगतात किंवा मरतात: वापरकर्त्यांना वेगळ्या विंडोमधून मजकूर कॉपी करायचा असल्यास, ते ते वापरणे थांबवतात. सिस्टीम स्तरावर काम करणे म्हणजे कर्सर ब्लिंक होईल तिथे कुठेही व्हॉइस इनपुट उपलब्ध होतो — ईमेल, कोड एडिटर, मेसेजिंग ॲप्स, दस्तऐवज — जे सर्वात यशस्वी श्रुतलेखन साधनांनी त्यांचे प्रेक्षक जिंकले आहेत.
मॅक रिलीझ देखील मेटा साठी उल्लेखनीय क्षेत्र चिन्हांकित करते. कंपनीचे AI प्रयत्न त्याच्या मोबाईल ॲप्स, त्याचा Meta AI सहाय्यक आणि त्याचे Llama-family आणि Muse-family मॉडेल्सवर केंद्रित आहेत. Apple च्या प्लॅटफॉर्मसाठी पॉलिश डेस्कटॉप उत्पादकता साधन पाठवण्यामुळे मेटाला एका व्यावसायिक वापरकर्त्याच्या बेसशी थेट संपर्क साधला जातो ज्यापर्यंत पोहोचण्यासाठी तो ऐतिहासिकदृष्ट्या संघर्ष करत आहे — आणि प्लॅटफॉर्मवर स्थापित श्रुतलेखन आणि ट्रान्सक्रिप्शन युटिलिटीजशी स्पर्धा करते.
एक गजबजलेले मैदान जे जलद होत राहते
मेटा अशा बाजारपेठेत प्रवेश करत आहे ज्याची गेल्या दोन वर्षांमध्ये पुनर्मूल्यांकन आणि पुनर्रचना केली गेली आहे. ओपनएआयच्या व्हिस्पर ओपन-सोर्स मॉडेल्सने प्रवेशयोग्य बहुभाषिक लिप्यंतरणासाठी आधाररेखा सेट केली आणि कंपनीच्या सशुल्क GPT ट्रान्सक्राइब एपीआयने व्यावसायिक बाजारपेठेचा बराचसा भाग कमी केला. दरम्यान, Google ने त्याच दिशेने कठोरपणे पुढे ढकलले आहे: रिअल टाइममध्ये डझनभर भाषा कव्हर करणारे मिथुन-संचालित ट्रान्सक्रिप्शन मॉडेल डेव्हलपरसाठी आणले गेले आहेत, जसे की आम्ही Google ने 85-भाषेतील रिअल-टाइम स्पीच ट्रान्सक्रिप्शन मॉडेल पाठवले होते.
त्या पार्श्वभूमीवर, भिन्नता कच्च्या अचूकतेपासून - जिथे नेते मानक बेंचमार्कवर एकमेकांच्या आवाजात क्लस्टर केलेले असतात — व्यावहारिक तपशीलांकडे: लेटन्सी, स्पीकर हाताळणी, भाषांमधील कोड-स्विचिंग, किंमत आणि मॉडेल कुठे चालते. एकाचवेळी मल्टी-स्पीकरवर आणि रिअल टाइममध्ये बहुभाषिक ओळखीवर मेटाचा भर तंतोतंत त्या व्यावहारिक तपशीलांना लक्ष्य करतो.
आवाज अचानक मोक्याचा का होतो
वेळ अपघाती नाही. AI एजंट्ससाठी व्हॉइस हा डीफॉल्ट इंटरफेस बनत आहे आणि ज्या कंपन्या ऑडिओ लेयरच्या मालकीच्या आहेत — कॅप्चर, ट्रान्सक्रिप्शन, समजून घेणे, प्रतिसाद — सहाय्यक अनुभवांसाठी सर्वात नैसर्गिक प्रवेश बिंदू नियंत्रित करतात. मेटा AI चष्मा आणि वेअरेबल उपकरणांबद्दलच्या त्याच्या महत्त्वाकांक्षेबद्दल सार्वजनिक आहे, जिथे व्हॉइस हा एकमेव व्यावहारिक इनपुट आहे. एक जलद, अचूक, जाता जाता ऑडिओ मॉडेल हे त्या रोडमॅपसाठी पायाभूत सुविधा आहे.
एंटरप्राइझ कोन देखील आहे. मीटिंग्ज, सपोर्ट कॉल्स आणि फील्ड वर्क हे बहु-स्पीकर ऑडिओचे प्रचंड व्हॉल्यूम तयार करतात जे संस्थांना शोधण्यायोग्य आणि कृती करण्यायोग्य हवे आहेत. संभाषण होत असताना विश्वसनीयरित्या लिप्यंतरण करणारे मॉडेल — स्पीकर लेबल केलेले आणि मॅन्युअल कॉन्फिगरेशनशिवाय हाताळल्या जाणाऱ्या भाषांसह — डेमो आणि उत्पादन यांच्यातील फरक आहे.
रिअल-टाइम ट्रान्सक्रिप्शनमध्ये सोयीपेक्षा जास्त फायदे आहेत. लाइव्ह मथळे बधिर आणि ऐकू न शकणाऱ्या वापरकर्त्यांसाठी मीटिंग, क्लासरूम आणि ब्रॉडकास्ट सुलभ करतात आणि झटपट बहुभाषिक मथळे आंतरराष्ट्रीय संघांसाठी भाषेतील अडथळे कमी करतात. जेव्हा लिप्यंतरण नैसर्गिक भाषणाशी गती ठेवण्यासाठी पुरेसे जलद असते आणि एकाच वेळी अनेक स्पीकर ट्रॅक करण्यासाठी पुरेसे मजबूत असते, तेव्हा ती प्रवेशयोग्यता वैशिष्ट्ये विशेष राहणे थांबवतात आणि दैनंदिन साधनांमध्ये तयार केलेले डीफॉल्ट बनतात.
Meta ने प्रारंभिक कव्हरेजमध्ये किंमत किंवा पूर्ण उपलब्धता तपशील जाहीर केलेला नाही. पण दिशा निःसंदिग्ध आहे: एआय स्टॅकचा ऑडिओ लेयर, ज्याला दीर्घकाळ कमोडिटी मानले जाते, आता प्लॅटफॉर्म युद्धात आघाडीवर आहे — आणि मेटाने त्यावर लढण्याचे ठरवले आहे.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
