एनगैजेट के अनुसार, मेटा ने सोमवार को एक नए ऑडियो एआई मॉडल का अनावरण किया, जो कई स्पीकरों के बीच अंतर कर सकता है और वास्तविक समय में कई भाषाओं को ट्रांसक्राइब कर सकता है, यह एक ऐसा कदम है जो कंपनी को स्पीच एआई के लिए तेजी से भीड़ भरे बाजार में गहराई से धकेलता है। सूचना ने सबसे पहले ऑडियो मॉडल की घोषणा की सूचना दी, जबकि एक साथी उत्पाद - म्यूज़ वॉयस ट्रांसक्राइब, मैक पर वास्तविक समय वॉयस डिक्टेशन ला रहा है - 9to5Mac द्वारा विस्तृत किया गया था।
जुड़वां संकेत जारी करता है कि मेटा अपने एआई स्टैक के लिए आवाज को प्रथम श्रेणी के इनपुट के रूप में मान रहा है, बाद में नहीं। वास्तविक समय प्रतिलेखन जो ओवरलैपिंग स्पीकर को संभाल सकता है, बातचीत के बीच भाषा स्विचिंग, और सिस्टम-व्यापी श्रुतलेख ऐसी क्षमताएं हैं जो आवाज को एक नवीन सुविधा से दैनिक उपयोग इंटरफ़ेस में बदल देती हैं। For more context on this story, see our ongoing AI news.
एक मॉडल, कई आवाज़ें, कई भाषाएँ
जैसा कि एनगैजेट ने रिपोर्ट किया है, हेडलाइन क्षमता वास्तविक समय में कई वक्ताओं और कई भाषाओं के बीच अंतर करने की मॉडल की क्षमता है। यह संयोजन व्यावहारिक प्रतिलेखन में दो सबसे कठिन समस्याओं को एक साथ संबोधित करता है: स्पीकर डायराइजेशन - यह पता लगाना कि किसने क्या कहा - और बहुभाषी मान्यता, जहां बातचीत बिना रुके भाषाओं के बीच चलती रहती है।
अधिकांश मौजूदा ट्रांसक्रिप्शन पाइपलाइन इन्हें अलग-अलग चरणों के रूप में मानते हैं: पहले एक डायराइजेशन मॉडल स्पीकर को विभाजित करता है, फिर एक पहचान मॉडल प्रत्येक सेगमेंट को ट्रांसक्रिप्ट करता है। उन्हें एक वास्तविक समय मॉडल में संयोजित करना ही प्रौद्योगिकी को लाइव उपयोग के मामलों के लिए व्यवहार्य बनाता है - बैठकें, साक्षात्कार, ग्राहक कॉल, लाइव अनुवाद ओवरले - जहां पोस्ट-प्रोसेसिंग की प्रतीक्षा करने से उद्देश्य विफल हो जाता है।
म्यूज़ वॉयस ट्रांसक्राइब प्रत्येक मैक ऐप पर श्रुतलेख लाता है
मॉडल के साथ, मेटा ने macOS के लिए म्यूज़ वॉयस ट्रांसक्राइब लॉन्च किया। जैसा कि 9to5Mac ने रिपोर्ट किया है, टूल वास्तविक समय वॉयस डिक्टेशन प्रदान करता है जो मैक अनुप्रयोगों पर काम करता है - प्रभावी रूप से एक स्टैंडअलोन ऐप के बजाय एक सिस्टम-वाइड डिक्टेशन परत। गैजेट रिव्यू के कवरेज में इसे प्रत्येक मैक ऐप पर रीयल-टाइम डिक्टेशन लाने वाला बताया गया है।
वह डिज़ाइन अपनाने के लिए मायने रखता है। श्रुतलेख उपकरण घर्षण पर जीवित रहते हैं या मर जाते हैं: यदि उपयोगकर्ताओं को एक अलग विंडो से पाठ की प्रतिलिपि बनानी होती है, तो वे इसका उपयोग करना बंद कर देते हैं। सिस्टम स्तर पर काम करने का मतलब है कि वॉयस इनपुट कहीं भी उपलब्ध हो जाता है जहां कर्सर झपकाता है - ईमेल, कोड संपादक, मैसेजिंग ऐप, दस्तावेज़ - जो बिल्कुल इसी तरह है कि सबसे सफल श्रुतलेख उपकरण ने अपने दर्शकों को जीत लिया है।
मैक रिलीज़ मेटा के लिए उल्लेखनीय क्षेत्र को भी चिह्नित करता है। कंपनी के AI प्रयास उसके मोबाइल ऐप्स, उसके मेटा AI असिस्टेंट और उसके लामा-फ़ैमिली और म्यूज़-फ़ैमिली मॉडल पर केंद्रित हैं। ऐप्पल के प्लेटफ़ॉर्म के लिए एक पॉलिश डेस्कटॉप उत्पादकता टूल की शिपिंग मेटा को पेशेवर उपयोगकर्ता आधार के साथ सीधे संपर्क में लाती है, जिस तक पहुंचने के लिए इसे ऐतिहासिक रूप से संघर्ष करना पड़ा है - और इसे प्लेटफ़ॉर्म पर स्थापित श्रुतलेख और प्रतिलेखन उपयोगिताओं के साथ प्रतिस्पर्धा में रखता है।
एक भीड़भाड़ वाला मैदान जो लगातार तेज़ होता जा रहा है
मेटा एक ऐसे बाज़ार में प्रवेश कर रहा है जिसका पिछले दो वर्षों में पुनर्मूल्यांकन और पुनर्रचना की गई है। ओपनएआई के व्हिस्पर ओपन-सोर्स मॉडल सुलभ बहुभाषी ट्रांसक्रिप्शन के लिए आधार रेखा निर्धारित करते हैं, और कंपनी के भुगतान किए गए जीपीटी ट्रांसक्राइब एपीआई ने कीमत पर वाणिज्यिक बाजार के अधिकांश हिस्से को कम कर दिया है। इस बीच, Google ने उसी दिशा में कड़ी मेहनत की है: वास्तविक समय में दर्जनों भाषाओं को कवर करने वाले जेमिनी-संचालित ट्रांसक्रिप्शन मॉडल को डेवलपर्स के लिए पेश किया गया है, जैसा कि हमने तब कवर किया था जब Google ने अपने 85-भाषा वास्तविक समय भाषण ट्रांसक्रिप्शन मॉडल को शिप किया था।
उस पृष्ठभूमि के खिलाफ, भेदभाव कच्ची सटीकता से स्थानांतरित हो गया है - जहां नेताओं को मानक बेंचमार्क पर एक-दूसरे के शोर के भीतर क्लस्टर किया जाता है - व्यावहारिक विवरणों में: विलंबता, स्पीकर हैंडलिंग, भाषाओं के बीच कोड-स्विचिंग, मूल्य निर्धारण, और जहां मॉडल चलता है। वास्तविक समय में एक साथ मल्टी-स्पीकर और बहुभाषी पहचान पर मेटा का जोर सटीक रूप से उन व्यावहारिक विवरणों को लक्षित करता है।
आवाज़ अचानक रणनीतिक क्यों हो जाती है
समय आकस्मिक नहीं है. वॉयस एआई एजेंटों के लिए डिफ़ॉल्ट इंटरफ़ेस बन रहा है, और जिन कंपनियों के पास ऑडियो परत है - कैप्चर, ट्रांसक्रिप्शन, समझ, प्रतिक्रिया - सहायक अनुभवों के लिए सबसे प्राकृतिक प्रवेश बिंदु को नियंत्रित करती है। मेटा एआई ग्लास और पहनने योग्य उपकरणों के लिए अपनी महत्वाकांक्षाओं के बारे में सार्वजनिक रहा है, जहां आवाज अनिवार्य रूप से एकमात्र व्यावहारिक इनपुट है। एक तेज़, सटीक, चलते-फिरते ऑडियो मॉडल उस रोडमैप के लिए बुनियादी ढांचा है।
इसमें एंटरप्राइज एंगल भी है. मीटिंग, समर्थन कॉल और फ़ील्ड कार्य भारी मात्रा में मल्टी-स्पीकर ऑडियो उत्पन्न करते हैं जिन्हें संगठन खोजने योग्य और कार्रवाई योग्य चाहते हैं। एक मॉडल जो बातचीत होते ही विश्वसनीय रूप से प्रतिलेखन करता है - जिसमें स्पीकर लेबल होते हैं और मैन्युअल कॉन्फ़िगरेशन के बिना भाषाओं को नियंत्रित किया जाता है - एक डेमो और एक उत्पाद के बीच का अंतर है।
वास्तविक समय प्रतिलेखन सुविधा से परे लाभ भी प्रदान करता है। लाइव कैप्शन बैठकों, कक्षाओं और प्रसारणों को बधिर और कम सुनने वाले उपयोगकर्ताओं के लिए सुलभ बनाते हैं, और त्वरित बहुभाषी कैप्शन अंतरराष्ट्रीय टीमों के लिए भाषा बाधाओं को कम करते हैं। जब प्रतिलेखन प्राकृतिक भाषण के साथ तालमेल बनाए रखने के लिए पर्याप्त तेज़ होता है और एक साथ कई वक्ताओं को ट्रैक करने के लिए पर्याप्त मजबूत होता है, तो उन पहुंच सुविधाओं को विशेष समायोजन नहीं दिया जाता है और रोजमर्रा के उपकरणों में डिफ़ॉल्ट रूप से निर्मित किया जाता है।
मेटा ने प्रारंभिक कवरेज में मूल्य निर्धारण या पूर्ण उपलब्धता विवरण की घोषणा नहीं की है। लेकिन दिशा अचूक है: एआई स्टैक की ऑडियो परत, जिसे लंबे समय तक एक वस्तु के रूप में माना जाता था, अब प्लेटफ़ॉर्म युद्ध में एक मोर्चा है - और मेटा ने इस पर लड़ने का फैसला किया है।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
