ओपनएआई ने चैटजीपीटी के लिए वॉयस मॉडल की एक नई श्रृंखला जीपीटी-लाइव लॉन्च की है, जो एक ही समय में सुन और बोल सकती है, जो कंपनी के अब तक के वार्तालाप वॉयस अनुभव के सबसे महत्वपूर्ण ओवरहाल को चिह्नित करती है। रिलीज़ में OpenAI द्वारा वर्णित पूर्ण-डुप्लेक्स आर्किटेक्चर का उपयोग किया गया है, जो उपयोगकर्ताओं को सहायक के साथ हस्तक्षेप करने, बात करने और बातचीत करने की अनुमति देता है, जैसा कि कंपनी का कहना है कि यह एक वास्तविक फोन कॉल जैसा लगता है।
यह लॉन्च इस सप्ताह OpenAI के GPT-5.6 मॉडल परिवार के व्यापक रोलआउट के साथ आता है, और वॉयस इंटरफेस के बारे में [ब्रेकिंग AI समाचार] (https://aibuzzwire.news) बनाने के लिए एक धक्का का प्रतिनिधित्व करता है जो मशीन को कमांड करने जैसा कम और किसी व्यक्ति के साथ चैट करने जैसा लगता है।
जीपीटी-लाइव को क्या अलग बनाता है
पारंपरिक वॉयस असिस्टेंट हाफ-डुप्लेक्स मोड में काम करते हैं: आप बोलते हैं, फिर रुकते हैं, फिर सिस्टम आपके अनुरोध को संसाधित करता है और प्रतिक्रिया देता है। टर्न-टेकिंग कठोर है. जीपीटी-लाइव फुल-डुप्लेक्स ऑडियो प्रोसेसिंग के साथ उस पैटर्न को तोड़ता है, जिसका अर्थ है कि मॉडल आपको बात करते समय भी सुन सकता है। यह प्राकृतिक रुकावटों, मध्य-वाक्य सुधारों और ओवरलैपिंग वार्तालाप को सक्षम बनाता है - जिस तरह की आगे-पीछे की बातें इंसान मान लेते हैं लेकिन वॉयस एआई को ऐतिहासिक रूप से संघर्ष करना पड़ा है।
रॉयटर्स के अनुसार, जीपीटी-लाइव मॉडल एक साथ सुनते और बोलते हैं - एक ऐसी क्षमता जो लंबे समय से वॉयस एआई क्षेत्र के लिए एक लक्ष्य रही है। यह दृष्टिकोण अजीब रुकावटों और जबरन टर्न-टेकिंग को हटा देता है जिसने चैटजीपीटी के वॉयस मोड के पुराने संस्करणों को परिभाषित किया है।एक उल्लेखनीय तकनीकी विवरण: जब GPT-Live को जटिल प्रश्नों का सामना करना पड़ता है, तो यह उन्हें पृष्ठभूमि में GPT-5.5 पर भेज देता है। वॉयस मॉडल वास्तविक समय में बातचीत के प्रवाह को संभालता है, जबकि एक बड़ा तर्क मॉडल पर्दे के पीछे कठिन कार्यों पर काम करता है - फिर उत्तर को वापस फीड करता है। ओपनएआई के अनुसार, श्रम का वह विभाजन, प्रतिक्रियाशीलता का त्याग किए बिना प्रतिक्रिया की गुणवत्ता में काफी सुधार करता है जो वास्तविक समय की बातचीत को स्वाभाविक महसूस कराता है।
उपलब्धता और कीमत
OpenAI दो स्तरों में नए वॉयस मॉडल पेश कर रहा है:
- जीपीटी-लाइव-1 - पूर्ण मॉडल, अब भुगतान करने वाले चैटजीपीटी ग्राहकों (प्लस, प्रो और टीम प्लान) के लिए उपलब्ध है।
- जीपीटी-लाइव-1 मिनी - मुफ़्त चैटजीपीटी खातों के लिए एक छोटा, हल्का संस्करण उपलब्ध है।
ओपनएआई ने कहा, एपीआई एक्सेस जल्द ही आ रहा है, जो डेवलपर्स को अपने स्वयं के एप्लिकेशन में फुल-डुप्लेक्स वॉयस बनाने की अनुमति देगा। कंपनी ने अभी तक एपीआई के लिए विस्तृत मूल्य निर्धारण प्रकाशित नहीं किया है।
यह लॉन्च वेब खोज को सीधे ध्वनि वार्तालाप में भी लाता है। जैसा कि सर्च इंजन जर्नल ने रिपोर्ट किया है, जीपीटी-लाइव चैटजीपीटी वॉयस में लाइव खोज को एकीकृत करता है, ताकि उपयोगकर्ता वर्तमान घटनाओं या तेजी से बदलती जानकारी के बारे में पूछ सकें और मोड स्विच किए बिना ताजा वेब परिणामों में आधारित उत्तर प्राप्त कर सकें।
एक प्रतिस्पर्धी वॉयस एआई बाज़ार
जीपीटी-लाइव तेजी से भीड़भाड़ वाले वॉयस एआई परिदृश्य में उतरता है। Google अपने जेमिनी-संचालित वॉयस फीचर्स को एंड्रॉइड और अपने जेमिनी लाइव उत्पाद पर आगे बढ़ा रहा है, जबकि ऐप्पल बड़े भाषा मॉडल के आसपास सिरी पर फिर से काम करना जारी रखता है। ओपनएआई के मुख्य प्रतिद्वंद्वी एंथ्रोपिक ने अपने हालिया प्रयासों को आवाज के बजाय एजेंटिक कोडिंग और रीजनिंग मॉडल पर केंद्रित किया है।
पूर्ण-डुप्लेक्स दृष्टिकोण वह दिशा है जहाँ व्यापक उद्योग जा रहा है। एक साथ सुनने और बोलने की अनुमति देकर, जीपीटी-लाइव विलंबता को कम करता है और वॉयस असिस्टेंट के साथ उपयोगकर्ताओं की सबसे बड़ी शिकायत को दूर करता है: प्रतीक्षा। जटिल प्रश्नों के लिए GPT-5.5 को हैंडऑफ करना भी एक संकेत है कि OpenAI आवाज को एक अलग इंटरफ़ेस के रूप में नहीं, बल्कि अपने सबसे सक्षम मॉडल के सामने के दरवाजे के रूप में देखता है।
यह क्यों मायने रखता है
वर्षों से आवाज को एक द्वितीयक, कमांड-संचालित इंटरफ़ेस के रूप में माना जाता रहा है - टाइमर सेट करने और मौसम की जांच करने के लिए अच्छा है, सूक्ष्म बातचीत के लिए कम उपयोगी है। जीपीटी-लाइव की शर्त यह है कि अड़चन कभी भी मॉडल की बुद्धिमत्ता नहीं थी, बल्कि इंटरफ़ेस थी: इंसानों को अलग-थलग बोलने के लिए मजबूर करना।
यदि पूर्ण-डुप्लेक्स वार्तालाप बड़े पैमाने पर विश्वसनीय रूप से काम करता है, तो यह बदल जाता है कि लोग फोन पर, कारों में, स्मार्ट स्पीकर पर और अंततः पहनने योग्य उपकरणों पर एआई के साथ कैसे बातचीत करते हैं। यह परिचित चिंताओं को भी जन्म देता है - हमेशा सुनने वाले उपकरणों में सहमति के बारे में, सिंथेटिक आवाजों के यथार्थवाद के बारे में, और क्या अधिक प्राकृतिक बातचीत उपयोगकर्ताओं को एआई के उत्तरों पर अधिक भरोसा करने के लिए प्रेरित करती है।
ओपनएआई ने अपनी मौजूदा सामग्री नीतियों से परे जीपीटी-लाइव के लिए विशिष्ट सुरक्षा उपायों का विवरण नहीं दिया है, हालांकि खोज एकीकरण का मतलब है कि मॉडल अब लाइव जानकारी को आवाज में खींच सकता है जो उपयोगकर्ताओं के लिए उस पाठ की तुलना में गंभीर रूप से मूल्यांकन करना कठिन हो सकता है जिसे वे वापस स्क्रॉल कर सकते हैं।
आगे क्या आता है
अभी के लिए, GPT-Live पहले एक ChatGPT सुविधा है और बाद में एक डेवलपर उत्पाद है। असली परीक्षा एपीआई एक्सेस के साथ होगी, जब तृतीय-पक्ष ऐप्स, ग्राहक-सेवा प्लेटफ़ॉर्म और हार्डवेयर निर्माता पूर्ण-डुप्लेक्स वार्तालाप को अपने उत्पादों में प्लग कर सकते हैं। ऐसा तब भी है जब ओपनएआई को सस्ते ओपन-सोर्स वॉयस मॉडल और फीचर से मेल खाने के लिए उत्सुक प्रतिस्पर्धियों से मूल्य निर्धारण दबाव का सामना करना पड़ेगा।
GPT-5.6 की सार्वजनिक रिलीज के साथ एक साथ लॉन्च से पता चलता है कि OpenAI आवाज और तर्क को एक ही रणनीति के दो हिस्सों के रूप में देखता है: एक शक्तिशाली मॉडल जो सोचता है, एक इंटरफ़ेस के साथ जोड़ा जाता है जो आपको एक सहकर्मी की तरह बात करने देता है।
एआई से आगे रहें
मॉडल रिलीज़, वॉयस एआई और उद्योग को आकार देने वाली हर चीज़ के निरंतर कवरेज के लिए, एआई बज़ वायर पर नवीनतम एआई विकास का अनुसरण करें।
अधिक AI समाचार पढ़ें →



