OpenAI GPT-Live را راهاندازی کرده است، سری جدیدی از مدلهای صوتی برای ChatGPT که میتواند به طور همزمان گوش کند و صحبت کند، که نشاندهنده مهمترین بازسازی این شرکت در تجربه صوتی مکالمهاش تا به امروز است. این نسخه از آنچه OpenAI به عنوان یک معماری تمام دوبلکس توصیف میکند استفاده میکند، و به کاربران اجازه میدهد حرفهایشان را قطع کنند، صحبت کنند و با دستیار صحبت کنند، طوری که شرکت میگوید شبیه یک تماس تلفنی واقعی است.
این راهاندازی در کنار عرضه گستردهتر OpenAI از خانواده مدل GPT-5.6 در این هفته ارائه میشود و نشاندهنده فشاری است برای ایجاد [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) در مورد رابطهای صوتی، کمتر شبیه فرمان دادن به یک ماشین و بیشتر شبیه چت کردن با یک فرد است.
چه چیزی GPT-Live را متفاوت می کند
دستیارهای صوتی سنتی در حالت نیمه دوبلکس کار می کنند: شما صحبت می کنید، سپس توقف می کنید، سپس سیستم درخواست شما را پردازش می کند و پاسخ می دهد. دور زدن سخت است. GPT-Live با پردازش صوتی فول دوبلکس این الگو را می شکند، به این معنی که مدل می تواند شما را در حالی که هنوز در حال صحبت است بشنود. این وقفههای طبیعی، تصحیحهای میان جمله و مکالمههای همپوشانی را امکانپذیر میکند - نوعی از رفتوآمد انسانها بدیهی است اما هوش مصنوعی صوتی در طول تاریخ با آن دست و پنجه نرم میکند.
به گفته رویترز، مدل های GPT-Live به طور همزمان گوش می دهند و صحبت می کنند – قابلیتی که مدت هاست هدف حوزه هوش مصنوعی صوتی بوده است. این رویکرد، مکثهای ناخوشایند و چرخش اجباری را که نسخههای قبلی حالت صوتی ChatGPT را تعریف کردهاند، حذف میکند.
یک جزئیات فنی قابل توجه: وقتی GPT-Live با سؤالات پیچیده روبرو می شود، آنها را به GPT-5.5 در پس زمینه می دهد. مدل صوتی جریان مکالمه را در زمان واقعی کنترل میکند، در حالی که یک مدل استدلال بزرگتر روی کارهای سختتر در پشت صحنه کار میکند – سپس پاسخ را باز میگرداند. طبق گفته OpenAI، این تقسیم کار، کیفیت پاسخ را به شدت بهبود میبخشد، بدون اینکه پاسخگویی را قربانی کند که باعث میشود مکالمه بیدرنگ احساس شود.
در دسترس بودن و قیمت
OpenAI مدل های صوتی جدید را در دو سطح عرضه می کند:
- GPT-Live-1 - مدل کامل، اکنون برای مشترکین ChatGPT پرداختی (طرح های Plus، Pro و Team) در دسترس است.
- GPT-Live-1 mini - یک نسخه کوچکتر و سبکتر در دسترس برای حسابهای ChatGPT رایگان.
OpenAI گفت: دسترسی به API به زودی ارائه می شود، که به توسعه دهندگان اجازه می دهد صدای دوطرفه را در برنامه های خود ایجاد کنند. این شرکت هنوز قیمت دقیق API را منتشر نکرده است.
راه اندازی همچنین جستجوی وب را مستقیماً به مکالمه صوتی می آورد. همانطور که Search Engine Journal گزارش داد، GPT-Live جستجوی زنده را با صدای ChatGPT ادغام می کند، بنابراین کاربران می توانند در مورد رویدادهای جاری یا اطلاعات با تغییر سریع سؤال کنند و بدون تغییر حالت، در نتایج جدید وب پاسخ ها را دریافت کنند.
بازار هوش مصنوعی صوتی رقابتی
GPT-Live در چشم انداز هوش مصنوعی صوتی به طور فزاینده ای شلوغ می شود. گوگل ویژگیهای صوتی مبتنی بر Gemini خود را در سراسر Android و محصول Gemini Live خود اعمال کرده است، در حالی که اپل همچنان به بررسی مجدد سیری در مورد مدلهای زبان بزرگ ادامه میدهد. Anthropic، رقیب اصلی OpenAI، تلاشهای اخیر خود را به جای صدا، بر مدلهای کدگذاری عاملی و استدلال متمرکز کرده است.
رویکرد تمام دوبلکس جایی است که به نظر می رسد صنعت گسترده تر در حال حرکت است. با اجازه دادن به گوش دادن و صحبت کردن همزمان، GPT-Live تأخیر را کاهش میدهد و بزرگترین شکایت کاربران از دستیارهای صوتی را حذف میکند: انتظار. انتقال به GPT-5.5 برای پرس و جوهای پیچیده همچنین سیگنالی است که OpenAI صدا را نه به عنوان یک رابط ساده، بلکه به عنوان درب ورودی به توانمندترین مدل های خود می بیند.
چرا مهم است
صدا برای سالها بهعنوان یک رابط ثانویه و فرمانمحور در نظر گرفته میشود – برای تنظیم تایمرها و بررسی آبوهوا خوب است و برای مکالمههای ظریف کمتر مفید است. شرط GPT-Live این است که گلوگاه هرگز هوش مدل نبود، بلکه رابط: وادار کردن انسانها به صحبت کردن در فواصل مختلف.
اگر مکالمه تمام دوبلکس در مقیاس قابل اعتماد کار کند، نحوه تعامل افراد با هوش مصنوعی در تلفنها، خودروها، بلندگوهای هوشمند و در نهایت در دستگاههای پوشیدنی را تغییر میدهد. همچنین نگرانیهای آشنا را ایجاد میکند - در مورد رضایت در دستگاههایی که همیشه گوش میدهند، در مورد واقعگرایی صداهای مصنوعی، و در مورد اینکه آیا مکالمه طبیعیتر باعث میشود کاربران بیش از حد به پاسخهای هوش مصنوعی اعتماد کنند.
OpenAI اقدامات ایمنی خاصی را برای GPT-Live فراتر از خطمشیهای محتوای موجود خود ارائه نکرده است، اگرچه ادغام جستجو به این معنی است که این مدل اکنون میتواند اطلاعات زنده را به صدایی بکشد که ارزیابی انتقادی آن برای کاربران سختتر از متنی است که میتوانند به عقب برگردند.
بعد چه می آید
در حال حاضر، GPT-Live اول یک ویژگی ChatGPT و در مرحله دوم یک محصول توسعه دهنده است. آزمایش واقعی با دسترسی API انجام میشود، زمانی که برنامههای شخص ثالث، پلتفرمهای خدمات مشتری و سازندگان سختافزار بتوانند مکالمه دوطرفه کامل را به محصولات خود متصل کنند. همچنین در آن زمان است که OpenAI با فشار قیمتگذاری از سوی مدلهای صوتی منبع باز ارزانتر و رقبای مشتاق برای مطابقت با این ویژگی مواجه خواهد شد.
راه اندازی همزمان با انتشار عمومی GPT-5.6 نشان می دهد که OpenAI صدا و استدلال را به عنوان دو نیمه از یک استراتژی می بیند: یک مدل قدرتمند که فکر می کند، همراه با رابطی که به شما امکان می دهد مانند یک همکار با آن صحبت کنید.
از هوش مصنوعی جلوتر بمانید
برای پوشش مداوم نسخههای مدل، هوش مصنوعی صوتی و هر چیزی که صنعت را شکل میدهد، آخرین پیشرفتهای هوش مصنوعی را در AI Buzz Wire دنبال کنید.
بیشتر بخوانید اخبار هوش مصنوعی →



