OpenAI GPT-Live را راه‌اندازی کرده است، سری جدیدی از مدل‌های صوتی برای ChatGPT که می‌تواند به طور همزمان گوش کند و صحبت کند، که نشان‌دهنده مهم‌ترین بازسازی این شرکت در تجربه صوتی مکالمه‌اش تا به امروز است. این نسخه از آنچه OpenAI به عنوان یک معماری تمام دوبلکس توصیف می‌کند استفاده می‌کند، و به کاربران اجازه می‌دهد حرف‌هایشان را قطع کنند، صحبت کنند و با دستیار صحبت کنند، طوری که شرکت می‌گوید شبیه یک تماس تلفنی واقعی است.

این راه‌اندازی در کنار عرضه گسترده‌تر OpenAI از خانواده مدل GPT-5.6 در این هفته ارائه می‌شود و نشان‌دهنده فشاری است برای ایجاد [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) در مورد رابط‌های صوتی، کمتر شبیه فرمان دادن به یک ماشین و بیشتر شبیه چت کردن با یک فرد است.

چه چیزی GPT-Live را متفاوت می کند

دستیارهای صوتی سنتی در حالت نیمه دوبلکس کار می کنند: شما صحبت می کنید، سپس توقف می کنید، سپس سیستم درخواست شما را پردازش می کند و پاسخ می دهد. دور زدن سخت است. GPT-Live با پردازش صوتی فول دوبلکس این الگو را می شکند، به این معنی که مدل می تواند شما را در حالی که هنوز در حال صحبت است بشنود. این وقفه‌های طبیعی، تصحیح‌های میان جمله و مکالمه‌های همپوشانی را امکان‌پذیر می‌کند - نوعی از رفت‌وآمد انسان‌ها بدیهی است اما هوش مصنوعی صوتی در طول تاریخ با آن دست و پنجه نرم می‌کند.

به گفته رویترز، مدل های GPT-Live به طور همزمان گوش می دهند و صحبت می کنند – قابلیتی که مدت هاست هدف حوزه هوش مصنوعی صوتی بوده است. این رویکرد، مکث‌های ناخوشایند و چرخش اجباری را که نسخه‌های قبلی حالت صوتی ChatGPT را تعریف کرده‌اند، حذف می‌کند.

یک جزئیات فنی قابل توجه: وقتی GPT-Live با سؤالات پیچیده روبرو می شود، آنها را به GPT-5.5 در پس زمینه می دهد. مدل صوتی جریان مکالمه را در زمان واقعی کنترل می‌کند، در حالی که یک مدل استدلال بزرگ‌تر روی کارهای سخت‌تر در پشت صحنه کار می‌کند – سپس پاسخ را باز می‌گرداند. طبق گفته OpenAI، این تقسیم کار، کیفیت پاسخ را به شدت بهبود می‌بخشد، بدون اینکه پاسخگویی را قربانی کند که باعث می‌شود مکالمه بی‌درنگ احساس شود.

در دسترس بودن و قیمت

OpenAI مدل های صوتی جدید را در دو سطح عرضه می کند:

  • GPT-Live-1 - مدل کامل، اکنون برای مشترکین ChatGPT پرداختی (طرح های Plus، Pro و Team) در دسترس است.
  • GPT-Live-1 mini - یک نسخه کوچکتر و سبکتر در دسترس برای حسابهای ChatGPT رایگان.

OpenAI گفت: دسترسی به API به زودی ارائه می شود، که به توسعه دهندگان اجازه می دهد صدای دوطرفه را در برنامه های خود ایجاد کنند. این شرکت هنوز قیمت دقیق API را منتشر نکرده است.

راه اندازی همچنین جستجوی وب را مستقیماً به مکالمه صوتی می آورد. همانطور که Search Engine Journal گزارش داد، GPT-Live جستجوی زنده را با صدای ChatGPT ادغام می کند، بنابراین کاربران می توانند در مورد رویدادهای جاری یا اطلاعات با تغییر سریع سؤال کنند و بدون تغییر حالت، در نتایج جدید وب پاسخ ها را دریافت کنند.

بازار هوش مصنوعی صوتی رقابتی

GPT-Live در چشم انداز هوش مصنوعی صوتی به طور فزاینده ای شلوغ می شود. گوگل ویژگی‌های صوتی مبتنی بر Gemini خود را در سراسر Android و محصول Gemini Live خود اعمال کرده است، در حالی که اپل همچنان به بررسی مجدد سیری در مورد مدل‌های زبان بزرگ ادامه می‌دهد. Anthropic، رقیب اصلی OpenAI، تلاش‌های اخیر خود را به جای صدا، بر مدل‌های کدگذاری عاملی و استدلال متمرکز کرده است.

رویکرد تمام دوبلکس جایی است که به نظر می رسد صنعت گسترده تر در حال حرکت است. با اجازه دادن به گوش دادن و صحبت کردن همزمان، GPT-Live تأخیر را کاهش می‌دهد و بزرگترین شکایت کاربران از دستیارهای صوتی را حذف می‌کند: انتظار. انتقال به GPT-5.5 برای پرس و جوهای پیچیده همچنین سیگنالی است که OpenAI صدا را نه به عنوان یک رابط ساده، بلکه به عنوان درب ورودی به توانمندترین مدل های خود می بیند.

چرا مهم است

صدا برای سال‌ها به‌عنوان یک رابط ثانویه و فرمان‌محور در نظر گرفته می‌شود – برای تنظیم تایمرها و بررسی آب‌وهوا خوب است و برای مکالمه‌های ظریف کمتر مفید است. شرط GPT-Live این است که گلوگاه هرگز هوش مدل نبود، بلکه رابط: وادار کردن انسانها به صحبت کردن در فواصل مختلف.

اگر مکالمه تمام دوبلکس در مقیاس قابل اعتماد کار کند، نحوه تعامل افراد با هوش مصنوعی در تلفن‌ها، خودروها، بلندگوهای هوشمند و در نهایت در دستگاه‌های پوشیدنی را تغییر می‌دهد. همچنین نگرانی‌های آشنا را ایجاد می‌کند - در مورد رضایت در دستگاه‌هایی که همیشه گوش می‌دهند، در مورد واقع‌گرایی صداهای مصنوعی، و در مورد اینکه آیا مکالمه طبیعی‌تر باعث می‌شود کاربران بیش از حد به پاسخ‌های هوش مصنوعی اعتماد کنند.

OpenAI اقدامات ایمنی خاصی را برای GPT-Live فراتر از خط‌مشی‌های محتوای موجود خود ارائه نکرده است، اگرچه ادغام جستجو به این معنی است که این مدل اکنون می‌تواند اطلاعات زنده را به صدایی بکشد که ارزیابی انتقادی آن برای کاربران سخت‌تر از متنی است که می‌توانند به عقب برگردند.

بعد چه می آید

در حال حاضر، GPT-Live اول یک ویژگی ChatGPT و در مرحله دوم یک محصول توسعه دهنده است. آزمایش واقعی با دسترسی API انجام می‌شود، زمانی که برنامه‌های شخص ثالث، پلتفرم‌های خدمات مشتری و سازندگان سخت‌افزار بتوانند مکالمه دوطرفه کامل را به محصولات خود متصل کنند. همچنین در آن زمان است که OpenAI با فشار قیمت‌گذاری از سوی مدل‌های صوتی منبع باز ارزان‌تر و رقبای مشتاق برای مطابقت با این ویژگی مواجه خواهد شد.

راه اندازی همزمان با انتشار عمومی GPT-5.6 نشان می دهد که OpenAI صدا و استدلال را به عنوان دو نیمه از یک استراتژی می بیند: یک مدل قدرتمند که فکر می کند، همراه با رابطی که به شما امکان می دهد مانند یک همکار با آن صحبت کنید.

از هوش مصنوعی جلوتر بمانید

برای پوشش مداوم نسخه‌های مدل، هوش مصنوعی صوتی و هر چیزی که صنعت را شکل می‌دهد، آخرین پیشرفت‌های هوش مصنوعی را در AI Buzz Wire دنبال کنید.

بیشتر بخوانید اخبار هوش مصنوعی →