أطلقت OpenAI GPT-Live، وهي سلسلة جديدة من النماذج الصوتية لـ ChatGPT التي يمكنها الاستماع والتحدث في نفس الوقت، مما يمثل أهم إصلاح شامل أجرته الشركة لتجربتها الصوتية للمحادثة حتى الآن. يستخدم الإصدار ما تصفه OpenAI بأنه بنية ثنائية الاتجاه، مما يسمح للمستخدمين بالمقاطعة والتحدث والتحدث مع المساعد بطريقة تقول الشركة إنها تبدو وكأنها مكالمة هاتفية حقيقية.

ويأتي الإطلاق جنبًا إلى جنب مع طرح OpenAI الأوسع لمجموعة طرازات GPT-5.6 هذا الأسبوع، ويمثل دفعة لجعل أخبار الذكاء الاصطناعي العاجلة حول الواجهات الصوتية تبدو أقل شبهًا بقيادة آلة وأكثر أشبه بالدردشة مع شخص ما.

ما الذي يجعل GPT-Live مختلفًا

تعمل المساعدات الصوتية التقليدية في وضع أحادي الاتجاه: تتحدث، ثم تتوقف، ثم يعالج النظام طلبك ويستجيب. أخذ الأدوار صارم. يكسر GPT-Live هذا النمط من خلال معالجة الصوت ثنائية الاتجاه، مما يعني أن النموذج يمكنه سماعك بينما لا يزال يتحدث. يتيح ذلك المقاطعات الطبيعية، وتصحيحات منتصف الجملة، والمحادثات المتداخلة، وهو النوع الذي يعتبره البشر أمرًا مفروغًا منه، لكن الذكاء الاصطناعي الصوتي عانى معه تاريخيًا.

وفقًا رويترز، تستمع نماذج GPT-Live وتتحدث في وقت واحد - وهي القدرة التي كانت منذ فترة طويلة هدفًا لمجال الذكاء الاصطناعي الصوتي. يزيل هذا النهج حالات التوقف المؤقت غير الملائمة وأخذ الأدوار الإجبارية التي حددت الإصدارات السابقة من الوضع الصوتي لـ ChatGPT.

تفاصيل فنية ملحوظة: عندما يواجه GPT-Live أسئلة معقدة، فإنه يسلمها إلى GPT-5.5 في الخلفية. يتعامل النموذج الصوتي مع تدفق المحادثة في الوقت الفعلي، بينما يعمل نموذج الاستدلال الأكبر على المهام الأصعب خلف الكواليس - ثم يقدم الإجابة مرة أخرى. يؤدي تقسيم العمل هذا، وفقًا لـ OpenAI، إلى تحسين جودة الاستجابة بشكل كبير دون التضحية بالاستجابة التي تجعل المحادثة في الوقت الفعلي تبدو طبيعية.

التوفر والتسعير

تقوم OpenAI بطرح النماذج الصوتية الجديدة في مستويين:

  • GPT-Live-1 — النموذج الكامل، متاح الآن لمشتركي ChatGPT المدفوعين (خطط Plus وPro وTeam).
  • GPT-Live-1 mini — إصدار أصغر حجمًا وأخف وزنًا متاح لحسابات ChatGPT المجانية.

وقالت OpenAI إن الوصول إلى واجهة برمجة التطبيقات سيأتي قريبًا، مما سيسمح للمطورين ببناء صوت مزدوج الاتجاه في تطبيقاتهم الخاصة. لم تنشر الشركة بعد أسعارًا مفصلة لواجهة برمجة التطبيقات (API).

يؤدي الإطلاق أيضًا إلى جلب البحث على الويب مباشرة إلى المحادثة الصوتية. كما ذكرت Search Engine Journal، يدمج GPT-Live البحث المباشر في صوت ChatGPT، بحيث يمكن للمستخدمين السؤال عن الأحداث الحالية أو المعلومات سريعة التغير والحصول على إجابات مستندة إلى نتائج الويب الجديدة دون تبديل الأوضاع.

سوق الذكاء الاصطناعي الصوتي التنافسي

تهبط GPT-Live في مشهد الذكاء الاصطناعي الصوتي المزدحم بشكل متزايد. تعمل Google على تطوير ميزاتها الصوتية التي تعمل بنظام Gemini عبر Android ومنتج Gemini Live الخاص بها، بينما تواصل Apple إعادة صياغة Siri حول نماذج اللغات الكبيرة. وقد ركزت شركة Anthropic، المنافس الرئيسي لـ OpenAI، جهودها الأخيرة على نماذج البرمجة والاستدلال بدلاً من الصوت.

إن نهج الازدواج الكامل هو المكان الذي يبدو أن الصناعة الأوسع تتجه إليه. من خلال السماح بالاستماع والتحدث في وقت واحد، تعمل GPT-Live على تقليل زمن الوصول وإزالة أكبر شكوى لدى المستخدمين من المساعدين الصوتيين: الانتظار. يعد التحول إلى GPT-5.5 للاستعلامات المعقدة أيضًا إشارة إلى أن OpenAI تنظر إلى الصوت ليس كواجهة مجردة، ولكن كباب أمامي لنماذجها الأكثر قدرة.

لماذا يهم

لقد تم التعامل مع الصوت لسنوات كواجهة ثانوية تعتمد على الأوامر، وهو جيد لضبط المؤقتات والتحقق من الطقس، وأقل فائدة للمحادثات الدقيقة. رهان GPT-Live هو أن عنق الزجاجة لم يكن أبدًا ذكاء النموذج، بل الواجهة: إجبار البشر على التحدث في رشقات نارية معزولة.

إذا عملت المحادثة ثنائية الاتجاه بشكل موثوق على نطاق واسع، فإنها ستغير كيفية تفاعل الأشخاص مع الذكاء الاصطناعي على الهواتف، وفي السيارات، ومكبرات الصوت الذكية، وفي النهاية على الأجهزة القابلة للارتداء. كما أنه يثير مخاوف مألوفة - حول الموافقة في أجهزة الاستماع دائمًا، وحول واقعية الأصوات الاصطناعية، وحول ما إذا كانت المحادثة الطبيعية تقود المستخدمين إلى الإفراط في الثقة في إجابات الذكاء الاصطناعي.

لم تقدم OpenAI تفاصيل عن تدابير السلامة المحددة لـ GPT-Live بما يتجاوز سياسات المحتوى الحالية الخاصة بها، على الرغم من أن تكامل البحث يعني أن النموذج يمكنه الآن سحب المعلومات المباشرة إلى صوت قد يكون من الصعب على المستخدمين تقييمه بشكل نقدي مقارنة بالنص الذي يمكنهم التمرير إليه مرة أخرى.

ما يأتي بعد ذلك

في الوقت الحالي، تعد GPT-Live إحدى ميزات ChatGPT أولاً ومنتجًا للمطورين ثانيًا. سيصل الاختبار الحقيقي من خلال الوصول إلى واجهة برمجة التطبيقات (API)، عندما تتمكن تطبيقات الطرف الثالث ومنصات خدمة العملاء وصانعي الأجهزة من توصيل محادثة ثنائية الاتجاه بمنتجاتهم الخاصة. وهذا أيضًا هو الوقت الذي ستواجه فيه OpenAI ضغوطًا على الأسعار من النماذج الصوتية الأرخص ثمناً مفتوحة المصدر ومن المنافسين الذين يتوقون إلى مطابقة هذه الميزة.

يشير الإطلاق المتزامن مع الإصدار العام لـ GPT-5.6 إلى أن OpenAI تنظر إلى الصوت والتفكير باعتبارهما نصفين من نفس الإستراتيجية: نموذج قوي يفكر، مقترنًا بواجهة تتيح لك التحدث إليه مثل زميل.

البقاء في صدارة الذكاء الاصطناعي

للحصول على تغطية مستمرة لإصدارات النماذج والذكاء الاصطناعي الصوتي وكل ما يشكل الصناعة، تابع أحدث تطورات الذكاء الاصطناعي على AI Buzz Wire.

اقرأ المزيد من أخبار الذكاء الاصطناعي →