أطلقت Google نموذجي Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، وهما نموذجان للحوار المباشر تصفهما الشركة بأنهما الأكثر تقدمًا حتى الآن للمحادثة الصوتية الطبيعية. بدأ طرح النماذج في 15 سبتمبر عبر Gemini API وGoogle AI Studio وSearch Live وGemini Live وGoogle Workspace، مع إمكانية الوصول للمؤسسات في معاينة خاصة من خلال Gemini Enterprise.
جاء هذا الإعلان من Tom Ouyang، المهندس الرئيسي، وMalini Jaganathan، أحد أعضاء الجهاز الفني، اللذين يكتبان نيابة عن فريق Gemini Audio. إنه يمتد إلى عائلة Gemini 3.8 التي ظهرت لأول مرة في وقت سابق من هذا الشهر مع طرازي Flash وFlash Cyber، ويمثل الدفعة الأكثر قوة من Google حتى الآن نحو المساعدة الصوتية متعددة الوسائط في الوقت الفعلي - وهو سوق يتنافس فيه الوضع الصوتي لـ OpenAI وموجة من الشركات الناشئة في مجال الكلام على نفس حالة الاستخدام اليومي.
يتناسب الإطلاق مع امتداد مزدحم بشكل ملحوظ لخط طراز Google؛ تُظهر تغطية [أحدث تطورات الذكاء الاصطناعي] (https://aibuzzwire.news) أن الشركة قد شحنت منتجاتها بشكل متكرر في غضون بضعة أسابيع وهي تحارب المنافسين على التسعير والترميز والآن الصوت.
مصمم للمحادثة في الوقت الفعلي
ما يميز النماذج المباشرة عن نماذج الدردشة القياسية المزودة بميكروفون متصل هو زمن الاستجابة والحالة. تصف وثائق Live API من Google واجهة ذات زمن وصول منخفض تعالج التدفقات المستمرة من الصوت والصور والنصوص عبر اتصال WebSocket سليم، وتقبل صوت PCM الخام بسرعة 16 كيلو هرتز، وصور JPEG بمعدل يصل إلى إطار واحد في الثانية، والنص، وتعيد الصوت المنطوق في الوقت الفعلي.
تقوم النماذج بمعالجة الإدخال المرئي في الوقت الفعلي تقريبًا، مما يسمح للمساعد برؤية ما يراه المستخدم - تُظهر مقاطع الفيديو التوضيحية من Google برنامج Gemini 3.8 Live وهو يوجه جلسة تأهيل الموظف باستخدام السياق المرئي، ويلعب الشطرنج في الوقت الفعلي تقريبًا، ويبني خطط عمل كاملة وأدوات تسويق مخصصة من خلال الكلام الطبيعي. يمكن للنماذج أيضًا اكتشاف 97 لغة مدعومة والانتقال بينها تلقائيًا، في منتصف المحادثة، دون الحاجة إلى تبديل الإعدادات بواسطة المستخدم.
ولعل الأمر الأكثر أهمية للاستخدام العملي هو أن النماذج تنفذ الأدوات واستدعاءات واجهة برمجة التطبيقات (API) في الخلفية أثناء استمرار المحادثة، مع الإقرار بالطلبات والحفاظ على استمرار الحوار أثناء انتهاء المهام. يؤدي ذلك إلى تحويل المساعد من مستجيب يعتمد على الأدوار بشكل صارم إلى شيء أقرب إلى الوكيل الذي يصادف أنه يتحدث.
الأرقام التي يروج لها جوجل
تفيد Google أن برنامج Gemini 3.8 Live Extended Thinking حصل على المركز العام الأعلى في مؤشر جودة تحويل الكلام إلى كلام للتحليل الاصطناعي بنتيجة 82.6. عند إكمال مهمة الوكيل، حصلت الشركة على 68.6% في معيار τ-Voice و35.1% في تقييم τ-Voice للخدمات المصرفية في Sierra، إلى جانب درجة 97.7% في Big Bench Audio.
هذه هي الأرقام التي تم الإبلاغ عنها من قبل Google، وسيستغرق التحقق المستقل وقتًا - ولكن المطالبة بأعلى مخطط التحليل الاصطناعي، إذا استمرت، ستضع Google في مقدمة العروض المحسنة للكلام من OpenAI وشركات الذكاء الاصطناعي الصوتية المخصصة من حيث جودة المحادثة الشاملة. وتقول Google أيضًا إن شركة Extended Thinking تحافظ على نقطة سعر تنافسية للغاية، وهي إشارة ضمنية إلى ضغط الأسعار الذي حدد الجيل 3.8.
يتم وضع علامة مائية على كل الصوت الذي تم إنشاؤه بواسطة النماذج باستخدام SynthID، وهي علامة مائية غير محسوسة من Google، لذلك يظل الكلام الناتج عن الذكاء الاصطناعي قابلاً للاكتشاف - وهو ضمان للامتثال والمعلومات الخاطئة الذي أصبح قياسيًا عبر منتجات Google التوليدية.
أين يمكنك استخدامه
ويختلف التوفر بين النموذجين. Gemini 3.8 Live متاح للجميع داخل Search Live، وهو وضع البحث المرئي في الوقت الفعلي من Google. يتوفر Extended Thinking في Gemini Live، وفي Docs لمشتركي Google AI Pro وUltra من خلال Workspace، وفي Gmail وKeep لجميع مستخدمي Google.
يحصل المطورون على النماذج من خلال Gemini API وGoogle AI Studio، وتقول Google إن Live API تستخدم بالفعل من قبل منصات بما في ذلك Agora وFishjam وLiveKit وPipcat وVercel وVision Agents لبناء واجهات تعتمد على الصوت فوق البنية التحتية لـ Google في الوقت الفعلي. تم تسمية Salesforce وGenspark وLumeris كشركاء إطلاق للنماذج الجديدة.
سوق الذكاء الاصطناعي الصوتي المزدحم
أصبح الصوت ساحة معركة الواجهة لعام 2026 لأنه المكان الذي يهرب فيه الذكاء الاصطناعي أخيرًا من لوحة المفاتيح. النموذج الذي يمكنه الرؤية والاستماع وتبديل اللغات وتشغيل الأدوات أثناء التحدث لا يتنافس مع برامج الدردشة الأخرى ولكن مع المكالمة الهاتفية وخط دعم العملاء والمساعد الشخصي.
ميزة Google هي التوزيع: حيث يمنح كل من البحث وAndroid وWorkspace وChrome النماذج المباشرة قاعدة مثبتة لا يمكن لأي منافس أن يضاهيها. تراهن الشركة على أن التواجد في كل ركن من أركان يوم المستخدم - الآن مع أفضل نماذجها الصوتية - سيكون أكثر أهمية من أي فوز معياري واحد. سيحصل المنافسون على فرصتهم للرد، لكن جوجل أوضحت أن الصوت، الذي كان في السابق ميزة تجريبية، أصبح الآن خط إنتاج من الدرجة الأولى.
بالنسبة للمطورين، الرسالة مباشرة بالمثل. من خلال نشر تنسيقات الإدخال الدقيقة، وتوثيق تنفيذ أداة الخلفية، وزرع النظام البيئي باستخدام منصات Live API، تحاول Google جعل مجموعتها هي الركيزة الافتراضية لأي شخص يقوم ببناء واجهات منطوقة - بدءًا من روبوتات دعم العملاء إلى المساعدين الذين يمكن ارتداؤهم. سواء كانت ادعاءات الجودة الخاصة بـ Gemini 3.8 Live صامدة في ظل الاختبار المستقل، فإن عملية التوفر قيد التنفيذ بالفعل.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →