طرحت Google Live Avatar، وهي قدرة جديدة لـ Gemini 3.8 Live والتي تمنح الذكاء الاصطناعي التحادثي للشركة وجه فيديو في الوقت الفعلي تقريبًا. في إعلانها الرسمي، الذي تم وصفه بالتفصيل بواسطة WERSM، تقدم Google الميزة كوكيل مؤسسي يمكنه الاستماع والرؤية والتحدث مع الحفاظ على شخصية مرئية ديناميكية - متاحة من خلال Gemini Enterprise، وهو عرض الذكاء الاصطناعي للأعمال الخاص بالشركة.
تم إطلاق التغطية لمدة أسبوع تقريبًا: بدأت منافذ الصناعة في الإبلاغ عن ميزة الحضور المرئي في Gemini 3.8 Live أواخر الأسبوع الماضي، ونشرت Deccan Herald الأخبار يوم الاثنين، مشيرة إلى أن الميزة "تضع وجهًا على برنامج الدردشة الآلي الذي يعمل بالذكاء الاصطناعي". بالنسبة للشركات التي تقوم بتقييم أدوات الذكاء الاصطناعي والمساعدين، يشير الإعلان إلى الاتجاه الذي يتجه إليه الذكاء الاصطناعي التحادثي للمؤسسة: أقل من نافذة الدردشة، وأكثر من ذلك ممثل الخدمة الدائم.
ما يفعله Live Avatar بالفعل
يجمع Live Avatar بين إنشاء الفيديو في الوقت الفعلي تقريبًا وإمكانيات الحوار المباشر في Gemini. يسلط Google الضوء على المزامنة الدقيقة للشفاه، والتعبيرات الطبيعية، وتمثيل الأدوار بشكل سلس - وهي الآليات التي تجعل الرأس الناطق يبدو حاضرًا وليس غريبًا.
لكن التفاصيل الأكثر أهمية تكمن وراء الوجه. وبحسب الإعلان:
- الإدخال المتزامن متعدد الوسائط. يمكن للوكيل معالجة المدخلات المرئية والصوتية في نفس الوقت، بدلاً من التعامل معها كدورات منفصلة.
- استدعاءات الأداة غير المتزامنة. يمكن لـ Live Avatar جلب المعلومات في الخلفية أثناء استمرار المحادثة. مثال Google هو تسجيل الوصول إلى الفندق، حيث يتعامل الوكيل مع مهمة معقدة دون ترك الضيف يحدق في حالة التحميل.
- تغطية بـ 97 لغة. تقول Google إن الصورة الرمزية يمكنها التنقل بين 97 لغة مع تكييف مزامنة الشفاه والتعبيرات دون انحراف واضح - نفس الوكيل الذي يحمل العلامة التجارية يحمل هوية متسقة عبر الأسواق مع تغيير طريقة توصيله المنطوقة.
قد تكون هذه النقطة الأخيرة هي الأكثر أهمية تجاريًا لهذه الميزة. روبوت الدردشة التقليدي يجعل المستخدم ينتظر الإجابة؛ تم تصميم Live Avatar للحفاظ على حركة التفاعل أثناء عمل النظام بالأسفل. يخلق الوجه الاستمرارية، لكن السلوك الأساسي يكون أقرب إلى سير عمل الخدمة الذي يظل تحادثيًا.
من chatbot إلى حضور العلامة التجارية
يطلب إطار Google من العلامات التجارية القيام بأكثر من مجرد تمكين التبديل. تتم دعوة الشركات التي تنشر Live Avatar لتصميم شخصية - هوية مرئية، وطريقة في التحدث، وشخصية سيتعرف عليها عملاؤها عبر نقاط الاتصال واللغات.
يؤدي ذلك إلى تحويل الذكاء الاصطناعي المؤسسي من أداة مساعدة يتحملها المستخدمون إلى حضور يرتبط به المستخدمون، ويضع قرارات التصميم - كيف يبدو الوكيل، وكيف يتفاعل، ومتى يبتسم - على قدم المساواة مع جودة النموذج تحته. كما أنه يزيد من المخاطر المتعلقة بالاتساق: فالصورة الرمزية التي تناقض نفسها عبر اللغات، أو تتصرف بشكل مختلف على قنوات مختلفة، تقوض الثقة التي من المفترض أن يبنيها الوجه.
المؤسسة أولاً، في الوقت الحالي
يقتصر التوفر الأولي على Gemini Enterprise، وفقًا لتقارير متعددة، ولم تعلن Google عن جدول زمني لطرح المستهلك. وهذا يضع Live Avatar في نمط مألوف لميزات الذكاء الاصطناعي من Google: يتم شحن منتجات الأعمال أولاً، حيث يتم التحكم في النشر ويكون تحقيق الدخل مباشرًا، قبل أن تصل القدرات إلى المساعد العام.
يعكس نهج المؤسسة أولاً أيضًا ما تتطلبه الميزة. يعد إنشاء مقاطع فيديو في الوقت الفعلي بالإضافة إلى الحوار المباشر أمرًا مكلفًا من الناحية الحسابية، كما أن أعباء عمل المؤسسات - مكاتب خدمة العملاء، وتدفقات الحجز، والأكشاك الشخصية - تأتي بنطاقات محددة حيث يمكن تبرير التكلفة مقابل وقت الموظفين الذي تحل محله أو تزيده.
معادلة الثقة
يغير الوجه ما يلاحظه المستخدمون وما يغفرونه. إن تركيز جوجل على المزامنة الدقيقة للشفاه، والتعبيرات الطبيعية، والتناوب السلس ليس أمرًا تجميليًا: فهذه هي على وجه التحديد الطبقات التي تنكسر فيها الشخصية الاصطناعية، ويكون المستخدمون أسرع بكثير في اكتشاف رد الفعل المتأخر أو التعبير في توقيت خاطئ بدلاً من اكتشاف جملة متقنة.
وهذا يقطع الطريقين بالنسبة للشركات. يمكن للصورة الرمزية التي تم تنفيذها بشكل جيد أن تجعل الخدمة الآلية تشعر بالحضور؛ يمكن أن يؤدي التنفيذ السيئ إلى جعل نفس الأتمتة تبدو خادعة - وجه يولي اهتمامًا لا يتمتع به النظام الأساسي. إن استدعاءات الأداة غير المتزامنة التي تصفها جوجل هي أيضًا، بهذا المعنى، آلية ثقة: الصورة الرمزية تحافظ على المحادثة حية بشكل واضح أثناء عمل النظام، بدلاً من التظاهر بأن الإجابة جاهزة بالفعل.
سيتم الحكم على الشركات التي تنشر Live Avatar بشكل فعال بناءً على تصميم الرقصات - كيفية تعامل الشخصية مع التوقفات المؤقتة والتصحيحات والانقطاعات. ويشير الإعلان إلى أن جوجل تعاملت مع تلك اللحظات على أنها مشكلات هندسية أساسية بدلاً من كونها مشاكل تلميع، وهو ما سيتطلبه أي نشر يواجه العميل.
لماذا يهم
جعل المساعدون الصوتيون محادثة الذكاء الاصطناعي؛ الصور الرمزية تجعلها عرضية. إذا كان أداء Live Avatar كما هو موصوف - مشهد وصوت متزامنان، واستخدام أداة الخلفية، ومزامنة الشفاه متعددة اللغات - فستتوقف واجهة الذكاء الاصطناعي للمؤسسة عن كونها مربع نص وتبدأ في كونها شخصية تتحكم فيها الشركة.
والسؤال المفتوح هو التبني: ما إذا كانت الشركات تريد بالفعل أن يكون للذكاء الاصطناعي الخاص بها وجه، أو ما إذا كانت الميزة تظل بمثابة تحفة فنية للعرض التجريبي. جوجل تراهن على الأول. من خلال استخدام 97 لغة وأداة خلفية مدمجة، سهلت الشركة على العلامات التجارية العالمية اكتشاف ذلك.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →