گوگل Live Avatar را معرفی کرده است، قابلیت جدیدی برای Gemini 3.8 Live که به هوش مصنوعی مکالمه ای این شرکت چهره ویدیویی تقریباً واقعی می دهد. گوگل در اعلامیه رسمی خود که توسط WERSM به تفصیل توضیح داده شده است، این ویژگی را به عنوان یک عامل سازمانی ارائه میکند که میتواند در عین حفظ شخصیت بصری پویا، گوش دهد، ببیند و صحبت کند - که از طریق Gemini Enterprise، ارائهدهنده هوش مصنوعی تجاری این شرکت در دسترس است.
این عرضه تقریباً یک هفته است که پوشش داده شده است: رسانه های صنعتی اواخر هفته گذشته شروع به گزارش ویژگی حضور بصری در Gemini 3.8 Live کردند و Deccan Herald این خبر را روز دوشنبه بیشتر کرد و خاطرنشان کرد که این ویژگی "روی چت ربات هوش مصنوعی قرار می دهد". برای کسبوکارهایی که [ابزارها و دستیاران هوش مصنوعی] (https://aibuzzwire.news) را ارزیابی میکنند، این اعلامیه نشان میدهد که هوش مصنوعی محاورهای سازمانی به کجا میرود: کمتر یک پنجره چت، بیشتر یک نماینده سرویس همیشه روشن.
آنچه Live Avatar در واقع انجام می دهد
Live Avatar ترکیبی از تولید ویدئو در زمان واقعی با قابلیتهای گفتگوی زنده Gemini است. گوگل همگامسازی دقیق لب، عبارات طبیعی و چرخش روان را برجسته میکند - مکانیکی که باعث میشود سر صحبتکننده به جای عجیب و غریب، حضور داشته باشد.
اما جزئیات بیشتر در پشت صورت می نشیند. بر اساس اعلامیه:
- ورودی چندوجهی همزمان. عامل می تواند ورودی های بصری و صوتی را همزمان پردازش کند، نه اینکه آنها را به عنوان چرخش جداگانه مدیریت کند.
- تماس های ابزار ناهمزمان. آواتار زنده می تواند در حالی که مکالمه ادامه دارد اطلاعات را در پس زمینه واکشی کند. مثال گوگل چک-این هتل است، که در آن نماینده یک کار پیچیده را انجام می دهد بدون اینکه مهمان را به حالت بارگیری خیره کند.
- پوشش 97 زبانی. گوگل می گوید که آواتار می تواند بین 97 زبان حرکت کند در حالی که همگام سازی لب و عبارات را بدون جابجایی قابل مشاهده تطبیق می دهد - همان نماینده مارک دار که هویت ثابتی را در سراسر بازارها دارد و در عین حال تحویل گفتاری خود را تغییر می دهد.
این آخرین نکته ممکن است از نظر تجاری مهم ترین ویژگی باشد. یک ربات چت معمولی باعث می شود کاربر منتظر پاسخ باشد. یک آواتار زنده برای حفظ تعامل در حالی که سیستم در زیر کار می کند طراحی شده است. چهره تداوم ایجاد می کند، اما رفتار زیربنایی به یک گردش کار سرویس نزدیک تر است که اتفاقاً مکالمه باقی می ماند.
از ربات چت تا حضور برند
فریمبندی گوگل از برندها میخواهد که کاری بیش از فعال کردن یک جابجایی انجام دهند. شرکتهایی که آواتار زنده را به کار میگیرند دعوت میشوند تا یک شخصیت طراحی کنند - هویت بصری، شیوه صحبت، شخصیتی که مشتریانشان در نقاط تماس و زبانها تشخیص میدهند.
این امر هوش مصنوعی سازمانی را از ابزاری که کاربران تحمل میکنند به حضوری که کاربران با آن ارتباط برقرار میکنند تغییر میدهد، و تصمیمات طراحی - ظاهر نماینده، واکنشهایش، زمانی که لبخند میزند - مطابق با کیفیت مدل در زیر آن قرار میگیرد. همچنین خطر ثبات را افزایش میدهد: آواتاری که در زبانها با خود در تضاد است، یا در کانالهای مختلف رفتار متفاوتی دارد، اعتمادی را که چهره قرار است ایجاد کند، تضعیف میکند.
در حال حاضر، ابتدا سازمانی
طبق گزارشهای متعدد، در دسترس بودن اولیه محدود به Gemini Enterprise است و Google جدول زمانی برای عرضه به مصرفکننده اعلام نکرده است. این ویژگی Live Avatar را در یک الگوی آشنا برای ویژگیهای هوش مصنوعی Google قرار میدهد: محصولات تجاری ابتدا ارسال میشوند، جایی که استقرار کنترل میشود و درآمدزایی مستقیم است، قبل از اینکه قابلیتها به دستیار عمومی برسد.
رویکرد اول سازمانی همچنین آنچه را که ویژگی میخواهد منعکس میکند. تولید ویدیوی بیدرنگ که در بالای گفتگوی زنده قرار میگیرد، از نظر محاسباتی گران است، و بارهای کاری سازمانی - میزهای خدمات مشتری، جریانهای رزرو، کیوسکهای حضوری - با محدودههای تعریفشدهای عرضه میشوند که در آن میتوان هزینه را در مقابل زمان تعویض یا افزایش کارکنان توجیه کرد.
معادله اعتماد
چهره چیزی را که کاربران متوجه می شوند و آنچه را که می بخشند تغییر می دهد. تاکید گوگل بر همگامسازی دقیق لبها، عبارات طبیعی و چرخش روان نیست: اینها دقیقاً درزهایی هستند که یک شخصیت مصنوعی در آن شکسته میشود و کاربران به مراتب سریعتر از تشخیص یک جمله بیحرکت یک واکنش تاخیری یا یک بیان به موقع را تشخیص میدهند.
که هر دو راه را برای مشاغل کاهش می دهد. یک آواتار که به خوبی اجرا شده باشد، میتواند احساس حضور در یک سرویس خودکار را ایجاد کند. اجرای ضعیف می تواند همان اتوماسیون را فریبنده کند - چهره ای که توجهی را به نمایش می گذارد که سیستم اصلی آن را ندارد. ابزار ناهمزمانی که گوگل تشریح میکند، از این نظر، یک مکانیسم اعتماد نیز هستند: آواتار مکالمه را در حالی که سیستم کار میکند بهطور آشکار زنده نگه میدارد، نه اینکه وانمود کند که پاسخ از قبل آماده است.
شرکتهایی که آواتار زنده را به کار میگیرند، به طور مؤثر بر اساس طراحی رقص مورد قضاوت قرار میگیرند – اینکه شخص چگونه مکثها، اصلاحات و وقفهها را مدیریت میکند. این اعلامیه حاکی از آن است که گوگل آن لحظات را بهعنوان مشکلات اصلی مهندسی تلقی کرده است تا صیقل دادن، که این همان چیزی است که هر استقرار با مشتری نیاز دارد.
چرا مهم است
دستیارهای صوتی هوش مصنوعی را مکالمه کردند. آواتارها آن را نمایشی می کنند. اگر آواتار زنده همانطور که توضیح داده شد عمل کند - دید و صدا همزمان، استفاده از ابزار پسزمینه، همگامسازی چند زبانه - رابط هوش مصنوعی سازمانی دیگر یک جعبه متن نیست و تبدیل به شخصیتی میشود که یک شرکت کنترل میکند.
سوال باز این است که: آیا کسبوکارها واقعاً میخواهند هوش مصنوعی آنها چهره داشته باشد یا اینکه این ویژگی به عنوان یک نمایشدهنده نمایشی باقی میماند. گوگل روی اولی شرط بندی کرده است. با 97 زبان و استفاده از ابزار پسزمینه داخلی، این شرکت این کار را برای برندهای جهانی آسان کرده است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →