گوگل Live Avatar را معرفی کرده است، قابلیت جدیدی برای Gemini 3.8 Live که به هوش مصنوعی مکالمه ای این شرکت چهره ویدیویی تقریباً واقعی می دهد. گوگل در اعلامیه رسمی خود که توسط WERSM به تفصیل توضیح داده شده است، این ویژگی را به عنوان یک عامل سازمانی ارائه می‌کند که می‌تواند در عین حفظ شخصیت بصری پویا، گوش دهد، ببیند و صحبت کند - که از طریق Gemini Enterprise، ارائه‌دهنده هوش مصنوعی تجاری این شرکت در دسترس است.

این عرضه تقریباً یک هفته است که پوشش داده شده است: رسانه های صنعتی اواخر هفته گذشته شروع به گزارش ویژگی حضور بصری در Gemini 3.8 Live کردند و Deccan Herald این خبر را روز دوشنبه بیشتر کرد و خاطرنشان کرد که این ویژگی "روی چت ربات هوش مصنوعی قرار می دهد". برای کسب‌وکارهایی که [ابزارها و دستیاران هوش مصنوعی] (https://aibuzzwire.news) را ارزیابی می‌کنند، این اعلامیه نشان می‌دهد که هوش مصنوعی محاوره‌ای سازمانی به کجا می‌رود: کمتر یک پنجره چت، بیشتر یک نماینده سرویس همیشه روشن.

آنچه Live Avatar در واقع انجام می دهد

Live Avatar ترکیبی از تولید ویدئو در زمان واقعی با قابلیت‌های گفتگوی زنده Gemini است. گوگل همگام‌سازی دقیق لب، عبارات طبیعی و چرخش روان را برجسته می‌کند - مکانیکی که باعث می‌شود سر صحبت‌کننده به جای عجیب و غریب، حضور داشته باشد.

اما جزئیات بیشتر در پشت صورت می نشیند. بر اساس اعلامیه:

  • ورودی چندوجهی همزمان. عامل می تواند ورودی های بصری و صوتی را همزمان پردازش کند، نه اینکه آنها را به عنوان چرخش جداگانه مدیریت کند.
  • تماس های ابزار ناهمزمان. آواتار زنده می تواند در حالی که مکالمه ادامه دارد اطلاعات را در پس زمینه واکشی کند. مثال گوگل چک-این هتل است، که در آن نماینده یک کار پیچیده را انجام می دهد بدون اینکه مهمان را به حالت بارگیری خیره کند.
  • پوشش 97 زبانی. گوگل می گوید که آواتار می تواند بین 97 زبان حرکت کند در حالی که همگام سازی لب و عبارات را بدون جابجایی قابل مشاهده تطبیق می دهد - همان نماینده مارک دار که هویت ثابتی را در سراسر بازارها دارد و در عین حال تحویل گفتاری خود را تغییر می دهد.

این آخرین نکته ممکن است از نظر تجاری مهم ترین ویژگی باشد. یک ربات چت معمولی باعث می شود کاربر منتظر پاسخ باشد. یک آواتار زنده برای حفظ تعامل در حالی که سیستم در زیر کار می کند طراحی شده است. چهره تداوم ایجاد می کند، اما رفتار زیربنایی به یک گردش کار سرویس نزدیک تر است که اتفاقاً مکالمه باقی می ماند.

از ربات چت تا حضور برند

فریم‌بندی گوگل از برندها می‌خواهد که کاری بیش از فعال کردن یک جابجایی انجام دهند. شرکت‌هایی که آواتار زنده را به کار می‌گیرند دعوت می‌شوند تا یک شخصیت طراحی کنند - هویت بصری، شیوه صحبت، شخصیتی که مشتریانشان در نقاط تماس و زبان‌ها تشخیص می‌دهند.

این امر هوش مصنوعی سازمانی را از ابزاری که کاربران تحمل می‌کنند به حضوری که کاربران با آن ارتباط برقرار می‌کنند تغییر می‌دهد، و تصمیمات طراحی - ظاهر نماینده، واکنش‌هایش، زمانی که لبخند می‌زند - مطابق با کیفیت مدل در زیر آن قرار می‌گیرد. همچنین خطر ثبات را افزایش می‌دهد: آواتاری که در زبان‌ها با خود در تضاد است، یا در کانال‌های مختلف رفتار متفاوتی دارد، اعتمادی را که چهره قرار است ایجاد کند، تضعیف می‌کند.

در حال حاضر، ابتدا سازمانی

طبق گزارش‌های متعدد، در دسترس بودن اولیه محدود به Gemini Enterprise است و Google جدول زمانی برای عرضه به مصرف‌کننده اعلام نکرده است. این ویژگی Live Avatar را در یک الگوی آشنا برای ویژگی‌های هوش مصنوعی Google قرار می‌دهد: محصولات تجاری ابتدا ارسال می‌شوند، جایی که استقرار کنترل می‌شود و درآمدزایی مستقیم است، قبل از اینکه قابلیت‌ها به دستیار عمومی برسد.

رویکرد اول سازمانی همچنین آنچه را که ویژگی می‌خواهد منعکس می‌کند. تولید ویدیوی بی‌درنگ که در بالای گفتگوی زنده قرار می‌گیرد، از نظر محاسباتی گران است، و بارهای کاری سازمانی - میزهای خدمات مشتری، جریان‌های رزرو، کیوسک‌های حضوری - با محدوده‌های تعریف‌شده‌ای عرضه می‌شوند که در آن می‌توان هزینه را در مقابل زمان تعویض یا افزایش کارکنان توجیه کرد.

معادله اعتماد

چهره چیزی را که کاربران متوجه می شوند و آنچه را که می بخشند تغییر می دهد. تاکید گوگل بر همگام‌سازی دقیق لب‌ها، عبارات طبیعی و چرخش روان نیست: اینها دقیقاً درزهایی هستند که یک شخصیت مصنوعی در آن شکسته می‌شود و کاربران به مراتب سریع‌تر از تشخیص یک جمله بی‌حرکت یک واکنش تاخیری یا یک بیان به موقع را تشخیص می‌دهند.

که هر دو راه را برای مشاغل کاهش می دهد. یک آواتار که به خوبی اجرا شده باشد، می‌تواند احساس حضور در یک سرویس خودکار را ایجاد کند. اجرای ضعیف می تواند همان اتوماسیون را فریبنده کند - چهره ای که توجهی را به نمایش می گذارد که سیستم اصلی آن را ندارد. ابزار ناهمزمانی که گوگل تشریح می‌کند، از این نظر، یک مکانیسم اعتماد نیز هستند: آواتار مکالمه را در حالی که سیستم کار می‌کند به‌طور آشکار زنده نگه می‌دارد، نه اینکه وانمود کند که پاسخ از قبل آماده است.

شرکت‌هایی که آواتار زنده را به کار می‌گیرند، به طور مؤثر بر اساس طراحی رقص مورد قضاوت قرار می‌گیرند – اینکه شخص چگونه مکث‌ها، اصلاحات و وقفه‌ها را مدیریت می‌کند. این اعلامیه حاکی از آن است که گوگل آن لحظات را به‌عنوان مشکلات اصلی مهندسی تلقی کرده است تا صیقل دادن، که این همان چیزی است که هر استقرار با مشتری نیاز دارد.

چرا مهم است

دستیارهای صوتی هوش مصنوعی را مکالمه کردند. آواتارها آن را نمایشی می کنند. اگر آواتار زنده همانطور که توضیح داده شد عمل کند - دید و صدا همزمان، استفاده از ابزار پس‌زمینه، همگام‌سازی چند زبانه - رابط هوش مصنوعی سازمانی دیگر یک جعبه متن نیست و تبدیل به شخصیتی می‌شود که یک شرکت کنترل می‌کند.

سوال باز این است که: آیا کسب‌وکارها واقعاً می‌خواهند هوش مصنوعی آن‌ها چهره داشته باشد یا اینکه این ویژگی به عنوان یک نمایش‌دهنده نمایشی باقی می‌ماند. گوگل روی اولی شرط بندی کرده است. با 97 زبان و استفاده از ابزار پس‌زمینه داخلی، این شرکت این کار را برای برندهای جهانی آسان کرده است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →