Google は、同社の会話型 AI にほぼリアルタイムのビデオ顔を提供する Gemini 3.8 Live の新機能である Live Avatar を導入しました。 WERSM で詳しく説明されている公式発表の中で、Google はこの機能を、同社のビジネス AI 製品である Gemini Enterprise を通じて利用できる、動的なビジュアル ペルソナを維持しながら聞いたり、見たり、話したりできるエンタープライズ エージェントとして紹介しています。
この展開は約 1 週間にわたって報道を集めてきた。業界メディアは先週後半に Gemini 3.8 Live のビジュアル プレゼンス機能について報道し始め、月曜日には Deccan Herald がこのニュースをさらに伝え、この機能が「AI チャットボットに顔を与える」と指摘した。 AI ツールとアシスタント を評価している企業にとって、この発表はエンタープライズ会話型 AI がどこに向かっているのかを示しています。チャット ウィンドウではなく、常時接続のサービス担当者です。
Live Avatar が実際に行うこと
Live Avatar は、ほぼリアルタイムのビデオ生成と Gemini のライブ対話機能を組み合わせています。 Google は、正確な口パク、自然な表現、滑らかなターンテイクを強調しています。これらは、話す人に不気味さではなく存在感を与える仕組みです。
しかし、より重要な詳細は顔の裏側にあります。発表によると:
- 同時マルチモーダル入力 エージェントは、ビジュアル入力とオーディオ入力を別々のターンとして処理するのではなく、同時に処理できます。
- 非同期ツール呼び出し ライブ アバターは、会話を続けながらバックグラウンドで情報を取得できます。 Google の例はホテルのチェックインです。この場合、エージェントはゲストを読み込み中の状態で見つめ続けることなく、複雑なタスクを処理します。
- 97 言語をカバー。 Google によると、アバターは口パクや表現に目に見えるズレを生じさせることなく 97 言語間を移動できるという。つまり、同じブランドのエージェントが、音声での伝え方を変えながら、市場全体で一貫したアイデンティティを保持しているということだ。
最後の点は、この機能の商業的に最も重要な点かもしれません。従来のチャットボットは、ユーザーを応答を待たせます。ライブ アバターは、システムがその下で動作している間、インタラクションを動かし続けるように設計されています。顔は連続性を生み出しますが、その根底にある動作は、たまたま会話的なままであるサービス ワークフローに近いものです。
チャットボットからブランドプレゼンスへ
Google の枠組みでは、ブランドに対し、切り替えを有効にする以上のことを求めています。 Live Avatar を展開する企業は、タッチポイントや言語を超えて顧客が認識できるビジュアル アイデンティティ、話し方、ペルソナなどのキャラクターをデザインするよう求められています。
これにより、エンタープライズ AI は、ユーザーが許容する実用的なものから、ユーザーが関係する存在へと変化し、エージェントがどのように見えるか、どのように反応するか、いつ笑うかといった設計上の決定が、根底にあるモデルの品質と同じ立場に置かれます。また、一貫性に対するリスクも高まります。アバターが言語間で矛盾したり、チャネルごとに異なる動作をしたりすると、その顔が構築するはずだった信頼が損なわれてしまいます。
今のところエンタープライズファースト
複数のレポートによると、初期の提供は Gemini Enterprise に限定されており、Google は消費者向け展開のスケジュールを発表していません。これにより、Live Avatar は Google の AI 機能のよく知られたパターンに組み込まれます。つまり、機能がパブリック アシスタントに届く前に、ビジネス製品が最初に出荷され、展開が制御され、収益化が直接行われます。
エンタープライズファーストのアプローチは、機能の要求も反映しています。ライブ対話の上に重ねられるリアルタイムビデオ生成は計算コストが高く、顧客サービスデスク、予約フロー、対面キオスクなどの企業のワークロードには、スタッフの補充や増強にかかる時間に対してコストを正当化できる範囲が定義されています。
信頼の方程式
顔によって、ユーザーが気づくものと許すものが変わります。 Google が正確な口パク、自然な表現、流れるようなターンテイクを重視しているのは表面的なものではありません。これらはまさに人工的なペルソナが壊れる継ぎ目であり、ユーザーは堅苦しい文章に気づくよりも、反応の遅れやタイミングの誤りに気づくほうがはるかに早いのです。
これは企業にとって双方の道を切り開くことになります。適切に実行されたアバターは、自動化されたサービスに参加していると感じさせることができます。実行が不十分だと、同じオートメーションが欺瞞的に感じられる可能性があります。つまり、基盤となるシステムが持たない注意を顔が実行しているように感じられます。 Google が説明する非同期ツール呼び出しは、その意味では信頼メカニズムでもあります。アバターは、すでに答えが用意されているふりをするのではなく、システムが動作している間、目に見えて会話を継続します。
Live Avatar を導入する企業は、振り付け、つまりペルソナが一時停止、修正、中断をどのように処理するかによって実質的に評価されます。この発表は、Google がこれらの瞬間を磨きをかけるのではなく、中核的なエンジニアリング上の問題として扱ってきたことを示唆しており、顧客向けの展開にはそれが求められます。
なぜそれが重要なのか
音声アシスタントにより AI が会話可能になりました。アバターはそれをプレゼンテーションにします。 Live Avatar が、視覚と音声の同期、バックグラウンド ツールの使用、多言語リップシンクなど、説明どおりに機能すれば、エンタープライズ AI のインターフェイスはテキスト ボックスではなくなり、企業が制御するキャラクターになり始めます。
未解決の問題は採用です。企業が実際に AI に顔を持つことを望んでいるのか、それともその機能がデモフロアの目玉にとどまっているのかということです。 Googleは前者に賭けている。 97 の言語とバックグラウンド ツールの使用が組み込まれているため、同社は世界的なブランドを簡単に見つけられるようにしています。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→