Google は、Gemini 3.8 Live および Gemini 3.8 Live Extended Thinking を発表しました。これは、同社が自然音声会話向けで最も先進的であると説明する 2 つのライブ対話モデルです。このモデルは 9 月 15 日に Gemini API、Google AI Studio、Search Live、Gemini Live、Google Workspace で展開を開始し、Gemini Enterprise を通じてプライベート プレビューでエンタープライズ アクセスが可能になりました。

この発表は、Gemini オーディオ チームを代表して主任エンジニアの Tom Ouyang と技術スタッフのメンバーである Malini Jaganathan によって行われました。これは、今月初めに Flash および Flash Cyber​​ モデルでデビューした Gemini 3.8 ファミリを拡張するもので、リアルタイムのマルチモーダル音声支援、つまり OpenAI の音声モードと音声スタートアップの波が同じ日常使用ケースをめぐって競争している市場への、Google のこれまでで最も積極的な取り組みを示しています。

今回の発表は、Google のモデルラインが著しく混雑している時期に適合する。 最新の AI 開発 の報道によると、同社は価格、コーディング、そして音声に関して競合他社と戦いながら、数週間の間に出荷を繰り返していることがわかります。

リアルタイム会話用に構築

Live モデルとマイクが接続された標準のチャット モデルの違いは、遅延と状態です。 Google の Live API ドキュメントには、ステートフルな WebSocket 接続を介してオーディオ、画像、テキストの連続ストリームを処理し、生の 16kHz PCM オーディオ、最大 1 フレーム/秒の JPEG 画像、およびテキストを受け入れ、音声をリアルタイムで返す低遅延インターフェイスについて説明されています。

モデルは視覚入力をほぼリアルタイムで処理し、ユーザーが見ているものをアシスタントが確認できるようにします。Google のデモ ビデオでは、Gemini 3.8 Live がビジュアル コンテキストを使用して従業員のオンボーディング セッションをガイドし、ほぼリアルタイムでチェスをプレイし、自然音声を通じて完全なビジネス プランとカスタム マーケティング ツールキットを構築する様子を示しています。このモデルは、ユーザーが設定を切り替えることなく、会話中にサポートされている 97 言語を自動的に検出して切り替えることもできます。

おそらく実用上最も重要なのは、モデルが会話の継続中にバックグラウンドでツールと API 呼び出しを実行し、リクエストを承認し、タスクが終了するまで対話を継続することです。これにより、アシスタントは厳密なターンベースの回答者から、たまたま話すエージェントに近いものに変わります。

Google が宣伝している数字

Google の報告によると、Gemini 3.8 Live Extended Thinking は、Artificial Analysis の Speech-to-Speech Quality Index でスコア 82.6 を獲得し、総合トップの座を獲得しました。エージェント タスクの完了に関して、同社は、Big Bench Audio の 97.7% スコアと並んで、τ-Voice ベンチマークで 68.6%、Sierra の τ-Voice-banking 評価で 35.1% を挙げています。

これらはGoogle自身が報告した数字であり、独立した検証には時間がかかるだろうが、人工分析チャートのトップへの主張が維持されれば、Googleは全体的な会話品質において、OpenAIや音声AI専用企業が提供する音声最適化製品よりも優位に立つことになるだろう。 Googleはまた、Extended Thinkingが非常に競争力のある価格帯を維持しているとも述べており、これは3.8世代を特徴づけた価格圧力への暗黙の了解であるとしている。

モデルによって生成されたすべての音声には、Google の知覚できない透かしである SynthID の透かしが入れられているため、AI によって生成された音声は引き続き検出可能です。これは、Google の生成製品全体で標準になりつつあるコンプライアンスと誤情報の保護手段です。

Where You Can Use It

2 つのモデル間で入手可能性が異なります。 Gemini 3.8 Live は、Google のリアルタイム ビジュアル検索モードである Search Live 内で誰でも利用できます。 Extended Thinking は、Gemini Live、Google AI Pro および Ultra 購読者向けの Workspace 経由のドキュメント、およびすべての Google ユーザー向けの Gmail と Keep で利用できます。

開発者はGemini APIとGoogle AI Studioを通じてモデルを取得しており、Googleによると、Live APIはすでにAgora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agentsなどのプラットフォームで使用されており、Googleのリアルタイムインフラ上に音声駆動インターフェースを構築しているという。 Salesforce、Genspark、Lumeris が新モデルの発売パートナーとして指名されています。

混雑した音声 AI 市場

音声は、AI がついにキーボードから逃れる場所であるため、2026 年のインターフェイスの戦場になりつつあります。会話中に見たり、聞いたり、言語を切り替えたり、ツールを実行したりできるモデルは、他のチャットボットではなく、電話、カスタマー サポート ライン、パーソナル アシスタントと競合します。

Google の利点は配信です。検索、Android、Workspace、Chrome により、Live モデルには競合他社が匹敵するようなインストール ベースが得られません。同社は、最高の音声モデルを使用して、ユーザーの一日の隅々に存在することが、単一のベンチマークでの勝利よりも重要になると賭けています。ライバルたちも対抗するチャンスを得るだろうが、Googleはかつてはデモ機能だった音声が今では一流の製品ラインになっていると明言している。

開発者にとっても、メッセージは同様に直接的です。 Google は、正確な入力形式を公開し、バックグラウンド ツールの実行を文書化し、Live API プラットフォームでエコシステムをシードすることで、自社のスタックを、カスタマー サポート ボットからウェアラブル アシスタントに至るまで、音声インターフェイスを構築するすべての人にとってのデフォルトの基盤にしようとしています。 Gemini 3.8 Live の品質に関する主張が独立したテストで維持されるかどうかはわかりませんが、可用性への取り組みはすでに始まっています。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→