Google は、リアルタイム文字起こし用に構築された新しい音声テキスト変換モデルである Gemini 3.5 Transcribe を発表しました。このモデルは、85 を超える言語を自動的に認識し、途中で出力を磨き上げ、つなぎ言葉を削除し、質問されずに言葉のつまずきを修正します。

この発表により、Google のスピーチ スタックは、急速に成長する文字起こし市場における直接の挑戦者として位置付けられます。この市場では、開発者が通話、会議、キャプション、音声インターフェイスにどのサービスを採用するかが精度と遅延によってますます決定されています。 この件の詳細は、AIニュースをご覧ください。

モデルでできること

The Decoder が報道した Google の発表によると、Gemini 3.5 Transcribe は、話し言葉をテキストに変換するだけではありません。

  • 85 以上の言語にわたる自動言語検出、構成は不要
  • つなぎ言葉の削除、「えーっと」、「あのー」、および同様の矛盾を解消します
  • 失言を修正、逐語的なノイズではなく読みやすい散文を生成します
  • 自律的なテキスト書式設定 (句読点や構造を含む)

同社は、ストリーミング音声で 4.0 パーセント、録音音声で 2.6 パーセントの単語エラー率を報告しており、前世代の Chirp 3 と比較して遅延が約 70 パーセント削減*されており、遅延によって会話が中断されるライブ キャプション シナリオでは大幅なマージンが得られます。

2 つのジョブに対する 2 つのインターフェース

開発者は、次の 2 つの異なるアプリケーション プログラミング インターフェイスを通じてアクセスできます。

ライブ API — `gemini-3.5-transcribe-live`

非常に低い遅延でリアルタイム ストリーミングを処理し、応答時間が最も重要なライブ キャプション、音声エージェント、対話型アシスタントをターゲットにします。

インタラクション API — `gemini-3.5-transcribe`

録音された音声を処理し、話者の属性とタイムスタンプを含むトランスクリプトを返します。これは、会議、インタビュー、ポッドキャスト、メディアのポストプロダクションに一般的なワークフローです。

このモデルは文字起こし以外にも、関数呼び出しをサポートしています。つまり、フォローアップ タスクを Gemini ファミリーの他のモデルに委任できます。たとえば、セッション中の発言に基づいて画像生成リクエストや Web 検索をトリガーできます。これにより、トランスクリプト エンジンが、音声駆動型アプリケーションの制御可能なインターフェイス層に変わります。

すでに Google サービス全体で出荷されています

このモデルは現在、Google AI Studio と開発者向けの Gemini Enterprise Agent Platform で公開されています。 Google はまた、これを消費者向けサーフェスにも接続しています。Android 上の Gboard は、Rambler と呼ばれる内部コンポーネントを介してディクテーションにこれを使用し、macOS 上の Gemini アプリ はそれを音声入力に適用し、Chrome 統合もこれに続く予定です。

その配分が重要です。音声認識はその規模を維持しており、モデルをキーボード、デスクトップ アプリ、ブラウザに組み込むことで、毎日何十億もの入力インタラクションにさらされると同時に、アクセント、方言、騒がしい環境全体でエラー率を下げるために必要な評価ループに供給されます。

音声 AI における競争上の利害

転写は、フロンティアラボと専門ベンダーの間で密かに競争の場となっています。正確で低遅延の音声理解は、音声コマンド、エンタープライズ会議インテリジェンス、アクセシビリティ機能、および多言語カスタマー サービス自動化に基づいて動作するエージェント製品への入り口です。

Google は、積極的なレイテンシーの改善と自己修正出力を組み合わせることで、開発者が生の音声キャプチャではなく、編集されたテキストのように読めるトランスクリプトを好むようになることに賭けています。つまり、厳密な逐語的忠実性と引き換えに使いやすさを追求しているのです。法律や医療の転記者など、正確な記録を必要とするチームは、依然として逐語的モードを望むかもしれません。他の人たちにとって、人の話を聞くことと理解することとの間の実質的な差は縮まり続けています。

Gemini 3.5 Transcribe が AI Studio およびエンタープライズ ツールで一般提供されるようになったことで、最初の意味のあるテストは、音声エージェント開発者からの採用指標になります。この市場セグメントは急速に成長しており、精度の向上がかなりの規模の切り替えの決定につながるほどです。

レイテンシが本当の戦場である理由

エラー率が大きく取り上げられますが、どの製品が実行可能であるかはレイテンシによって静かに決まります。ライブ キャプション オーバーレイを供給する文字起こしエンジンは、会話のペースに合わせる必要があり、そうしないと視聴者が離れてしまいます。カスタマー サポート コールの交渉を行う音声エージェントは、音声レイヤーが追いつくまでの間、ぎこちなく一時停止することはできません。 Google が報告した Chirp 3 と比較した遅延の 70% 削減は、まさにそのギャップ、つまり話者が文を終えてからそれに対応する下流システムとの間の距離を縮めることをターゲットとしています。

エージェント アプリケーションの場合、これはさらに複雑になります。音声対話のすべてのターンには、認識、推論、および応答が含まれます。認識段階からミリ秒を短縮することで、会話のタイミング バジェットを侵害することなく、より有能で低速な推論モデルに費やす余裕が構築者に与えられます。

文字通りのトレードオフ

デザインの選択の 1 つは精査に値します。デフォルトでは、Gemini 3.5 Transcribe は出力を厳選します。つまり、つなぎ言葉が消え、つまずきが修正され、書式設定が自動的に適用されます。ほとんどのビジネス用途(議事録、キャプション、検索可能なアーカイブ)にとって、それはまさにユーザーが望んでいることです。

ただし、特定のワークフローは逐語的記録に依存します。法的証言録取、コンプライアンス審査、ジャーナリズムの事実確認では、ためらうことも含めて、何が発言されたのかを正確に知る必要がある場合があります。規制された業界の組織は、機密性の高いパイプラインを新しいモデルに移行する前に、どの程度の平滑化がオプションで構成可能であるかを明確にする必要があります。 Google のドキュメントと API パラメータは、業界にとって文字通りの境界線と洗練された境界線の位置を効果的に設定します。

堀としての多言語の足跡

自動検出による 85 以上の言語のカバーは、単なる機能チェックリストの項目ではありません。多言語対応は、競合他社が歴史的に遅れをとっている市場に価値を集中させます。地域的なアクセント、文の途中で言語間のコード切り替え、およびリソースの少ない言語はすべて、英語中心のコーパスで狭い範囲でトレーニングされたモデルを罰します。

数十ヶ国にわたってサポート センターを運営しているグローバル企業にとって、言語検出を処理する単一のモデルにより統合の複雑さが透過的に軽減され、市場ごとの多数の構成ではなく 1 つのパイプラインが使用されます。 Gboard の何十億もの Android インストールによる配布と組み合わせて、Google は文字起こし品質の多言語対応をプレミアム機能ではなくインフラストラクチャとして位置付けています。

何を見るべきか

Gemini 3.5 Transcribe が市場シェアを変えるのか、それとも単に期待を高めるだけなのかを示す 3 つのシグナルがあります。競合他社が精度の主張ではなく、待ち時間の数値をどれだけ早く一致させるか。そして、関数呼び出しフックが Gemini 上でネイティブに構築された音声ファースト エージェントの波を生み出すかどうか。このリリースは現在公開されており、AI Studio を介した価格帯により実験が十分に安くなり、スイッチング コストがほぼゼロになるはずです。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →