OpenAI は、同時に聞くことと話すことができる ChatGPT の新しい音声モデル シリーズである GPT-Live を開始しました。これは、同社のこれまでの会話音声エクスペリエンスの最も重要な見直しを示しています。このリリースでは、OpenAI が全二重アーキテクチャと呼ぶものを使用しており、ユーザーは、実際の電話のように感じられると同社が言う方法で、アシスタントに割り込んだり、話しかけたり、会話したりすることができる。
この発表は、OpenAI による今週の GPT-5.6 モデル ファミリーの広範な展開と並行して行われ、音声インターフェイスに関する AI ニュース速報 を、機械に命令するというよりも人とチャットするようなものにするための推進を表しています。
GPT-Live の違い
従来の音声アシスタントは半二重モードで動作します。つまり、話し、話しを止めると、システムが要求を処理して応答します。ターンテイクは厳格です。 GPT-Live は、全二重 音声処理によってそのパターンを打破します。つまり、モデルは会話中でもあなたの声を聞くことができます。これにより、自然な中断、文の途中での修正、重複した会話が可能になります。これは、人間にとっては当然のことですが、音声 AI は歴史的に苦労してきた種類のやり取りです。
ロイター によると、GPT-Live モデルは音声を聞きながら同時に話すことができ、これは音声 AI 分野の長年の目標であった機能です。このアプローチにより、ChatGPT の音声モードの以前のバージョンを定義していた厄介な一時停止や強制的な交代が解消されます。注目すべき技術的な詳細: GPT-Live は複雑な質問に遭遇すると、それらをバックグラウンドで GPT-5.5 に渡します。音声モデルは会話の流れをリアルタイムで処理し、より大きな推論モデルは舞台裏でより困難なタスクに取り組み、回答をフィードバックします。 OpenAI によれば、この分業により、リアルタイムの会話が自然に感じられる応答性を損なうことなく、応答品質が大幅に向上します。
在庫状況と価格
OpenAI は、新しい音声モデルを 2 つの層で展開しています。
- GPT-Live-1 — フル モデル。有料の ChatGPT 加入者 (Plus、Pro、および Team プラン) が現在利用可能です。
- GPT-Live-1 mini — 無料の ChatGPT アカウントで利用できる、小型で軽量のバージョン。
OpenAI によると、API アクセス が間もなく提供され、開発者は全二重音声を独自のアプリケーションに組み込むことができるようになります。同社はまだAPIの詳細な価格を公表していない。
このリリースにより、ウェブ検索も音声会話に直接導入されます。 Search Engine Journal が報じたように、GPT-Live はライブ検索を ChatGPT 音声に統合するため、ユーザーは現在の出来事や急速に変化する情報について質問し、モードを切り替えることなく最新の Web 結果に基づいた回答を得ることができます。
競争の激しい音声 AI 市場
GPT-Live は、ますます混雑する音声 AI 環境に登場します。 Google は、Gemini を活用した音声機能を Android および Gemini Live 製品全体に推し進めてきましたが、Apple は大規模な言語モデルを中心に Siri を作り直し続けています。 OpenAI の主なライバルである Anthropic は、最近の取り組みを音声よりもエージェント コーディングと推論モデルに重点を置いています。
全二重アプローチは、より広範な業界が向かう方向であると思われます。 GPT-Live は、同時に聞くことと話すことを可能にすることで遅延を短縮し、ユーザーが音声アシスタントに対して抱いていた唯一の最大の不満である待ち時間を解消します。複雑なクエリに対する GPT-5.5 へのハンドオフは、OpenAI が音声を機能をそぎ落としたインターフェイスとしてではなく、最も有能なモデルへの玄関口として捉えていることの表れでもあります。
なぜそれが重要なのか
音声は何年もの間、コマンド駆動の二次的なインターフェイスとして扱われてきました。タイマーの設定や天気の確認には適していますが、微妙な会話にはあまり役に立ちません。 GPT-Live の賭けは、ボトルネックはモデルの知能ではなく、インターフェイス、つまり人間が孤立したバーストで話すことを強制することだということです。
全二重会話が大規模に確実に機能すれば、人々が電話、自動車、スマート スピーカー、そして最終的にはウェアラブル デバイスで AI と対話する方法が変わります。また、常に聞いているデバイスでの同意について、合成音声のリアリズムについて、より自然な会話によってユーザーが AI の回答を過剰に信頼することにつながるのではないかなど、よくある懸念も生じます。
OpenAIは既存のコンテンツポリシーを超えたGPT-Liveの具体的な安全対策については詳しく述べていないが、検索の統合により、このモデルはスクロールバックできるテキストよりもユーザーが批判的に評価するのが難しい可能性のある生の情報を音声に取り込むことができるようになる。
次に何が起こるか
現時点では、GPT-Live は第一に ChatGPT 機能であり、第二に開発者製品です。本当のテストは、サードパーティ アプリ、カスタマー サービス プラットフォーム、ハードウェア メーカーが自社製品に全二重会話を組み込むことができるとき、API アクセスによって実現します。そのとき、OpenAI は、より安価なオープンソース音声モデルや、その機能に対抗しようとする競合他社からの価格圧力に直面することになります。
GPT-5.6 の一般リリースとの同時リリースは、OpenAI が音声と推論を同じ戦略の 2 つの部分、つまり、思考する強力なモデルと、同僚のように会話できるインターフェイスとを組み合わせたものと見なしていることを示唆しています。
AI の一歩先を行く
モデルのリリース、音声 AI、業界を形作るあらゆるものを継続的に取り上げるには、AI Buzz Wire で最新の AI 開発をフォローしてください。
AI ニュースをもっと読む→



