TechCrunchが報じたように、OpenAIは音声ベースのエージェント機能をChatGPTモバイルアプリに導入し、ユーザーが話すだけで文書の草稿、メールの要約、プレゼンテーションの構築といった実際の作業を開始できると同社が水曜日に発表した。
この展開は、OpenAI が以前デスクトップで提供していたスマートフォンの機能にも拡張され、音声がユーザーが複雑なタスクで AI アシスタントと対話する方法の 1 つとして急速に成長していることから導入されました。
加入者が音声でできること
Plus および Pro の加入者は、ChatGPT モバイル アプリの [作業] タブを使用して、ドキュメントを作成したり、メールの下書きを作成したり、音声で Slack メッセージを要約したりできるようになります。同じ音声ワークフローは、サイトの構築、プレゼンテーションの作成、クラウド ブラウザの使用、ChatGPT の財務領域の掘り下げなど、[作業] タブがすでにサポートしているより重いジョブをカバーします。
Free ユーザーと Go ユーザーは、より狭い範囲のアップデートを取得し、プラグインや接続されたアプリを操作できるようになります。
OpenAIによると、音声会話によりリッチなテキスト出力が生成され、ユーザーは音声モードとテキストモードの間を流動的に移動できるようになるという。おそらく、通勤とデスクトップをやりくりしている人にとって最も実用的な追加機能は、外出先で始めた会話を後でデスクトップ アプリで再開できることです。
GPT-Live からモバイル エージェントへの道
このアップデートは、OpenAI が 7 月に開始したストーリーのモバイル章であり、その際、新しい会話モデルである GPT-Live を立ち上げ、その後それをデスクトップ アプリに接続して、ユーザーが音声で [作業] タブのタスクを完了し、[コーデックス] タブでアプリを構築できるようにしました。水曜日の発表は、同じ音声駆動のタスク実行を電話機にもたらすことでループを終了します。
モバイルの音声エージェントが重要な理由
この変化は、使用パターンの変化を反映しています。複雑なタスクを AI アシスタントに命令するために音声を利用するユーザーが増えており、会議の合間、車内、またはキーボードから離れた場所でも、これらの命令が最も自然に行われるのは電話です。
これまで、ChatGPT の最も強力なエージェント機能はデスクトップ上に存在していました。 ChatGPT でプレゼンテーションを作成したり、複数ステップのリサーチ タスクを実行したりしたいユーザーは、コンピューターに向かって、[作業] タブに指示を入力する必要がありました。モバイル アプリは、その人気にもかかわらず、主に会話の表面でした。水曜日のアップデートはその区別を崩壊させます。電話は、音声チャネルをインターフェースとして、実質的な作業を開始する正当な場所になります。
サブスクリプションの分割
この展開により、ChatGPT のサブスクリプション層間の境界線も明確になります。 Plus および Pro のサブスクライバー (すでに最高の使用制限があり、OpenAI の最も機能的なモデルにアクセスできるプラン) は、文書作成、電子メールの下書き、Slack の要約など、完全な音声駆動の「作業」タブのエクスペリエンスを利用できます。また、サイトの構築、プレゼンテーションの作成、クラウド ブラウザの使用、ChatGPT の財務領域へのアクセスもすべて音声で行うことができます。
Free ユーザーと Go ユーザーは、プラグインと接続アプリを中心とした、より制限された機能セットを受け取ります。この階層化は、OpenAI のおなじみのパターンに従っています。つまり、デスクトップで機能を証明してから、最も価値のある機能がユーザーを有料プランに誘導するモバイル バージョンを提供します。 OpenAIにとって、ライバルが同じユーザーに積極的に求愛している今、この動きは有料層の外堀をさらに深くすることになる。
Anthropic のアプローチとの比較
ここでは競争の背景が重要です。 TechCrunch は、Anthropic が最近、自社のユーザーにとってモバイルとデスクトップ間の引き継ぎを容易にし、Cowork と Chat のインターフェースを 1 つのエクスペリエンスに統合したと指摘しています。対照的に、OpenAI は依然としてチャットとワークスペースを分離しています。これは、ファイル、プロジェクト、ツールが存在するワークスペースからカジュアルな会話を区別するための意図的な製品分割です。
両社は、AI アシスタントのワークフロー設計において、事実上、相反する実験を行っている。 Anthropic のマージされたインターフェイスは、ユーザーがデバイス間で追従する単一の統一されたサーフェスを望んでいることに賭けています。 OpenAI の賭けは、チャットと構造化されたワークスペースがさまざまなニーズに対応し、音声が結合組織として機能することで区別性を維持すべきであるということです。つまり、モバイルで話すことでタスクを開始し、デスクトップでキーボードで調整するということです。
次に見るべきもの
次の明らかな疑問は、音声エージェントが [作業] タブからどのくらいの距離を移動するかということです。 OpenAI のデスクトップ統合はすでに、アプリ構築ツールである Codex にまで及んでおり、そこでのモバイル パリティは携帯電話を完全な開発面に変えることになります。 OpenAIはその時期を発表していない。
信頼性も未解決です。エージェントの音声タスク (ドラフト、要約、ブラウジング) には複数のステップの実行が含まれており、エラーが複合化し、モバイル環境では中断やコンテキストの切り替えが発生します。初期のユーザー エクスペリエンスによって、音声による作業が毎日の習慣になるか、デモに適した機能であり続けるかが決まります。
いずれにせよ、進行方向は明確です。2 年前には音声で質問に答えていたアシスタントは、現在では、あなたがデスクに着く前にタスクを完了することが期待されています。水曜日のアップデートにより、OpenAI のモバイル ユーザーはそのタスクを文章で開始でき、到着すると大きな画面でそれを選択できるようになります。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→