OpenAI menghadirkan fitur agen berbasis suara ke aplikasi seluler ChatGPT, memungkinkan pengguna melakukan pekerjaan nyata — menyusun dokumen, meringkas email, membuat presentasi — hanya dengan berbicara, perusahaan mengumumkan pada hari Rabu, seperti dilansir TechCrunch.
Peluncuran ini meluas ke kemampuan ponsel cerdas yang sebelumnya ditawarkan OpenAI di desktop, dan hal ini terjadi karena suara menjadi salah satu cara pengguna berinteraksi dengan asisten AI untuk tugas-tugas kompleks yang tumbuh paling cepat.
Apa yang dapat dilakukan pelanggan melalui suara
Pelanggan Plus dan Pro akan dapat menggunakan tab Kerja di aplikasi seluler ChatGPT untuk membuat dokumen, membuat draf email, atau meringkas pesan Slack dengan suara. Alur kerja suara yang sama mencakup pekerjaan berat yang sudah didukung tab Pekerjaan, seperti membuat situs, membuat presentasi, menggunakan browser cloud, dan menggali area keuangan ChatGPT.
Pengguna gratis dan Go mendapatkan bagian pembaruan yang lebih sempit, mendapatkan kemampuan untuk bekerja dengan plugin dan aplikasi yang terhubung.
OpenAI mengatakan percakapan suara kini akan menghasilkan keluaran teks yang lebih kaya, dan pengguna dapat berpindah dengan lancar antara mode suara dan teks. Mungkin tambahan yang paling praktis bagi orang-orang yang sering bepergian dan menggunakan desktop: percakapan yang dimulai saat bepergian dapat dilanjutkan nanti di aplikasi desktop.
Jalan dari GPT-Live ke agen seluler
Pembaruan ini merupakan babak seluler dari cerita OpenAI yang dimulai pada bulan Juli, ketika meluncurkan GPT-Live, model percakapan barunya, dan kemudian menghubungkannya ke aplikasi desktop sehingga pengguna dapat menyelesaikan tugas tab Kerja dan membuat aplikasi di tab Codex dengan suara. Pengumuman hari Rabu ini menutup loop dengan menghadirkan eksekusi tugas berbasis suara yang sama ke ponsel.
Mengapa agen suara di seluler penting
Pergeseran ini mencerminkan bagaimana pola penggunaan berubah. Semakin banyak pengguna yang beralih ke suara untuk memberikan perintah kepada asisten AI untuk tugas-tugas kompleks, dan telepon adalah tempat dimana perintah tersebut paling sering terjadi — di antara rapat, di dalam mobil, atau jauh dari keyboard.
Hingga saat ini, fitur agen paling canggih di ChatGPT ada di desktop. Pengguna yang ingin ChatGPT membuat presentasi atau menjalankan tugas penelitian multi-langkah harus berada di depan komputer mereka, mengetik instruksi ke dalam tab Work. Aplikasi seluler, meskipun populer, sebagian besar merupakan platform percakapan. Pembaruan hari Rabu meruntuhkan perbedaan itu: telepon menjadi tempat yang sah untuk memulai pekerjaan substantif, dengan saluran suara sebagai antarmuka.
Pemisahan langganan
Peluncuran ini juga mempertajam batas antara tingkatan langganan ChatGPT. Pelanggan Plus dan Pro — paket yang telah memiliki batas penggunaan tertinggi dan akses ke model OpenAI yang paling mumpuni — mendapatkan pengalaman tab Kerja berbasis suara sepenuhnya, termasuk pembuatan dokumen, penyusunan email, dan ringkasan Slack. Mereka juga dapat membuat situs, membuat presentasi, menggunakan browser cloud, dan mengakses area keuangan ChatGPT, semuanya melalui suara.
Pengguna Gratis dan Go menerima serangkaian kemampuan yang lebih terbatas yang berpusat pada plugin dan aplikasi yang terhubung. Tingkatan tersebut mengikuti pola umum OpenAI: buktikan kemampuan di desktop, lalu hadirkan versi seluler yang fitur paling berharganya mendorong pengguna ke paket berbayar. Bagi OpenAI, langkah ini memperdalam kesenjangan di sekitar tingkatan berbayarnya pada saat para pesaing secara agresif mendekati pengguna yang sama.
Bagaimana perbandingannya dengan pendekatan Anthropic
Latar belakang persaingan penting di sini. TechCrunch mencatat bahwa Anthropic baru-baru ini mempermudah peralihan antara seluler dan desktop bagi penggunanya dan menggabungkan antarmuka Rekan Kerja dan Obrolan menjadi satu pengalaman. Sebaliknya, OpenAI masih memisahkan ruang obrolan dan ruang kerja — pemisahan produk yang sengaja dilakukan agar percakapan biasa tetap berbeda dari ruang kerja tempat file, proyek, dan alat berada.
Kedua perusahaan secara efektif menjalankan eksperimen berlawanan dalam desain alur kerja asisten AI. Antarmuka gabungan Anthropic bertaruh bahwa pengguna menginginkan satu permukaan terpadu yang mengikuti mereka di seluruh perangkat. Taruhan OpenAI adalah bahwa obrolan dan ruang kerja terstruktur melayani kebutuhan yang berbeda dan harus tetap berbeda, dengan akting suara sebagai jaringan penghubungnya — memulai tugas dengan berbicara di perangkat seluler, menyempurnakannya dengan keyboard di desktop.
Apa yang harus ditonton selanjutnya
Pertanyaan selanjutnya yang jelas adalah seberapa jauh perjalanan agen suara dari tab Pekerjaan. Integrasi desktop OpenAI telah menjangkau Codex, alat pembuat aplikasinya, dan paritas seluler di sana akan mengubah ponsel menjadi platform pengembangan penuh. OpenAI belum mengumumkan waktunya untuk itu.
Yang juga belum terselesaikan adalah keandalan. Tugas suara agen — menyusun, meringkas, menelusuri — melibatkan eksekusi multi-langkah yang menyebabkan kesalahan bertambah, dan lingkungan seluler menambah interupsi dan peralihan konteks. Pengalaman pengguna awal akan menentukan apakah pekerjaan berbasis suara akan menjadi kebiasaan sehari-hari atau tetap menjadi fitur yang ramah demo.
Apa pun yang terjadi, arah perjalanannya jelas: asisten yang menjawab pertanyaan melalui suara dua tahun lalu kini diharapkan menyelesaikan tugasnya sebelum Anda mencapai meja Anda. Dengan pembaruan hari Rabu, pengguna seluler OpenAI dapat memulai tugas tersebut dengan sebuah kalimat — dan melanjutkannya di layar yang lebih besar saat mereka tiba.
---
Tetap Terdepan dalam AIDapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.
Baca berita AI selengkapnya →