OpenAI telah melancarkan GPT-Live, satu siri model suara baharu untuk ChatGPT yang boleh mendengar dan bercakap pada masa yang sama, menandakan rombakan paling ketara bagi pengalaman suara perbualan syarikat setakat ini. Keluaran ini menggunakan apa yang diterangkan oleh OpenAI sebagai seni bina dupleks penuh, yang membolehkan pengguna mengganggu, bercakap dan bercakap dengan pembantu dengan cara yang dikatakan syarikat seolah-olah seperti panggilan telefon sebenar.
Pelancaran tiba bersama-sama pelancaran OpenAI yang lebih luas bagi keluarga model GPT-5.6 minggu ini, dan mewakili dorongan untuk membuat berita terkini AI tentang antara muka suara berasa kurang seperti memerintah mesin dan lebih seperti bersembang dengan seseorang.
Perkara yang Membuatkan GPT-Live Berbeza
Pembantu suara tradisional beroperasi dalam mod separuh dupleks: anda bercakap, kemudian anda berhenti, kemudian sistem memproses permintaan anda dan membalas. Pengambilan giliran adalah tegar. GPT-Live memecahkan corak itu dengan pemprosesan audio dupleks penuh, bermakna model boleh mendengar anda semasa ia masih bercakap. Itu membolehkan gangguan semula jadi, pembetulan pertengahan ayat dan perbualan yang bertindih - jenis manusia yang berulang-alik mengambil mudah tetapi AI suara telah bergelut dengan sejarahnya.
Menurut Reuters, model GPT-Live mendengar dan bercakap secara serentak — keupayaan yang telah lama menjadi sasaran untuk medan AI suara. Pendekatan ini menghilangkan jeda janggal dan mengambil giliran paksa yang telah menentukan versi awal mod suara ChatGPT.
Butiran teknikal yang ketara: apabila GPT-Live menghadapi soalan yang rumit, ia menyerahkannya kepada GPT-5.5 di latar belakang. Model suara mengendalikan aliran perbualan dalam masa nyata, manakala model penaakulan yang lebih besar berfungsi pada tugas yang lebih sukar di sebalik tabir — kemudian memberi jawapan kembali. Pembahagian kerja itu, menurut OpenAI, meningkatkan kualiti tindak balas secara drastik tanpa mengorbankan responsif yang menjadikan perbualan masa nyata terasa semula jadi.
Ketersediaan dan Harga
OpenAI melancarkan model suara baharu dalam dua peringkat:
- GPT-Live-1 — model penuh, tersedia sekarang untuk pelanggan ChatGPT berbayar (pelan Plus, Pro dan Pasukan).
- GPT-Live-1 mini — versi yang lebih kecil dan ringan tersedia untuk akaun ChatGPT percuma.
Pelancaran juga membawa carian web terus ke dalam perbualan suara. Seperti yang dilaporkan Jurnal Enjin Carian, GPT-Live menyepadukan carian langsung ke dalam suara ChatGPT, supaya pengguna boleh bertanya tentang peristiwa semasa atau maklumat yang berubah pantas dan mendapatkan jawapan berdasarkan hasil web baharu tanpa menukar mod.
Pasaran AI Suara Berdaya Saing
GPT-Live mendarat dalam landskap AI suara yang semakin sesak. Google telah mendorong ciri suara berkuasa Gemini merentas Android dan produk Gemini Livenya, manakala Apple terus mengolah semula Siri mengikut model bahasa besar. Anthropic, saingan utama OpenAI, telah menumpukan usaha baru-baru ini pada pengekodan agen dan model penaakulan berbanding suara.
Pendekatan dupleks penuh ialah tempat industri yang lebih luas nampaknya sedang menuju. Dengan membenarkan mendengar dan bercakap serentak, GPT-Live mengurangkan kependaman dan mengalih keluar satu aduan terbesar yang pernah dialami pengguna dengan pembantu suara: menunggu. Penyerahan kepada GPT-5.5 untuk pertanyaan kompleks juga merupakan isyarat bahawa OpenAI melihat suara bukan sebagai antara muka yang dilucutkan, tetapi sebagai pintu depan kepada model yang paling berkebolehan.
Mengapa Ia Penting
Suara telah dianggap selama bertahun-tahun sebagai antara muka kedua, didorong arahan — baik untuk menetapkan pemasa dan menyemak cuaca, kurang berguna untuk perbualan yang bernuansa. Pertaruhan GPT-Live ialah kesesakan tidak pernah menjadi kecerdasan model, tetapi antara muka: memaksa manusia untuk bercakap dalam semburan terpencil.
Jika perbualan dupleks penuh berfungsi dengan pasti pada skala, ia mengubah cara orang berinteraksi dengan AI pada telefon, dalam kereta, pada pembesar suara pintar dan akhirnya pada peranti boleh pakai. Ia juga menimbulkan kebimbangan biasa — tentang persetujuan dalam peranti yang sentiasa mendengar, tentang realisme suara sintetik dan sama ada perbualan yang lebih semula jadi menyebabkan pengguna terlalu mempercayai jawapan AI.
OpenAI tidak memperincikan langkah keselamatan khusus untuk GPT-Live melangkaui dasar kandungannya yang sedia ada, walaupun penyepaduan carian bermakna model kini boleh menarik maklumat langsung ke dalam suara yang mungkin lebih sukar untuk pengguna menilai secara kritis daripada teks yang boleh mereka tatal semula.
Apa Yang Akan Datang
Buat masa ini, GPT-Live ialah ciri ChatGPT pertama dan produk pembangun kedua. Ujian sebenar akan tiba dengan akses API, apabila apl pihak ketiga, platform perkhidmatan pelanggan dan pembuat perkakasan boleh memasukkan perbualan dupleks penuh ke dalam produk mereka sendiri. Itu juga apabila OpenAI akan menghadapi tekanan harga daripada model suara sumber terbuka yang lebih murah dan daripada pesaing yang tidak sabar-sabar untuk memadankan ciri tersebut.
Pelancaran serentak dengan keluaran awam GPT-5.6 mencadangkan OpenAI melihat suara dan penaakulan sebagai dua bahagian strategi yang sama: model berkuasa yang berfikir, dipasangkan dengan antara muka yang membolehkan anda bercakap dengannya seperti rakan sekerja.
Kekal Mendahului AI
Untuk liputan berterusan keluaran model, AI suara dan segala-galanya yang membentuk industri, ikuti perkembangan AI terbaharu di AI Buzz Wire.
Baca lebih banyak berita AI →



