Google memperkenalkan dua model teks ke pertuturan baharu pada hari Rabu — Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS — memanggilnya sebagai model penjanaan audio yang paling ekspresif lagi. Model ini tersedia di seluruh Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook dan Google Vids, menurut pengumuman Google daripada Leland Rechis, pengurus produk kumpulan, dan Alan Cowen, pengarah sains penyelidikan pada pasukan audio Gemini.

Pelancaran menggerakkan penjanaan suara melangkaui pratetap suara statik ke dalam perkara yang diterangkan oleh Google sebagai studio kreatif: suara yang direka bentuk daripada gesaan teks, persembahan yang diarahkan baris demi baris dan perancah keselamatan terbina dalam dari awal. Untuk mendapatkan maklumat lanjut tentang ini dan keluaran lain, lihat [berita model AI] kami(https://aibuzzwire.news).

Dua Model, Dua Pekerjaan

Pasangan itu membahagikan beban kerja dalam fesyen Google yang biasa. Gemini 3.8 Flash TTS dibina untuk arah kreatif yang mendalam dan reka bentuk watak — mencipta suara baharu sepenuhnya dari awal melalui gesaan bahasa semula jadi untuk permainan, buku audio yang mengasyikkan, podcast dan media interaktif, dengan kawalan berbutir ke atas isyarat lakonan, pacing, peralihan dialek dan saluran belakang. Gemini 3.8 Flash-Lite TTS ialah mainan volum: dioptimumkan untuk alih suara volum tinggi, penciptaan kandungan audio dan ejen suara ekspresif pada skala, dengan kawalan terperinci ke atas nada, pacing dan nuansa pada kos yang lebih rendah.

Kedudukan Google membingkaikan pasangan itu sebagai mengubah penjanaan suara "daripada pratetap statik kepada studio kreatif dinamik." Syarikat itu menunjukkan buku audio, permainan dan podcast sebagai destinasi semula jadi untuk model perdana, manakala varian Lite menyasarkan pasaran yang tidak menarik tetapi besar untuk alih suara dan ejen suara sentiasa aktif, di mana kos setiap minit yang dijana lebih penting daripada kuasa bintang. Kedua-dua model itu disepadukan ke dalam produk Google — Gemini Notebook dan Google Vids antaranya — menandakan bahawa teknologi itu akan muncul dalam alatan yang dihadapi pengguna dan bukannya kekal sebagai permainan API sahaja.

Studio Vokal Penuh, Daripada 30 Suara kepada Infinite

Google berkata pembangun kini boleh menskalakan daripada 30 suara asal kepada apa yang dipanggil perpustakaan tak terhingga. Sistem reka bentuk suara generatif membolehkan pengguna mencipta suara yang dipesan lebih dahulu dengan menyatakan ciri peranan, aksen dan suara merentas lebih 100 bahasa dan dialek — demo Google terdiri daripada suara DJ bertenaga tinggi dari Melbourne kepada "robot super-tinny, monoton" dan naga Jepun.

Di samping penjanaan, model ini dihantar dengan perpustakaan lebih daripada 2,000 suara sedia pengeluaran, termasuk jenis serantau seperti Sepanyol Mexico, Perancis Quebec dan Inggeris Scots.

Replikasi suara disertakan dengan pagar: pengguna boleh mencipta semula profil vokal yang konsisten daripada hanya sampel audio 30 saat — suara mereka sendiri, atau yang mereka berhak gunakan — disokong oleh pengesahan persetujuan terbina dalam, tanda air SynthID dan bukti kelayakan C2PA. Google juga menambah fungsi simpan dan skala untuk memastikan suara tersuai konsisten merentas projek, dengan pencampuran semula suara — timbre, pic, rentak dan loghat yang diperhalus melalui gesaan — disenaraikan akan datang tidak lama lagi.

Mengarahkan Persembahan, Baris demi Baris

Kedua-dua model menyokong arah per baris yang tepat. Pembangun boleh menulis arah pentas mereka sendiri atau membiarkan model mengarahkan penghantaran daripada isyarat skrip semula jadi — perbezaan antara ejen perkhidmatan pelanggan yang tenang dan adegan saspens yang berbisik. Letupan vokal berskrip seperti , dan menambah tekstur bukan lisan, manakala kata seru yang mendengar aktif seperti |mhm| dan |ya| mengendalikan gam perbualan yang menjadikan dialog terdengar seperti manusia.

Dua ciri menyasarkan kerja bentuk lebih panjang dan berbilang suara. Penjanaan bentuk panjang mengekalkan kualiti suara dan rentak audio berterusan berjam-jam dengan hanyutan pembesar suara yang minimum — bertujuan untuk podcast dan buku audio — manakala pementasan adegan dua pembesar suara asli mengarahkan perbualan berbilang pusingan daripada satu skrip dengan pengambilan giliran semula jadi dan suara yang dipisahkan dengan jelas.

Penanda Aras: No. 1 pada Hume AI

Google mengetuai pengumuman dengan nombor pihak ketiga. Gemini 3.8 Flash TTS menduduki tempat #1 keseluruhan pada Penanda Aras Reka Bentuk Suara Hume AI dengan skor 71.4, dan mendahului dalam pemodelan aksen pada 60.8. Pada Indeks Kualiti Keseluruhan Hume AI, kedua-dua model baharu masing-masing menuntut tempat #1 dan #2.

Tuntutan penanda aras daripada vendor harus sentiasa dibaca dengan berhati-hati, tetapi Hume AI — syarikat penyelidikan AI suara bebas — ialah pengadil yang munasabah untuk kualiti pertuturan, dan skor memberikan Google titik bercakap konkrit terhadap saingan dalam penjanaan suara.

Perlumbaan Senjata Audio Berterusan

Model baharu menyertai keluarga audio Gemini yang berkembang pesat yang sudah termasuk 3.5 Terjemah Langsung, 3.5 Transkripsi, 3.8 Langsung dan 3.8 Pemikiran Lanjutan Langsung — model suara masa nyata yang dilancarkan Google awal bulan ini. Irama itu bukan kebetulan: sintesis pertuturan yang ekspresif dan boleh dipercayai menjadi infrastruktur teras untuk ejen suara, sokongan pelanggan, alat kebolehaksesan dan pengeluaran media, dan Google mahu Gemini menjadi lapisan lalai untuk semua itu.

Bagi pembangun, pengambilan segera adalah praktikal dan bukannya futuristik: suara berjenama tersuai, alih suara berbilang bahasa dan penceritaan berjam-jam kini segera dibawa ke dalam Gemini API dan AI Studio — dengan tera air dilampirkan.

Ekonomi akan menentukan berapa banyak potensi itu digunakan. Google tidak menekankan harga dalam bahan pelancaran, tetapi kewujudan peringkat Flash-Lite membayangkan pilihan kos rendah yang disengajakan untuk beban kerja pukal, mencerminkan strategi peringkat yang digunakan di seluruh keluarga model Gemini. Perusahaan di Gemini Enterprise mendapat keupayaan yang sama di sebalik perjanjian sedia ada mereka, di mana Google menjangkakan sebahagian besar pengeluaran audio volum tinggi akan tiba.

Apa yang masih perlu dilihat ialah betapa cepatnya industri kreatif mengguna pakai penceritaan yang disintesis. Penanda air dan pengesahan persetujuan merendahkan halangan undang-undang dan etika, dan nombor penanda aras mencadangkan kualiti bukan lagi halangan. Jika tuntutan Google bertahan dalam amalan, jurang antara suara manusia yang dirakam dan yang dijana kini cukup sempit sehingga kos dan pemulihan — bukan keaslian — akan membuat keputusan untuk kebanyakan projek.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →