Google telah melancarkan Gemini 3.5 Transcribe, model pertuturan-ke-teks baharu yang dibina untuk transkripsi masa nyata yang mengenali lebih daripada 85 bahasa secara automatik — dan menggilap output di sepanjang jalan, menanggalkan perkataan pengisi dan membetulkan kesalahan lisan tanpa diminta.
Pelancaran meletakkan susunan pertuturan Google sebagai pencabar langsung dalam pasaran transkripsi yang berkembang pesat, di mana ketepatan dan kependaman semakin menentukan perkhidmatan yang digunakan oleh pembangun untuk panggilan, mesyuarat, kapsyen dan antara muka suara. For more context on this story, see our ongoing more AI stories.
Perkara Yang Model Boleh Lakukan
Menurut pengumuman Google, liputan yang diterbitkan oleh The Decoder, Gemini 3.5 Transcribe melangkaui menukar perkataan yang dituturkan kepada teks:
- Pengesanan bahasa automatik merentas lebih 85 bahasa, tanpa konfigurasi diperlukan
- Penyingkiran perkataan pengisi, membersihkan "um," "uh," dan gangguan yang serupa
- Pembetulan gelinciran lidah, menghasilkan prosa yang boleh dibaca daripada bunyi verbatim
- Pemformatan teks autonomi, termasuk tanda baca dan struktur
Syarikat itu melaporkan kadar ralat perkataan sebanyak 4.0 peratus untuk penstriman audio dan 2.6 peratus untuk audio yang dirakam, di samping pengurangan kependaman kira-kira 70 peratus berbanding pendahulunya, Chirp 3 — margin yang besar dalam senario kapsyen langsung di mana kelewatan memutuskan perbualan.
Dua Antara Muka untuk Dua Kerja
Pembangun mendapat akses melalui dua antara muka pengaturcaraan aplikasi yang berbeza:
Live API — `gemini-3.5-transcribe-live`
Mengendalikan penstriman masa nyata dengan kependaman yang sangat rendah, menyasarkan kapsyen langsung, ejen suara dan pembantu interaktif di mana masa respons paling penting.Interactions API — `gemini-3.5-transcribe`
Memproses audio yang dirakam dan mengembalikan transkrip dengan atribusi pembesar suara dan cap masa — aliran kerja yang biasa untuk mesyuarat, temu bual, podcast dan pasca produksi media.Di luar transkripsi, model ini menyokong panggilan fungsi, bermakna ia boleh mengagihkan tugas susulan kepada model lain dalam keluarga Gemini — contohnya mencetuskan permintaan penjanaan imej atau carian web berdasarkan sesuatu yang dikatakan semasa sesi. Itu menjadikan enjin transkrip menjadi lapisan antara muka yang boleh dikawal untuk aplikasi dipacu suara.
Sudah Menghantar Merentas Produk Google
Model ini disiarkan secara langsung dalam Google AI Studio dan pada Gemini Enterprise Agent Platform untuk pembangun hari ini. Google juga telah menyambungkannya ke permukaan pengguna: Gboard pada Android menggunakannya melalui komponen dalaman yang dipanggil Rambler untuk imlak, apl Gemini pada macOS menggunakannya pada input suara dan penyepaduan Chrome dijadualkan untuk diikuti.
Pengagihan itu penting. Pengecaman pertuturan memperolehnya pada skala, dan membenamkan model dalam papan kekunci, apl desktop dan penyemak imbas meletakkannya di hadapan berbilion-bilion interaksi input setiap hari — sambil menyuap gelung penilaian yang diperlukan untuk memastikan kadar ralat jatuh merentas aksen, dialek dan persekitaran yang bising.
Kepentingan Kompetitif dalam Pertuturan AI
Transkripsi secara senyap-senyap telah menjadi medan pertempuran yang kompetitif di kalangan makmal sempadan dan vendor pakar. Pemahaman pertuturan yang tepat dan kependaman rendah ialah tiket masuk untuk produk agen yang bertindak mengikut arahan yang dituturkan, kecerdasan mesyuarat perusahaan, ciri kebolehaksesan dan automasi perkhidmatan pelanggan berbilang bahasa.
Dengan menggandingkan penambahbaikan kependaman yang agresif dengan output pembetulan sendiri, Google bertaruh bahawa pembangun lebih suka transkrip yang dibaca seperti teks yang diedit daripada tangkapan fonetik mentah — memperdagangkan kesetiaan kata demi kata yang ketat untuk kebolehgunaan. Pasukan yang memerlukan rekod yang tepat, seperti transkrip undang-undang atau perubatan, mungkin masih mahukan mod verbatim; bagi orang lain, perbezaan praktikal antara mendengar seseorang dan memahami mereka terus mengecil.
Dengan Gemini 3.5 Transcribe kini tersedia secara amnya dalam AI Studio dan perkakas perusahaan, ujian pertama yang bermakna ialah metrik penerimaan daripada pembangun ejen suara — segmen pasaran berkembang dengan cukup cepat sehinggakan peningkatan ketepatan yang meningkat diterjemahkan ke dalam keputusan penukaran yang besar.
Mengapa Latensi Merupakan Medan Pertempuran Sebenar
Kadar ralat mendapat tajuk utama, tetapi kependaman secara senyap-senyap menentukan produk yang berdaya maju. Enjin transkripsi yang menyalurkan tindanan kapsyen langsung perlu mengikut rentak perbualan atau penonton melepaskan diri. Ejen suara yang merundingkan panggilan sokongan pelanggan tidak boleh menjeda dengan janggal semasa lapisan pertuturannya menyusul. Google melaporkan pengurangan kelewatan sebanyak 70 peratus berbanding sasaran Chirp 3 dengan tepat jurang itu — memendekkan jarak antara pembesar suara menamatkan ayat dan sistem hiliran bertindak ke atasnya.
Untuk aplikasi agenik ini menggabungkan: setiap pusingan dialog yang dituturkan melibatkan pengecaman, penaakulan dan tindak balas. Mencukur milisaat daripada peringkat pengecaman memberi ruang kepada pembina untuk berbelanja pada model penaakulan yang lebih berkebolehan — dan lebih perlahan — tanpa melanggar belanjawan pemasaan perbualan.
The Verbatim Trade-Off
Satu pilihan reka bentuk patut diteliti. Secara lalai, Gemini 3.5 Transkripsi menyusun output: perkataan pengisi hilang, tersandung dibetulkan dan pemformatan digunakan secara automatik. Untuk kebanyakan kegunaan perniagaan — minit, kapsyen, arkib boleh dicari — itulah yang pengguna mahukan.
Tetapi aliran kerja tertentu bergantung pada rekod verbatim. Deposisi undang-undang, ulasan pematuhan dan semakan fakta kewartawanan kadangkala memerlukan mengetahui dengan tepat apa yang dikatakan, termasuk keraguan. Organisasi dalam industri terkawal akan mahukan kejelasan tentang berapa banyak pelicinan adalah pilihan dan boleh dikonfigurasikan sebelum memindahkan saluran paip sensitif ke model baharu. Dokumentasi Google dan parameter API akan ditetapkan dengan berkesan di mana baris verbatim-berbanding-digilap terletak untuk industri.
Jejak Pelbagai Bahasa sebagai Parit
Liputan lebih 85 bahasa dengan pengesanan automatik bukan sekadar item senarai semak ciri. Jangkauan berbilang bahasa menumpukan nilai dalam pasaran yang pesaing dari segi sejarah ketinggalan: aksen serantau, penukaran kod antara bahasa pertengahan ayat dan bahasa sumber rendah semuanya menghukum model yang dilatih secara sempit mengenai korpora yang berbahasa Inggeris.
Untuk perusahaan global yang menjalankan pusat sokongan merentas berpuluh-puluh negara, satu model yang mengendalikan pengesanan bahasa secara telus mengurangkan kerumitan penyepaduan — satu saluran paip dan bukannya banyak konfigurasi setiap pasaran. Digabungkan dengan pengedaran melalui berbilion pemasangan Android Gboard, Google meletakkan multibahasa berkualiti transkripsi sebagai infrastruktur dan bukannya keupayaan premium.
Apa yang Perlu Dilihat
Tiga isyarat akan menunjukkan sama ada Gemini 3.5 Transcribe mengubah bahagian pasaran atau hanya meningkatkan jangkaan: penghijrahan pembangun dalam penanda aras pihak ketiga dalam beberapa bulan akan datang; seberapa cepat saingan sepadan dengan nombor kependaman dan bukannya tuntutan ketepatan; dan sama ada cangkuk panggilan fungsi melahirkan gelombang ejen yang mengutamakan suara yang dibina secara asli pada Gemini. Pelancaran adalah secara langsung sekarang, dan peringkat penetapan harga melalui AI Studio sepatutnya menjadikan percubaan cukup murah sehingga kos penukaran jatuh kepada hampir tiada.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →