Google telah meluncurkan Gemini 3.5 Transcribe, model ucapan-ke-teks baru yang dibuat untuk transkripsi real-time yang mengenali lebih dari 85 bahasa secara otomatis — dan menyempurnakan keluarannya, menghilangkan kata-kata pengisi dan mengoreksi kesalahan verbal tanpa diminta.

Peluncuran ini menempatkan tumpukan ucapan Google sebagai penantang langsung dalam pasar transkripsi yang berkembang pesat, di mana akurasi dan latensi semakin menentukan layanan mana yang akan diadopsi oleh pengembang untuk panggilan, rapat, teks, dan antarmuka suara. For more context on this story, see our ongoing more AI stories.

Apa yang Dapat Dilakukan Model

Menurut pengumuman Google, yang liputannya diterbitkan oleh The Decoder, Gemini 3.5 Transcribe lebih dari sekadar mengubah kata-kata yang diucapkan menjadi teks:

  • Deteksi bahasa otomatis dalam lebih dari 85 bahasa, tanpa perlu konfigurasi
  • Penghapusan kata pengisi, membersihkan "um", "uh", dan ketidakfasihan serupa
  • Koreksi kesalahan lidah, menghasilkan prosa yang mudah dibaca dan bukan bunyi kata demi kata
  • Pemformatan teks otonom, termasuk tanda baca dan struktur

Perusahaan melaporkan tingkat kesalahan kata sebesar 4,0 persen untuk streaming audio dan 2,6 persen untuk rekaman audio, serta pengurangan latensi sekitar 70 persen dibandingkan pendahulunya, Chirp 3 — margin yang besar dalam skenario teks langsung yang mana penundaan akan mengganggu percakapan.

Dua Antarmuka untuk Dua Pekerjaan

Pengembang mendapatkan akses melalui dua antarmuka pemrograman aplikasi yang berbeda:

API Langsung — `gemini-3.5-transkripsi-langsung`

Menangani streaming waktu nyata dengan latensi sangat rendah, menargetkan teks langsung, agen suara, dan asisten interaktif yang mengutamakan waktu respons.

API Interaksi — `gemini-3.5-transcribe`

Memproses rekaman audio dan mengembalikan transkrip dengan atribusi pembicara dan stempel waktu — alur kerja yang umum untuk rapat, wawancara, podcast, dan pascaproduksi media.

Selain transkripsi, model ini mendukung panggilan fungsi, artinya model ini dapat mendelegasikan tugas tindak lanjut ke model lain dalam keluarga Gemini — misalnya memicu permintaan pembuatan gambar atau penelusuran web berdasarkan sesuatu yang dikatakan selama sesi. Hal ini mengubah mesin transkrip menjadi lapisan antarmuka yang dapat dikontrol untuk aplikasi berbasis suara.

Sudah Mengirim ke Seluruh Produk Google

Model ini tersedia di Google AI Studio dan di Gemini Enterprise Agent Platform untuk pengembang saat ini. Google juga telah menghubungkannya ke platform konsumen: Gboard di Android menggunakannya melalui komponen internal yang disebut Rambler untuk dikte, aplikasi Gemini di macOS menerapkannya pada masukan suara, dan integrasi Chrome dijadwalkan menyusul.

Distribusi itu penting. Pengenalan ucapan semakin berkembang, dan penyematan model ini di keyboard, aplikasi desktop, dan browser menempatkannya di depan miliaran interaksi masukan setiap hari — sekaligus memberikan putaran evaluasi yang diperlukan untuk menjaga tingkat kesalahan tetap rendah pada aksen, dialek, dan lingkungan yang bising.

Taruhan Kompetitif dalam Speech AI

Transkripsi diam-diam telah menjadi medan pertempuran kompetitif antara laboratorium terdepan dan vendor spesialis. Pemahaman ucapan yang akurat dan berlatensi rendah adalah tiket masuk untuk produk agen yang bertindak berdasarkan perintah lisan, intelijen rapat perusahaan, fitur aksesibilitas, dan otomatisasi layanan pelanggan multibahasa.

Dengan memasangkan peningkatan latensi yang agresif dengan hasil koreksi mandiri, Google yakin bahwa pengembang lebih memilih transkrip yang dibaca seperti teks yang diedit daripada tangkapan fonetik mentah — memperdagangkan fidelitas kata demi kata yang ketat demi kegunaan. Tim yang membutuhkan catatan yang tepat, seperti penyalin hukum atau medis, mungkin masih menginginkan mode kata demi kata; bagi semua orang, perbedaan praktis antara mendengarkan seseorang dan memahaminya terus menyempit.

Dengan Gemini 3.5 Transcribe yang kini tersedia secara umum di AI Studio dan peralatan perusahaan, pengujian pertama yang bermakna adalah metrik adopsi dari pengembang agen suara — segmen pasar yang berkembang cukup cepat sehingga peningkatan akurasi tambahan dapat menghasilkan keputusan peralihan yang cukup besar.

Mengapa Latensi Adalah Medan Pertempuran Sebenarnya

Tingkat kesalahan menjadi berita utama, namun latensi diam-diam menentukan produk mana yang layak. Mesin transkripsi yang memberikan hamparan teks langsung harus mengimbangi percakapan, atau pemirsa akan melepaskan diri. Agen suara yang menegosiasikan panggilan dukungan pelanggan tidak dapat berhenti sejenak saat lapisan ucapannya menyusul. Google melaporkan pengurangan penundaan sebesar 70 persen dibandingkan dengan Chirp 3 yang menargetkan kesenjangan tersebut – memperpendek jarak antara pembicara menyelesaikan kalimat dan sistem hilir yang bertindak berdasarkan itu.

Untuk penerapan agen, hal ini digabungkan: setiap dialog lisan melibatkan pengenalan, penalaran, dan respons. Mengurangi waktu milidetik dari tahap pengenalan memberikan ruang bagi para pembangun untuk menggunakan model penalaran yang lebih mumpuni — dan lebih lambat — tanpa melanggar anggaran waktu percakapan.

Pengorbanan Verbatim

Satu pilihan desain patut dicermati. Secara default, Gemini 3.5 Transkrip mengkurasi keluaran: kata-kata pengisi hilang, kesalahan diperbaiki, dan pemformatan diterapkan secara otomatis. Untuk sebagian besar keperluan bisnis — notulen, teks, arsip yang dapat dicari — itulah yang diinginkan pengguna.

Namun alur kerja tertentu bergantung pada catatan kata demi kata. Pernyataan hukum, tinjauan kepatuhan, dan pengecekan fakta jurnalistik terkadang memerlukan pengetahuan yang tepat tentang apa yang dikatakan, termasuk keraguan. Organisasi dalam industri yang diatur akan menginginkan kejelasan tentang seberapa banyak pemulusan yang bersifat opsional dan dapat dikonfigurasi sebelum memigrasikan jaringan pipa sensitif ke model baru. Dokumentasi Google dan parameter API akan secara efektif menentukan posisi industri secara verbatim versus sempurna.

Jejak Multibahasa sebagai Parit

Cakupan lebih dari 85 bahasa dengan deteksi otomatis bukan sekadar item daftar periksa fitur. Jangkauan multibahasa memusatkan nilai di pasar yang secara historis tertinggal dari pesaing: aksen regional, peralihan kode antar bahasa di tengah kalimat, dan bahasa dengan sumber daya rendah, semuanya menghukum model yang dilatih secara sempit pada corpora yang banyak berbahasa Inggris.

Untuk perusahaan global yang menjalankan pusat dukungan di banyak negara, satu model yang menangani deteksi bahasa secara transparan mengurangi kompleksitas integrasi — satu jalur pipa dibandingkan banyak konfigurasi per pasar. Dikombinasikan dengan distribusi melalui miliaran instalasi Android Gboard, Google memposisikan multibahasa berkualitas transkripsi sebagai infrastruktur dan bukan kemampuan premium.

Yang Perlu Ditonton

Tiga sinyal akan menunjukkan apakah Gemini 3.5 Transcribe mengubah pangsa pasar atau hanya meningkatkan ekspektasi: migrasi pengembang dalam tolok ukur pihak ketiga dalam beberapa bulan mendatang; seberapa cepat pesaing mencocokkan angka latensi dibandingkan klaim akurasi; dan apakah kait pemanggil fungsi menghasilkan gelombang agen yang mengutamakan suara yang dibangun secara asli di Gemini. Peluncurannya sudah berjalan sekarang, dan tingkat harga melalui AI Studio akan membuat eksperimen menjadi cukup murah sehingga biaya peralihan hampir tidak ada.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →