Google kanthi tenang ngirim rong update model Gemini sing signifikan sajrone 48 jam minggu iki, lan loro-lorone ditujukan kanggo para pangembang kanggo nggawe aplikasi produksi. Gemini 3.5 Transcribe, ngenalaken 26 Agustus, minangka model wicara-kanggo-teks perusahaan sing paling tepat nganti saiki, miturut blog resmi Google. Gemini Omni 1.1 Flash, announced 27 Agustus, ndadekke kontrol profesional-bahan kanggo video generatif, kalebu extension pemandangan nganti 40 detik lan 4K upscaling. Loro-lorone model kasedhiya liwat Gemini API ing Google AI Studio lan Gemini Enterprise Agent Platform.

Gemini 3.5 Transkripsi: wicara-kanggo-teks sing ngresiki sawise dhewe For more context on this story, see our ongoing AI industry coverage.

Sing mbedakake Gemini 3.5 Transkripsi saka pangenalan wicara konvensional, ujare Google, yaiku ngowahi audio mentah langsung dadi teks sing dipoles lan diformat tinimbang transkrip mentah. Model kasebut nangani gangguan latar mburi, jargon rumit, lan ngresiki disfluency kanthi asli - mbusak tembung pangisi kaya "ums" lan "ahs," ngrampungake koreksi dhewe kayata "ayo ketemu Selasa-ora, Rebo," lan ngowahi format output kanthi otomatis.

Nomer pathokan sing dikutip Google penting banget. Minangka diukur dening Analisis Buatan, model entuk tingkat kesalahan tembung rata-rata (WER) 4.0 persen kanggo kasus panggunaan streaming lan 2.6 persen kanggo audio non-streaming. Ing pathokan multibasa FLEURS antarane basa ndhuwur, iku ngirim 5,50 persen WER ing mode streaming lan 5,04 persen non-streaming, Ngapikake model transkripsi Google sadurungé, Chirp 3. Wektu kanggo transkripsi final nambah dening 70 persen dibandhingake karo Chirp 3, maneh minangka diukur dening Analisis Artificial.

Model dikirim ing rong varian kanggo rong alur kerja. Kanggo aplikasi langsung, `gemini-3.5-transcribe-live` ngirimake streaming bidirectional terus-terusan kanthi latensi sub-detik liwat Live API, ngarahake agen swara lan captioning wektu nyata. Kanggo rekaman audio — rapat, log telpon, arsip — `gemini-3.5-transcribe` nawakake atribusi speaker nganti telung pamicara (kanthi dhukungan luwih akeh ing mode eksperimen) lan cap wektu tingkat tembung liwat API Interaksi.

Kapabilitas liyane kalebu deteksi otomatis lan transkripsi ing luwih saka 85 basa kanthi aksen lan penanganan dialek, lan dhukungan kosakata khusus supaya model kasebut adaptasi karo jargon khusus lan ejaan unik. Google uga menehi macem-macem mata model: liwat panggilan fungsi, bisa utusan tugas kaya nggawe gambar utawa analisis file menyang model Gemini liyane - fitur sing saiki kasedhiya ing aplikasi Gemini ing macOS.

Gemini Omni 1.1 Flash: generasi video tuwuh timeline

Peluncuran kapindho alamat keluhan paling umum babagan video AI: kontrol. Gemini Omni 1.1 Flash minangka nganyari fokus produksi sing ndadekake video generatif bisa dikontrol kanthi cara sing ora sadurunge, karo manajer produk Google DeepMind Anish Nangia lan Alisa Fortin nggambarake rilis kasebut nggawe Omni 1.1 "siap produksi kanggo panggunaan profesional."

Ekstensi adegan minangka fitur judhul. Pangembang saiki bisa terus ngasilake cuplikan kanthi lancar saka klip sing ana, kanthi model nganalisa nganti 10 detik saka konteks sadurunge - lompatan saka model sadurunge sing mung referensi detik pungkasan. Video bisa ditambah kanthi tambahan 10 detik nganti dawa kumulatif 40 detik, nambah konsistensi visual lan ketaatan narasi kanggo crita sing luwih dawa.

Nganyari uga nambah interpolasi pigura pisanan lan pungkasan, ngidini pangembang nemtokake pigura wiwitan lan pungkasan kanggo nggawe gerakan kamera sing lancar lan disengaja lan transisi antarane gambar. Kanggo pangiriman, proyek sing wis rampung bisa ditingkatake dadi resolusi 4K, dene mode pratinjau 360p ngidini para pangripta ngulang pituduh kanthi cepet lan murah sadurunge nindakake render pungkasan.

Saka API kanggo lumahing saben dinten

Google uga nyambungake loro model kasebut menyang produk konsumen, sing nuduhake keuntungan distribusi. Ing Android, fitur "Rambler" anyar ing Gboard nggunakake 3.5 Transcribe kanggo ngowahi pikirane sing diucapake dadi teks sing diformat kanthi apik nalika nyaring tembung pangisi — pangguna malah bisa ngowahi kanthi swara. Model kasebut uga nguwasani dikte ing aplikasi Gemini ing macOS, bisa digunakake bebarengan karo konteks layar ing Antigravity Google, lan digabungake menyang Chrome.

Kanggo pangembang, loro peluncuran kasebut diwaca minangka siji strategi: Google nyurung Gemini saka chatbot sing diajak ngobrol menyang infrastruktur sing ndeleng, krungu, lan ngasilake media. Kanthi OpenAI, ElevenLabs, lan klompok startup video sing saingan ing wilayah sing padha, tingkat kesalahan tembung 2,6 persen lan adegan koheren 40 detik minangka tawaran pambuka Google kanggo beban kerja produksi sing bener-bener ngasilake revenue - agen swara, saluran pipa captioning, lan alat kreatif. Pangembang bisa miwiti mbangun karo loro model ing Google AI Studio dina iki.

Kenapa tingkat kesalahan tembung isih penting

Tingkat kesalahan tembung kaya statistik akademik, nanging ing produksi, bedane antarane produk swara sing bisa digunakake lan sing nggawe frustasi. Saben pocapan sing ora dimangerteni ing agen swara ngilangi tugas: ID pesenan sing salah bakal nyebabake goleki sing gagal, alamat sing rusak ngirim paket menyang kutha sing salah. Mulane jurang antarane WER 2,6 persen ing audio non-streaming lan tarif siji-digit dhuwur sing umume generasi model kepungkur senyawa dadi prabédan urutan-ukuran-ukuran migunani.

Bedane antarane rong mode sing dilaporake Google uga penting kanggo arsitek. Transkripsi streaming - tokoh WER 4.0 persen - dagang sawetara akurasi kanggo latensi sub-detik, sing kasus panggunaan interaktif kaya agen swara langsung mbutuhake. Transkripsi batch saka audio sing direkam mlaku luwih alon nanging tekan 2.6 persen, mulane analytics lan pangolahan arsip kirim telpon bisa luwih nuntut. Kaputusan Google kanggo mbabarake loro-lorone minangka titik pungkasan model sing kapisah tinimbang siji setelan sing bisa diatur ngakoni manawa pangembang nggawe produk sing beda-beda ing salah siji sisih tradeoff kasebut.

Alur kerja berjenjang kanggo produksi video

Nganyari Omni 1.1 Flash uga pragmatis babagan carane karya kreatif kedadeyan. Video generatif larang regane: saben eksperimen cepet tegese render lengkap. Mode pratinjau 360p anyar misahake eksplorasi saka kiriman, ngidini para pangripta ngetutake variasi cepet kanthi murah lan mung mbayar upscaling 4K ing gambar sing bisa ditinjau.

Mekanika ekstensi pemandangan ngatasi masalah koherensi sing njaga video AI ing ghetto ukuran klip. Kanthi nganalisa 10 detik saka konteks sadurunge tinimbang mung pigura pungkasan, model bisa ngluwihi pemandangan ing 10-detik tambahan nganti 40 detik nalika tetep karakter, cahya, lan gaya visual konsisten. Digabungake karo interpolasi pisanan-lan-pungkasan-pigura - kang menehi editors TCTerms kontrol deterministik, cara mlebu lan metu spidol bisa ing editing conventional - rekaman AI-kui wiwit pas menyang pipelines kirim-produksi nyata tinimbang ngganti borongan.

Gambar kompetitif

Loro-lorone ngluncurake posisi Google minangka infrastruktur tinimbang tujuan. Ing wicara, Google njupuk vendor transkripsi khusus lan tumpukan swara saka saingan awan kanthi nggabungake akurasi paling canggih menyang API Gemini sing wis digunakake para pangembang. Ing video, saingan ing pasar sing rame karo startup sing didanai kanthi apik kanthi nandheske kontrol lan integrasi alur kerja liwat tontonan mentah.

Keuntungan distribusi bisa dadi faktor penentu. Model transkripsi sing padha sing bisa diarani para pangembang saka API Gemini wis nguwasani dikte Rambler Gboard ing Android, aplikasi Gemini ing macOS, Google Antigravity, lan Chrome - tegese Google bisa amortize pangembangan model ing milyaran interaksi pangguna nalika ngempalaken macem-macem audio donya nyata sing terus nambah. Kanggo pangembang sing milih pidato utawa tumpukan video ing 2026, flywheel kasebut saiki dadi bagian saka lapangan.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →