Google secara senyap-senyap menghantar dua kemas kini model Gemini yang penting dalam masa 48 jam minggu ini, dan kedua-duanya ditujukan tepat kepada pembangun membina aplikasi pengeluaran. Gemini 3.5 Transcribe, yang diperkenalkan pada 26 Ogos, merupakan model pertuturan-ke-teks yang paling tepat syarikat setakat ini, menurut blog rasmi Google. Gemini Omni 1.1 Flash, diumumkan pada 27 Ogos, membawa kawalan gred profesional kepada video generatif, termasuk sambungan adegan sehingga 40 saat dan peningkatan 4K. Kedua-dua model boleh didapati melalui API Gemini dalam Google AI Studio dan Platform Ejen Perusahaan Gemini.

Gemini 3.5 Transkripsi: pertuturan-ke-teks yang membersihkan dirinya sendiri For more context on this story, see our ongoing more AI stories.

Apa yang membezakan Gemini 3.5 Transkripsi daripada pengecaman pertuturan konvensional, kata Google, ialah ia menukar audio mentah terus kepada teks yang digilap dan diformat dan bukannya transkrip mentah. Model ini mengendalikan hingar latar belakang, jargon kompleks dan pembersihan ketidaklancaran secara asli — ia mengalih keluar perkataan pengisi seperti "ums" dan "ahs," menyelesaikan pembetulan diri seperti "jom jumpa Selasa—tidak, Rabu," dan memformat output secara automatik.

Nombor penanda aras yang disebut oleh Google adalah ketara. Seperti yang diukur oleh Analisis Buatan, model ini mencapai purata kadar ralat perkataan (WER) sebanyak 4.0 peratus untuk kes penggunaan penstriman dan 2.6 peratus untuk audio bukan penstriman. Pada penanda aras berbilang bahasa FLEURS merentas bahasa teratas, ia menyiarkan 5.50 peratus WER dalam mod penstriman dan 5.04 peratus bukan penstriman, menambah baik pada model transkripsi Google sebelumnya, Chirp 3. Masa untuk transkripsi akhir bertambah baik sebanyak 70 peratus berbanding dengan Chirp 3, sekali lagi seperti yang diukur oleh Analisis Buatan.

Model dihantar dalam dua varian untuk dua aliran kerja. Untuk aplikasi langsung, `gemini-3.5-transcribe-live` menyampaikan penstriman dua arah berterusan dengan kependaman subsaat melalui Live API, menyasarkan ejen suara dan kapsyen masa nyata. Untuk audio yang dirakam — mesyuarat, log panggilan, arkib — `gemini-3.5-transcribe` menawarkan atribusi pembesar suara untuk sehingga tiga pembesar suara (dengan sokongan untuk lebih banyak dalam mod percubaan) dan cap masa peringkat perkataan melalui Interactions API.

Keupayaan lain termasuk pengesanan automatik dan transkripsi merentas lebih daripada 85 bahasa dengan pengendalian loghat dan dialek serta sokongan perbendaharaan kata tersuai supaya model menyesuaikan diri dengan jargon khusus dan ejaan unik. Google juga memberikan pandangan model semacam: melalui panggilan fungsi, ia boleh mewakilkan tugas seperti penjanaan imej atau analisis fail kepada model Gemini yang lain — ciri yang kini tersedia dalam apl Gemini pada macOS.

Gemini Omni 1.1 Flash: penjanaan video mengembangkan garis masa

Pelancaran kedua menangani aduan yang paling biasa tentang video AI: kawalan. Gemini Omni 1.1 Flash ialah kemas kini tertumpu pengeluaran yang menjadikan video generatif boleh dikendalikan dengan cara yang tidak seperti sebelumnya, dengan pengurus produk Google DeepMind Anish Nangia dan Alisa Fortin menyifatkan keluaran itu menjadikan Omni 1.1 "sedia pengeluaran untuk kegunaan profesional."

Sambungan adegan ialah ciri tajuk. Pembangun kini boleh terus menjana rakaman dengan lancar daripada klip sedia ada, dengan model menganalisis sehingga 10 saat konteks terdahulu — lonjakan daripada model sebelumnya yang hanya merujuk detik terakhir. Video boleh dilanjutkan dalam kenaikan 10 saat sehingga panjang terkumpul 40 saat, meningkatkan ketekalan visual dan pematuhan naratif untuk cerita yang lebih panjang.

Kemas kini juga menambah interpolasi bingkai pertama dan terakhir, membenarkan pembangun menentukan bingkai mula dan tamat untuk mencipta pergerakan kamera yang licin dan disengajakan dan peralihan antara tangkapan. Untuk penghantaran, projek yang telah siap boleh ditingkatkan kepada resolusi 4K, manakala mod pratonton 360p membolehkan pencipta mengulangi gesaan dengan cepat dan murah sebelum membuat keputusan akhir.

Daripada API kepada permukaan harian

Google juga sedang mendawai kedua-dua model ke dalam produk penggunanya, yang menunjukkan kelebihan pengedarannya. Pada Android, ciri "Rambler" baharu dalam Gboard menggunakan 3.5 Transkripsi untuk menukar pemikiran yang dituturkan kepada teks yang diformat dengan baik sambil menapis perkataan pengisi — pengguna malah boleh membuat pengeditan melalui suara. Model ini juga menguasakan imlak dalam apl Gemini pada macOS, berfungsi bersama konteks skrin dalam Antigraviti Google dan sedang disepadukan ke dalam Chrome.

Bagi pembangun, kedua-dua pelancaran dibaca sebagai satu strategi: Google menolak Gemini daripada chatbot yang anda bercakap dengan infrastruktur yang melihat, mendengar dan menghasilkan media. Dengan OpenAI, ElevenLabs dan kohort pemula video yang bersaing di wilayah yang sama, kadar ralat perkataan 2.6 peratus dan adegan koheren 40 saat adalah bidaan pembukaan Google untuk beban kerja pengeluaran yang sebenarnya menjana pendapatan — ejen suara, saluran paip kapsyen dan alatan kreatif. Pembangun boleh mula membina dengan kedua-dua model dalam Google AI Studio hari ini.

Mengapa kadar ralat perkataan masih penting

Kadar ralat perkataan kelihatan seperti statistik akademik, tetapi dalam pengeluaran, perbezaan antara produk suara yang berfungsi dan yang mengecewakan. Setiap sebutan yang salah faham dalam ejen suara memecahkan tugas: ID pesanan yang salah dengar mencetuskan carian yang gagal, alamat yang bercelaru menghantar pakej ke bandar yang salah. Itulah sebabnya jurang antara WER 2.6 peratus pada audio bukan penstriman dan kadar satu digit tinggi yang biasa digunakan pada generasi model dahulu menggabungkan perbezaan tertib magnitud dalam kebolehgunaan.

Perbezaan antara dua mod yang dilaporkan Google juga penting untuk arkitek. Transkripsi penstriman — angka WER 4.0 peratus — memperdagangkan beberapa ketepatan untuk kependaman subsaat, yang memerlukan kes penggunaan interaktif seperti ejen suara langsung. Transkripsi kelompok audio yang dirakam berjalan lebih perlahan tetapi mencecah 2.6 peratus, itulah sebabnya analisis pasca panggilan dan pemprosesan arkib mampu menjadi lebih menuntut. Keputusan Google untuk mendedahkan kedua-duanya sebagai titik akhir model yang berasingan dan bukannya satu tetapan boleh laras mengakui bahawa pembangun membina produk yang berbeza pada kedua-dua belah pertukaran itu.

Aliran kerja berperingkat untuk penghasilan video

Kemas kini Omni 1.1 Flash adalah sama pragmatik tentang cara kerja kreatif sebenarnya berlaku. Video generatif mahal untuk diulang: setiap percubaan pantas bermakna pemaparan penuh. Mod pratonton 360p baharu memisahkan penerokaan daripada penyampaian, membenarkan pencipta melayari variasi segera dengan murah dan hanya membayar untuk peningkatan 4K pada tangkapan yang bertahan dalam semakan.

Mekanik sambungan tempat kejadian menangani masalah koheren yang telah mengekalkan video AI dalam ghetto bersaiz klip. Dengan menganalisis 10 saat konteks terdahulu dan bukannya hanya bingkai akhir, model boleh memanjangkan pemandangan dalam kenaikan 10 saat sehingga 40 saat sambil mengekalkan watak, pencahayaan dan gaya visual yang konsisten. Digabungkan dengan interpolasi bingkai pertama dan terakhir — yang memberikan titik kawalan penentu kepada editor, penanda jalan masuk dan keluar berfungsi dalam penyuntingan konvensional — rakaman yang dijana AI mula dimuatkan ke dalam saluran paip pasca pengeluaran sebenar dan bukannya menggantikannya secara borong.

Gambaran kompetitif

Kedua-duanya melancarkan meletakkan Google sebagai infrastruktur dan bukannya destinasi. Dalam ucapan, Google mengambil vendor transkripsi khusus dan susunan suara pesaing awannya dengan menggabungkan ketepatan terkini ke dalam API Gemini yang telah digunakan oleh pembangunnya. Dalam video, ia bersaing dalam pasaran yang sesak dengan syarikat permulaan yang dibiayai dengan baik dengan menekankan kawalan dan integrasi aliran kerja berbanding tontonan mentah.

Kelebihan pengedaran mungkin menjadi faktor penentu. Model transkripsi yang sama yang boleh dipanggil oleh pembangun daripada API Gemini sudahpun menguasai imlak Rambler Gboard pada Android, apl Gemini pada macOS, Antigraviti Google dan Chrome — bermakna Google boleh melunaskan pembangunan model merentas berbilion-bilion interaksi pengguna sambil mengumpul pelbagai audio dunia sebenar yang terus meningkatkannya. Bagi pembangun yang memilih susunan ucapan atau video pada tahun 2026, roda tenaga itu kini menjadi sebahagian daripada padang.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →