Google telah melancarkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, sepasang model dialog langsung yang syarikat gambarkan sebagai yang paling maju lagi untuk perbualan suara semula jadi. Model tersebut mula dilancarkan pada 15 September merentas API Gemini, Google AI Studio, Search Live, Gemini Live dan Google Workspace, dengan akses perusahaan dalam pratonton peribadi melalui Gemini Enterprise.
Pengumuman itu datang daripada Tom Ouyang, seorang jurutera utama, dan Malini Jaganathan, seorang anggota kakitangan teknikal, menulis bagi pihak Pasukan Audio Gemini. Ia memanjangkan keluarga Gemini 3.8 yang memulakan kerjaya awal bulan ini dengan model Flash dan Flash Cyber, dan ia menandakan dorongan Google yang paling agresif lagi ke dalam masa nyata, bantuan suara multimodal — pasaran di mana mod suara OpenAI dan gelombang pemula pertuturan bersaing untuk kes penggunaan harian yang sama.
Pelancaran ini sesuai dengan regangan yang sangat sesak untuk barisan model Google; liputan perkembangan AI terkini menunjukkan syarikat itu kini telah dihantar berulang kali dalam tempoh beberapa minggu kerana ia menentang pesaing dalam penentuan harga, pengekodan dan kini suara.
Dibina untuk Perbualan Masa Nyata
Apa yang membezakan model Langsung daripada model sembang standard dengan mikrofon dilampirkan ialah kependaman dan keadaan. Dokumentasi API Langsung Google menerangkan antara muka kependaman rendah yang memproses aliran berterusan audio, imej dan teks melalui sambungan WebSocket yang berstatus, menerima audio PCM 16kHz mentah, imej JPEG sehingga satu bingkai sesaat dan teks serta mengembalikan audio yang dituturkan dalam masa nyata.
Model memproses input visual dalam hampir masa nyata, membenarkan pembantu melihat perkara yang pengguna lihat — video demonstrasi Google menunjukkan Gemini 3.8 Live membimbing sesi onboarding pekerja menggunakan konteks visual, bermain catur dalam masa hampir nyata dan membina rancangan perniagaan yang lengkap dan kit alat pemasaran tersuai melalui ucapan semula jadi. Model juga boleh mengesan dan beralih antara 97 bahasa yang disokong secara automatik, pertengahan perbualan, tanpa pengguna menukar tetapan.
Mungkin yang paling penting untuk kegunaan praktikal: model melaksanakan alat dan panggilan API di latar belakang semasa perbualan diteruskan, mengakui permintaan dan mengekalkan dialog semasa tugasan selesai. Itu menjadikan pembantu daripada responden mengikut giliran kepada sesuatu yang lebih dekat dengan ejen yang kebetulan bercakap.
Nombor Yang Digembar-gemburkan oleh Google
Google melaporkan bahawa Gemini 3.8 Live Extended Thinking memperoleh kedudukan teratas keseluruhan pada Indeks Kualiti Pertuturan-ke-Pertuturan Analisis Buatan dengan skor 82.6. Pada penyempurnaan tugas ejenik, syarikat memetik 68.6% pada penanda aras τ-Voice dan 35.1% pada penilaian τ-Voice-banking Sierra, di samping skor 97.7% pada Big Bench Audio.
Itu adalah angka yang dilaporkan oleh Google sendiri, dan pengesahan bebas akan mengambil masa — tetapi tuntutan ke bahagian atas carta Analisis Buatan, jika ada, akan meletakkan Google di hadapan tawaran yang dioptimumkan pertuturan daripada OpenAI dan syarikat AI suara berdedikasi pada kualiti perbualan keseluruhan. Google juga mengatakan Extended Thinking mengekalkan titik harga yang sangat kompetitif, satu anggukan tersirat kepada tekanan harga yang telah mentakrifkan generasi 3.8.
Semua audio yang dijana oleh model ditanda air dengan SynthID, tera air Google yang tidak dapat dilihat, jadi pertuturan yang dijana AI kekal dapat dikesan — perlindungan pematuhan dan maklumat salah yang menjadi standard merentas produk generatif Google.
Tempat Anda Boleh Menggunakannya
Ketersediaan berbeza antara kedua-dua model. Gemini 3.8 Live tersedia untuk semua orang dalam Search Live, mod carian visual masa nyata Google. Extended Thinking tersedia dalam Gemini Live, dalam Docs untuk Google AI Pro dan pelanggan Ultra melalui Workspace serta dalam Gmail dan Keep untuk semua pengguna Google.
Pembangun mendapatkan model melalui API Gemini dan Google AI Studio, dan Google berkata Live API sudah digunakan oleh platform termasuk Agora, Fishjam, LiveKit, Pipecat, Vercel dan Ejen Vision untuk membina antara muka dipacu suara di atas infrastruktur masa nyata Google. Salesforce, Genspark dan Lumeris dinamakan sebagai rakan kongsi pelancaran untuk model baharu.
Pasaran AI Suara Sesak
Suara menjadi medan pertempuran antara muka 2026 kerana di situlah AI akhirnya terlepas dari papan kekunci. Model yang boleh melihat, mendengar, menukar bahasa dan menjalankan alatan semasa bercakap tidak bersaing dengan bot sembang lain tetapi dengan panggilan telefon, talian sokongan pelanggan dan pembantu peribadi.
Kelebihan Google ialah pengedaran: Carian, Android, Ruang Kerja dan Chrome memberikan model Langsung asas yang dipasang yang tidak dapat dipadankan oleh saingan. Syarikat itu bertaruh bahawa kehadiran di setiap sudut hari pengguna — kini dengan model suara terbaiknya — akan lebih penting daripada sebarang kemenangan penanda aras tunggal. Saingan akan mendapat peluang untuk bertindak balas, tetapi Google telah menjelaskan bahawa suara, sekali ciri demo, kini merupakan barisan produk kelas pertama.
Bagi pembangun, mesej adalah sama secara langsung. Dengan menerbitkan format input yang tepat, mendokumentasikan pelaksanaan alat latar belakang dan menyemai ekosistem dengan platform API Langsung, Google cuba menjadikan timbunannya sebagai substrat lalai bagi sesiapa sahaja yang membina antara muka pertuturan — daripada bot sokongan pelanggan kepada pembantu boleh pakai. Sama ada tuntutan kualiti Gemini 3.8 Live bertahan di bawah ujian bebas, permainan ketersediaan sudah pun digerakkan.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →