Google, şirketin doğal sesli konuşma için şimdiye kadarki en gelişmiş model olarak tanımladığı bir çift canlı diyalog modeli olan Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking'i piyasaya sürdü. Modeller, 15 Eylül'de Gemini API, Google AI Studio, Search Live, Gemini Live ve Google Workspace'te Gemini Enterprise aracılığıyla özel önizlemeyle kurumsal erişimle kullanıma sunulmaya başladı.
Duyuru, Gemini Ses Ekibi adına yazan baş mühendis Tom Ouyang ve teknik personel üyesi Malini Jaganathan'dan geldi. Bu ayın başlarında piyasaya sürülen Gemini 3.8 ailesini Flash ve Flash Cyber modelleriyle genişletiyor ve Google'ın, OpenAI'nin ses modu ve konuşma dalgası girişimlerinin aynı günlük kullanım durumu için rekabet ettiği bir pazar olan gerçek zamanlı, çok modlu ses yardımına yönelik şimdiye kadarki en agresif hamlesine işaret ediyor.
Lansman, Google'ın model serisi için oldukça kalabalık bir alana sığıyor; En son AI gelişmelerinin kapsamı, şirketin fiyatlandırma, kodlama ve artık ses konusunda rakipleriyle mücadele ederken birkaç hafta içinde tekrar tekrar sevkiyat yaptığını gösteriyor.
Gerçek Zamanlı Konuşma için Tasarlandı
Canlı modelleri mikrofon takılı standart sohbet modelinden ayıran şey gecikme ve durumdur. Google'ın Live API belgeleri, durum bilgisi olan bir WebSocket bağlantısı üzerinden sürekli ses, görüntü ve metin akışlarını işleyen, ham 16kHz PCM sesi, saniyede bir kareye kadar JPEG görüntüleri ve metni kabul eden ve konuşulan sesi gerçek zamanlı olarak geri döndüren düşük gecikmeli bir arayüzü açıklar.
Modeller görsel girişi neredeyse gerçek zamanlı olarak işleyerek asistanın kullanıcının gördüklerini görmesine olanak tanıyor. Google'ın tanıtım videoları Gemini 3.8 Live'ın görsel bağlamı kullanarak bir çalışanın işe alım oturumuna rehberlik ettiğini, neredeyse gerçek zamanlı olarak satranç oynadığını ve doğal konuşma yoluyla eksiksiz iş planları ve özel pazarlama araç setleri oluşturduğunu gösteriyor. Modeller ayrıca, kullanıcının ayarları değiştirmesine gerek kalmadan, konuşmanın ortasında desteklenen 97 dili otomatik olarak algılayıp bunlar arasında geçiş yapabiliyor.
Pratik kullanım açısından belki de en önemlisi: Modeller, konuşma devam ederken arka planda araçları ve API çağrılarını yürütür, istekleri kabul eder ve görevler tamamlanırken diyaloğun devam etmesini sağlar. Bu, asistanı kesinlikle sıra tabanlı bir yanıtlayıcıdan, konuşan bir temsilciye daha yakın bir şeye dönüştürüyor.
Google'ın Önerdiği Rakamlar
Google, Gemini 3.8 Live Extended Thinking'in Yapay Analiz Konuşmadan Konuşmaya Kalite Endeksi'nde 82,6 puanla en üst sırayı yakaladığını bildirdi. Temsilcilik görevinin tamamlanmasında şirket, Big Bench Audio'da %97,7'lik bir puanın yanı sıra, τ-Voice kıyaslamasında %68,6 ve Sierra'nın τ-Voice-bankacılık değerlendirmesinde %35,1 puan aldı.
Bunlar Google'ın kendi bildirdiği rakamlardır ve bağımsız doğrulama zaman alacaktır; ancak Yapay Analiz tablosunun en üst sıralarında yer alma iddiası, eğer doğruysa, Google'ı, genel konuşma kalitesi açısından OpenAI ve özel sesli yapay zeka şirketlerinin sunduğu konuşmaya göre optimize edilmiş tekliflerin önüne koyacaktır. Google ayrıca, Genişletilmiş Düşünme'nin son derece rekabetçi bir fiyat noktasını koruduğunu ve 3.8 neslini tanımlayan fiyat baskısına üstü kapalı bir selam verdiğini söylüyor.
Modeller tarafından oluşturulan tüm sesler, Google'ın algılanamaz filigranı olan SynthID ile filigranlanır, böylece yapay zeka tarafından oluşturulan konuşma tespit edilebilir kalır; bu, Google'ın üretken ürünlerinde standart hale gelen bir uyumluluk ve yanlış bilgilendirme korumasıdır.
Nerede Kullanabilirsiniz?
Kullanılabilirlik iki model arasında farklılık gösterir. Gemini 3.8 Live, Google'ın gerçek zamanlı görsel arama modu olan Search Live'da herkesin kullanımına açıktır. Extended Thinking, Gemini Live'da, Workspace aracılığıyla Google AI Pro ve Ultra aboneleri için Dokümanlar'da ve tüm Google kullanıcıları için Gmail ve Keep'te kullanılabilir.
Geliştiriciler modelleri Gemini API ve Google AI Studio aracılığıyla alıyor ve Google, Live API'nin halihazırda Agora, Fishjam, LiveKit, Pipecat, Vercel ve Vision Agents gibi platformlar tarafından Google'ın gerçek zamanlı altyapısı üzerinde ses odaklı arayüzler oluşturmak için kullanıldığını söylüyor. Salesforce, Genspark ve Lumeris, yeni modellerin lansman ortakları olarak adlandırılıyor.
Kalabalık Bir Ses Yapay Zeka Pazarı
Ses, 2026'nın arayüz savaş alanı haline geliyor çünkü yapay zekanın nihayet klavyeden kaçtığı yer burası. Görebilen, dinleyebilen, dil değiştirebilen ve konuşurken araçları çalıştırabilen bir model, diğer sohbet robotlarıyla değil, telefon görüşmesiyle, müşteri destek hattıyla ve kişisel asistanla rekabet ediyor.
Google'ın avantajı dağıtımdır: Arama, Android, Workspace ve Chrome, Live modellerine hiçbir rakibin ulaşamayacağı bir kurulu taban sağlar. Şirket, artık en iyi ses modelleriyle bir kullanıcının gününün her köşesinde yer almanın, herhangi bir kıyaslama zaferinden daha önemli olacağına bahse giriyor. Rakipler yanıt verme şansını yakalayacak, ancak Google, bir zamanlar demo özelliği olan sesin artık birinci sınıf bir ürün grubu olduğunu açıkça belirtti.
Geliştiriciler için de mesaj benzer şekilde doğrudandır. Google, tam giriş formatlarını yayınlayarak, arka planda araç çalıştırmayı belgeleyerek ve ekosistemi Canlı API platformlarıyla tohumlayarak, müşteri destek botlarından giyilebilir asistanlara kadar sözlü arayüzler oluşturan herkes için kendi yığınını varsayılan alt katman haline getirmeye çalışıyor. Gemini 3.8 Live'ın kalite iddiaları bağımsız testlerde geçerli olsa da kullanılabilirlik çalışmaları halihazırda devam ediyor.
---
Yapay Zekanın Önünde OlunEn son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →