گوگل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را راه اندازی کرده است، یک جفت مدل گفتگوی زنده که این شرکت آن را پیشرفته ترین تا کنون برای مکالمه صوتی طبیعی توصیف می کند. این مدل‌ها در ۱۵ سپتامبر در Gemini API، Google AI Studio، Search Live، Gemini Live و Google Workspace با دسترسی سازمانی در پیش‌نمایش خصوصی از طریق Gemini Enterprise عرضه شدند.

این اعلامیه از سوی تام اویانگ، یک مهندس اصلی، و مالینی جاگاناتان، یکی از اعضای کادر فنی، به نمایندگی از تیم صوتی جمینی منتشر شد. خانواده Gemini 3.8 را که در اوایل ماه جاری با مدل‌های Flash و Flash Cyber ​​معرفی شد، گسترش می‌دهد و تهاجمی‌ترین فشار گوگل را تا کنون به سمت کمک صوتی چندوجهی در زمان واقعی نشان می‌دهد – بازاری که حالت صوتی OpenAI و موجی از استارت‌آپ‌های گفتاری برای یک مورد استفاده روزانه با هم رقابت می‌کنند.

این راه‌اندازی در محدوده‌ای بسیار شلوغ برای خط مدل گوگل قرار می‌گیرد. پوشش [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) نشان می‌دهد که این شرکت اکنون در طول چند هفته بارها و بارها ارسال کرده است زیرا با رقبای خود در قیمت‌گذاری، کدنویسی و اکنون صدا مبارزه می‌کند.

برای مکالمه در زمان واقعی ساخته شده است

چیزی که مدل‌های Live را از یک مدل چت استاندارد با میکروفون متصل متمایز می‌کند، تأخیر و حالت است. اسناد Google's Live API یک رابط با تأخیر کم را توصیف می‌کند که جریان‌های پیوسته صدا، تصاویر و متن را از طریق اتصال WebSocket حالت‌پذیر پردازش می‌کند، صدای خام PCM با فرکانس ۱۶ کیلوهرتز، تصاویر JPEG تا حداکثر یک فریم در ثانیه و متن را می‌پذیرد و صدای گفتاری را در زمان واقعی برمی‌گرداند.

این مدل‌ها ورودی بصری را تقریباً در زمان واقعی پردازش می‌کنند و به دستیار اجازه می‌دهند تا آنچه را که کاربر می‌بیند ببیند - ویدیوهای نمایشی Google نشان می‌دهد که Gemini 3.8 Live با استفاده از زمینه بصری، جلسه ورود کارمند را با استفاده از زمینه بصری، بازی شطرنج در زمان واقعی، و ایجاد طرح‌های تجاری کامل و ابزارهای بازاریابی سفارشی از طریق گفتار طبیعی، راهنمایی می‌کند. این مدل‌ها همچنین می‌توانند به طور خودکار، در اواسط مکالمه، بدون تغییر تنظیمات کاربر، ۹۷ زبان پشتیبانی‌شده را شناسایی و بین آن‌ها انتقال دهند.

شاید مهم‌ترین برای استفاده عملی: مدل‌ها ابزارها و فراخوان‌های API را در پس‌زمینه اجرا می‌کنند، در حالی که مکالمه ادامه دارد، درخواست‌ها را تأیید می‌کنند و گفتگو را تا پایان کار ادامه می‌دهند. این باعث می شود دستیار از یک پاسخ دهنده کاملاً نوبتی به چیزی نزدیک تر به نماینده ای تبدیل شود که اتفاقاً صحبت می کند.

اعدادی که گوگل تبلیغ می کند

گوگل گزارش می دهد که Gemini 3.8 Live Extended Thinking جایگاه برتر را در شاخص کیفیت گفتار به گفتار تحلیل مصنوعی با امتیاز 82.6 به خود اختصاص داده است. در تکمیل وظایف نمایندگی، این شرکت 68.6 درصد در معیار τ-Voice و 35.1 درصد در ارزیابی بانکداری τ-Voice Sierra، در کنار امتیاز 97.7 درصد در Big Bench Audio ذکر کرده است.

اینها ارقام گزارش شده خود گوگل هستند و راستی‌آزمایی مستقل زمان می‌برد – اما ادعای صدر جدول تجزیه و تحلیل مصنوعی، در صورت وجود، گوگل را از پیشنهادات بهینه‌شده برای گفتار از OpenAI و شرکت‌های اختصاصی هوش مصنوعی صوتی در کیفیت کلی مکالمه پیشی می‌گیرد. گوگل همچنین می گوید که Extended Thinking یک نقطه قیمت بسیار رقابتی را حفظ می کند، یک اشاره ضمنی به فشار قیمتی که نسل 3.8 را تعریف کرده است.

تمام صدای تولید شده توسط مدل‌ها با SynthID، واترمارک نامحسوس Google، واترمارک می‌شوند، بنابراین گفتار تولید شده توسط هوش مصنوعی قابل تشخیص باقی می‌ماند - حفاظت از انطباق و اطلاعات نادرست که در محصولات تولیدی Google استاندارد می‌شود.

جایی که می توانید از آن استفاده کنید

در دسترس بودن بین این دو مدل متفاوت است. Gemini 3.8 Live برای همه افراد داخل Search Live، حالت جستجوی بصری بی‌درنگ Google در دسترس است. Extended Thinking در Gemini Live، در Docs برای مشترکین Google AI Pro و Ultra از طریق Workspace و در Gmail و Keep برای همه کاربران Google در دسترس است.

توسعه‌دهندگان مدل‌ها را از طریق Gemini API و Google AI Studio دریافت می‌کنند و گوگل می‌گوید که Live API قبلاً توسط پلتفرم‌هایی مانند Agora، Fishjam، LiveKit، Pipecat، Vercel و Vision Agents برای ایجاد رابط‌های صوتی بر روی زیرساخت‌های بلادرنگ Google استفاده می‌شود. Salesforce، Genspark و Lumeris به عنوان شرکای عرضه مدل های جدید نام برده می شوند.

بازار هوش مصنوعی صدای شلوغ

Voice در حال تبدیل شدن به میدان نبرد رابط کاربری در سال 2026 است، زیرا این همان جایی است که هوش مصنوعی در نهایت از صفحه کلید فرار می کند. مدلی که می تواند هنگام صحبت کردن ببیند، گوش دهد، زبان را تغییر دهد و ابزارها را اجرا کند، نه با چت ربات های دیگر، بلکه با تماس تلفنی، خط پشتیبانی مشتری و دستیار شخصی رقابت می کند.

مزیت Google توزیع است: جستجو، Android، Workspace و Chrome به مدل‌های Live پایگاه نصب‌شده‌ای می‌دهند که هیچ رقیبی نمی‌تواند با آن مطابقت کند. این شرکت شرط می‌بندد که حضور در هر گوشه‌ای از روز کاربر - اکنون با بهترین مدل‌های صوتی خود - بیشتر از هر معیاری برای برد مهم است. رقبا فرصت پاسخگویی را خواهند داشت، اما گوگل به وضوح اعلام کرده است که صدا که زمانی یک ویژگی نمایشی بود، اکنون یک خط محصول درجه یک است.

برای توسعه دهندگان، پیام به طور مشابه مستقیم است. با انتشار قالب‌های ورودی دقیق، مستندسازی اجرای ابزار پس‌زمینه و ایجاد اکوسیستم با پلت‌فرم‌های Live API، گوگل تلاش می‌کند تا پشته خود را به بستر پیش‌فرض برای هر کسی که رابط‌های گفتاری می‌سازد - از ربات‌های پشتیبانی مشتری گرفته تا دستیارهای پوشیدنی، تبدیل کند. چه ادعای کیفیت Gemini 3.8 Live تحت آزمایش مستقل باقی بماند، بازی در دسترس بودن در حال حاضر در حال حرکت است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →