گوگل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را راه اندازی کرده است، یک جفت مدل گفتگوی زنده که این شرکت آن را پیشرفته ترین تا کنون برای مکالمه صوتی طبیعی توصیف می کند. این مدلها در ۱۵ سپتامبر در Gemini API، Google AI Studio، Search Live، Gemini Live و Google Workspace با دسترسی سازمانی در پیشنمایش خصوصی از طریق Gemini Enterprise عرضه شدند.
این اعلامیه از سوی تام اویانگ، یک مهندس اصلی، و مالینی جاگاناتان، یکی از اعضای کادر فنی، به نمایندگی از تیم صوتی جمینی منتشر شد. خانواده Gemini 3.8 را که در اوایل ماه جاری با مدلهای Flash و Flash Cyber معرفی شد، گسترش میدهد و تهاجمیترین فشار گوگل را تا کنون به سمت کمک صوتی چندوجهی در زمان واقعی نشان میدهد – بازاری که حالت صوتی OpenAI و موجی از استارتآپهای گفتاری برای یک مورد استفاده روزانه با هم رقابت میکنند.
این راهاندازی در محدودهای بسیار شلوغ برای خط مدل گوگل قرار میگیرد. پوشش [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) نشان میدهد که این شرکت اکنون در طول چند هفته بارها و بارها ارسال کرده است زیرا با رقبای خود در قیمتگذاری، کدنویسی و اکنون صدا مبارزه میکند.
برای مکالمه در زمان واقعی ساخته شده است
چیزی که مدلهای Live را از یک مدل چت استاندارد با میکروفون متصل متمایز میکند، تأخیر و حالت است. اسناد Google's Live API یک رابط با تأخیر کم را توصیف میکند که جریانهای پیوسته صدا، تصاویر و متن را از طریق اتصال WebSocket حالتپذیر پردازش میکند، صدای خام PCM با فرکانس ۱۶ کیلوهرتز، تصاویر JPEG تا حداکثر یک فریم در ثانیه و متن را میپذیرد و صدای گفتاری را در زمان واقعی برمیگرداند.
این مدلها ورودی بصری را تقریباً در زمان واقعی پردازش میکنند و به دستیار اجازه میدهند تا آنچه را که کاربر میبیند ببیند - ویدیوهای نمایشی Google نشان میدهد که Gemini 3.8 Live با استفاده از زمینه بصری، جلسه ورود کارمند را با استفاده از زمینه بصری، بازی شطرنج در زمان واقعی، و ایجاد طرحهای تجاری کامل و ابزارهای بازاریابی سفارشی از طریق گفتار طبیعی، راهنمایی میکند. این مدلها همچنین میتوانند به طور خودکار، در اواسط مکالمه، بدون تغییر تنظیمات کاربر، ۹۷ زبان پشتیبانیشده را شناسایی و بین آنها انتقال دهند.
شاید مهمترین برای استفاده عملی: مدلها ابزارها و فراخوانهای API را در پسزمینه اجرا میکنند، در حالی که مکالمه ادامه دارد، درخواستها را تأیید میکنند و گفتگو را تا پایان کار ادامه میدهند. این باعث می شود دستیار از یک پاسخ دهنده کاملاً نوبتی به چیزی نزدیک تر به نماینده ای تبدیل شود که اتفاقاً صحبت می کند.
اعدادی که گوگل تبلیغ می کند
گوگل گزارش می دهد که Gemini 3.8 Live Extended Thinking جایگاه برتر را در شاخص کیفیت گفتار به گفتار تحلیل مصنوعی با امتیاز 82.6 به خود اختصاص داده است. در تکمیل وظایف نمایندگی، این شرکت 68.6 درصد در معیار τ-Voice و 35.1 درصد در ارزیابی بانکداری τ-Voice Sierra، در کنار امتیاز 97.7 درصد در Big Bench Audio ذکر کرده است.
اینها ارقام گزارش شده خود گوگل هستند و راستیآزمایی مستقل زمان میبرد – اما ادعای صدر جدول تجزیه و تحلیل مصنوعی، در صورت وجود، گوگل را از پیشنهادات بهینهشده برای گفتار از OpenAI و شرکتهای اختصاصی هوش مصنوعی صوتی در کیفیت کلی مکالمه پیشی میگیرد. گوگل همچنین می گوید که Extended Thinking یک نقطه قیمت بسیار رقابتی را حفظ می کند، یک اشاره ضمنی به فشار قیمتی که نسل 3.8 را تعریف کرده است.
تمام صدای تولید شده توسط مدلها با SynthID، واترمارک نامحسوس Google، واترمارک میشوند، بنابراین گفتار تولید شده توسط هوش مصنوعی قابل تشخیص باقی میماند - حفاظت از انطباق و اطلاعات نادرست که در محصولات تولیدی Google استاندارد میشود.
جایی که می توانید از آن استفاده کنید
در دسترس بودن بین این دو مدل متفاوت است. Gemini 3.8 Live برای همه افراد داخل Search Live، حالت جستجوی بصری بیدرنگ Google در دسترس است. Extended Thinking در Gemini Live، در Docs برای مشترکین Google AI Pro و Ultra از طریق Workspace و در Gmail و Keep برای همه کاربران Google در دسترس است.
توسعهدهندگان مدلها را از طریق Gemini API و Google AI Studio دریافت میکنند و گوگل میگوید که Live API قبلاً توسط پلتفرمهایی مانند Agora، Fishjam، LiveKit، Pipecat، Vercel و Vision Agents برای ایجاد رابطهای صوتی بر روی زیرساختهای بلادرنگ Google استفاده میشود. Salesforce، Genspark و Lumeris به عنوان شرکای عرضه مدل های جدید نام برده می شوند.
بازار هوش مصنوعی صدای شلوغ
Voice در حال تبدیل شدن به میدان نبرد رابط کاربری در سال 2026 است، زیرا این همان جایی است که هوش مصنوعی در نهایت از صفحه کلید فرار می کند. مدلی که می تواند هنگام صحبت کردن ببیند، گوش دهد، زبان را تغییر دهد و ابزارها را اجرا کند، نه با چت ربات های دیگر، بلکه با تماس تلفنی، خط پشتیبانی مشتری و دستیار شخصی رقابت می کند.
مزیت Google توزیع است: جستجو، Android، Workspace و Chrome به مدلهای Live پایگاه نصبشدهای میدهند که هیچ رقیبی نمیتواند با آن مطابقت کند. این شرکت شرط میبندد که حضور در هر گوشهای از روز کاربر - اکنون با بهترین مدلهای صوتی خود - بیشتر از هر معیاری برای برد مهم است. رقبا فرصت پاسخگویی را خواهند داشت، اما گوگل به وضوح اعلام کرده است که صدا که زمانی یک ویژگی نمایشی بود، اکنون یک خط محصول درجه یک است.
برای توسعه دهندگان، پیام به طور مشابه مستقیم است. با انتشار قالبهای ورودی دقیق، مستندسازی اجرای ابزار پسزمینه و ایجاد اکوسیستم با پلتفرمهای Live API، گوگل تلاش میکند تا پشته خود را به بستر پیشفرض برای هر کسی که رابطهای گفتاری میسازد - از رباتهای پشتیبانی مشتری گرفته تا دستیارهای پوشیدنی، تبدیل کند. چه ادعای کیفیت Gemini 3.8 Live تحت آزمایش مستقل باقی بماند، بازی در دسترس بودن در حال حاضر در حال حرکت است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →