طرحت Google نموذجين جديدين لتحويل النص إلى كلام يوم الأربعاء - Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS - واصفة إياهم بنماذج توليد الصوت الأكثر تعبيراً حتى الآن. النماذج متاحة عبر Google AI Studio وGemini API وGemini Enterprise وGemini Notebook وGoogle Vids، وفقًا لإعلان Google من Leland Rechis، مدير منتجات المجموعة، وAlan Cowen، مدير علوم الأبحاث في فريق Gemini الصوتي.

يعمل الإطلاق على نقل توليد الصوت إلى ما هو أبعد من الإعدادات الصوتية الثابتة المسبقة إلى ما تصفه Google بأنه استوديو إبداعي: ​​أصوات مصممة من مطالبة نصية، وعروض موجهة سطرًا تلو الآخر، وسقالات أمان مدمجة منذ البداية. لمعرفة المزيد حول هذا الإصدار والإصدارات الأخرى، راجع أخبار نموذج الذكاء الاصطناعي.

نموذجان، وظيفتان

يقوم الزوجان بتقسيم عبء العمل بطريقة جوجل المألوفة. تم تصميم Gemini 3.8 Flash TTS لتوجيه إبداعي عميق وتصميم الشخصيات - إنشاء أصوات جديدة تمامًا من الصفر عبر مطالبات اللغة الطبيعية للألعاب والكتب الصوتية الغامرة والبودكاست والوسائط التفاعلية، مع تحكم دقيق في إشارات التمثيل والإيقاع وتغيرات اللهجة والقنوات الخلفية. Gemini 3.8 Flash-Lite TTS هو تشغيل الصوت: مُحسّن للدبلجة ذات الحجم الكبير وإنشاء محتوى صوتي وعوامل صوتية معبرة على نطاق واسع، مع تحكم دقيق في النغمة والإيقاع والفروق الدقيقة بتكلفة أقل.

يؤطر تحديد موقع Google الزوج باعتباره تحويلًا لتوليد الصوت "من الإعدادات المسبقة الثابتة إلى استوديو إبداعي ديناميكي." تشير الشركة إلى الكتب الصوتية والألعاب والبودكاست كوجهات طبيعية للنموذج الرئيسي، في حين يستهدف الإصدار Lite السوق غير الساحرة ولكن الهائلة للدبلجة ووكلاء الصوت الدائمين، حيث تكون تكلفة الدقيقة المولدة أكثر أهمية من قوة النجوم. تم دمج كلا النموذجين في منتجات Google - من بينها Gemini Notebook وGoogle Vids - مما يشير إلى أن التكنولوجيا ستظهر في الأدوات التي تواجه المستهلك بدلاً من البقاء مجرد واجهة برمجة التطبيقات (API) فقط.

استوديو صوتي كامل، من 30 صوتًا إلى ما لا نهاية

تقول Google إن المطورين يمكنهم الآن التوسع من 30 صوتًا أصليًا إلى ما تسميه مكتبة لا نهائية. يتيح نظام التصميم الصوتي التوليدي للمستخدمين إنشاء أصوات مخصصة من خلال تحديد الدور واللهجة وخصائص الصوت عبر أكثر من 100 لغة ولهجة - وتتراوح عروض Google التجريبية من صوت DJ عالي الطاقة من ملبورن إلى "روبوت رتيب فائق النغمة" وتنين ياباني.

إلى جانب الجيل، تأتي النماذج مع مكتبة تضم أكثر من 2000 صوت جاهز للإنتاج، بما في ذلك الأصناف الإقليمية مثل الإسبانية المكسيكية والفرنسية الكيبيكية والإنجليزية الاسكتلندية.

يتم تضمين النسخ الصوتي مع حواجز الحماية: يمكن للمستخدمين إعادة إنشاء ملف تعريف صوتي متسق من عينة صوتية مدتها 30 ثانية فقط - من صوتهم، أو صوت لديهم حقوق استخدامه - مدعومًا بالتحقق من الموافقة المضمن، والعلامة المائية SynthID وبيانات اعتماد C2PA. تضيف Google أيضًا وظيفة الحفظ والتوسيع للحفاظ على اتساق الأصوات المخصصة عبر المشاريع، مع إدراج إعادة مزج الصوت - ضبط الصوت الدقيق وطبقة الصوت والسرعة واللكنة عبر المطالبات - قريبًا.

توجيه الأداء سطرًا تلو الآخر

يدعم كلا الطرازين الاتجاه الدقيق لكل خط. يمكن للمطورين كتابة توجيهاتهم المسرحية الخاصة أو السماح للنموذج بتوجيه التسليم من إشارات النص الطبيعية - وهو الفرق بين وكيل خدمة العملاء الهادئ والمشهد المشوق الهامس. تضيف الدفقات الصوتية المكتوبة مثل و و نسيجًا غير لفظي، بينما تضيف تدخلات الاستماع النشط مثل |mhm| و |نعم| التعامل مع غراء المحادثة الذي يجعل الحوار يبدو إنسانيًا.

تستهدف ميزتان العمل الطويل الشكل والمتعدد الأصوات. يحافظ الجيل الطويل على جودة الصوت والوتيرة عبر ساعات من الصوت المستمر مع الحد الأدنى من انحراف المتحدث - الذي يستهدف ملفات البودكاست والكتب الصوتية - بينما يوجه العرض المسرحي الأصلي لمتحدثين المحادثات متعددة الأدوار من نص واحد مع أخذ الأدوار بشكل طبيعي وأصوات منفصلة بوضوح.

المعايير: رقم 1 على هيوم AI

تقود Google الإعلان بأرقام الجهات الخارجية. حصل Gemini 3.8 Flash TTS على المركز الأول بشكل عام في مقياس تصميم الصوت الخاص بـ Hume AI بنتيجة 71.4، ويتصدر في نمذجة اللكنة بـ 60.8. في مؤشر الجودة الشاملة لشركة Hume AI، حصل النموذجان الجديدان على المركزين الأول والثاني على التوالي.

ينبغي دائمًا قراءة المطالبات المعيارية من البائع ببعض الحذر، لكن شركة Hume AI - وهي شركة أبحاث مستقلة للذكاء الاصطناعي الصوتي - تعد بمثابة حكم معقول لجودة الكلام، وتمنح النتائج Google نقطة نقاش ملموسة ضد المنافسين في توليد الصوت.

يستمر سباق التسلح الصوتي

تنضم الطرازات الجديدة إلى عائلة Gemini الصوتية سريعة النمو والتي تتضمن بالفعل 3.5 Live Translate و3.5 Transcribe و3.8 Live و3.8 Live Extended Thinking - النماذج الصوتية في الوقت الفعلي التي طرحتها Google في وقت سابق من هذا الشهر. الإيقاع ليس من قبيل الصدفة: فقد أصبح تركيب الكلام المعبّر والموثوق بنية تحتية أساسية لوكلاء الصوت، ودعم العملاء، وأدوات الوصول، وإنتاج الوسائط، وتريد Google أن يكون Gemini هو الطبقة الافتراضية لكل ذلك.

بالنسبة للمطورين، تعتبر الوجبات السريعة عملية وليست مستقبلية: أصبحت الآن الأصوات ذات العلامات التجارية المخصصة والدبلجة متعددة اللغات والسرد الذي يستمر لساعات طويلة متاحة الآن داخل Gemini API وAI Studio - مع إرفاق العلامات المائية.

وسوف يقرر الاقتصاد مقدار ما سيتم استخدامه من هذه الإمكانات. لم تؤكد Google على التسعير في مواد الإطلاق، ولكن وجود طبقة Flash-Lite يعني خيارًا متعمدًا منخفض التكلفة لأحمال العمل المجمعة، مما يعكس استراتيجية التقسيم التي تطبقها عبر عائلة نماذج Gemini. تحصل المؤسسات في Gemini Enterprise على نفس الإمكانات بموجب اتفاقياتها الحالية، وهو المكان الذي تتوقع Google أن يصل إليه الجزء الأكبر من الإنتاج الصوتي بكميات كبيرة.

وما يتبقى أن نرى هو مدى سرعة الصناعات الإبداعية في تبني السرد المركب. تعمل العلامة المائية والتحقق من الموافقة على تقليل الحواجز القانونية والأخلاقية، وتشير الأرقام القياسية إلى أن الجودة لم تعد هي عنق الزجاجة. إذا صمدت ادعاءات جوجل في الممارسة العملية، فإن الفجوة بين التعليق الصوتي البشري المسجل والتعليق الصوتي الذي تم إنشاؤه أصبحت الآن ضيقة بما يكفي بحيث تكون التكلفة والتحول - وليس الأصالة - هي التي ستتخذ القرار بالنسبة لمعظم المشاريع.

---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →