أطلقت Google Gemini 3.5 Transcribe، وهو نموذج جديد لتحويل الكلام إلى نص مصمم للنسخ في الوقت الفعلي والذي يتعرف على أكثر من 85 لغة تلقائيًا - ويصقل الإخراج على طول الطريق، ويزيل الكلمات الحشو ويصحح الأخطاء اللفظية دون أن يُطلب منك ذلك.

يؤدي هذا الإطلاق إلى وضع حزمة الكلام من Google كمنافس مباشر في سوق النسخ سريع النمو، حيث تحدد الدقة وزمن الوصول بشكل متزايد الخدمات التي يعتمدها المطورون للمكالمات والاجتماعات والتسميات التوضيحية والواجهات الصوتية. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.

ما يمكن أن يفعله النموذج

وفقًا لإعلان Google، الذي نشرته The Decoder، فإن Gemini 3.5 Transcribe يذهب إلى ما هو أبعد من تحويل الكلمات المنطوقة إلى نص:

  • الكشف التلقائي عن اللغة عبر أكثر من 85 لغة، دون الحاجة إلى أي تكوين
  • إزالة كلمات الحشو، وتنظيف "um"، و"uh"، وما شابه ذلك من عدم الطلاقة
  • تصحيح زلات اللسان، وإنتاج نثر مقروء بدلاً من الضجيج الحرفي
  • تنسيق النص المستقل، بما في ذلك علامات الترقيم والبنية

أبلغت الشركة عن معدل خطأ في الكلمات يبلغ 4.0 بالمائة لتدفق الصوت و2.6 بالمائة للصوت المسجل، إلى جانب تخفيضات في زمن الوصول بنسبة 70 بالمائة تقريبًا مقارنة بسابقه، Chirp 3 - وهو هامش كبير في سيناريوهات التسميات التوضيحية المباشرة حيث يقطع التأخير المحادثات.

واجهتان لوظيفتين

يحصل المطورون على إمكانية الوصول من خلال واجهتين متميزتين لبرمجة التطبيقات:

Live API — `gemini-3.5-transcribe-live`

يتعامل مع البث في الوقت الفعلي مع زمن استجابة منخفض للغاية، ويستهدف التسميات التوضيحية المباشرة ووكلاء الصوت والمساعدين التفاعليين حيث يكون وقت الاستجابة أكثر أهمية.

واجهة برمجة تطبيقات التفاعلات — `gemini-3.5-transcribe`

يعالج الصوت المسجل ويعيد النصوص مع إسناد المتحدث والطوابع الزمنية - سير العمل النموذجي للاجتماعات والمقابلات والبودكاست والوسائط في مرحلة ما بعد الإنتاج.

بالإضافة إلى النسخ، يدعم النموذج استدعاء الوظائف، مما يعني أنه يمكنه تفويض مهام المتابعة إلى نماذج أخرى في عائلة Gemini - على سبيل المثال تشغيل طلب إنشاء صورة أو بحث على الويب بناءً على شيء قيل أثناء الجلسة. يؤدي ذلك إلى تحويل محرك النسخ إلى طبقة واجهة يمكن التحكم فيها للتطبيقات التي تعتمد على الصوت.

يتم الشحن بالفعل عبر منتجات Google

النموذج موجود حاليًا في Google AI Studio وعلى Gemini Enterprise Agent Platform للمطورين اليوم. وقد قامت جوجل أيضًا بتوصيله إلى الأسطح الاستهلاكية: Gboard على Android يستخدمه عبر مكون داخلي يسمى Rambler للإملاء، تطبيق Gemini على macOS يطبقه على الإدخال الصوتي، ومن المقرر أن يتبعه تكامل Chrome.

هذا التوزيع مهم. يحظى التعرف على الكلام بمكانته على نطاق واسع، كما أن تضمين النموذج في لوحات المفاتيح وتطبيقات سطح المكتب والمتصفحات يضعه أمام مليارات من تفاعلات الإدخال يوميًا - مع تغذية حلقات التقييم اللازمة للحفاظ على انخفاض معدلات الخطأ عبر اللهجات واللهجات والبيئات الصاخبة.

الرهانات التنافسية في الذكاء الاصطناعي للكلام

أصبح النسخ بهدوء ساحة معركة تنافسية بين المختبرات الحدودية والموردين المتخصصين على حد سواء. يعد الفهم الدقيق للكلام بزمن وصول منخفض بمثابة تذكرة دخول للمنتجات الوكيلة التي تعمل بناءً على الأوامر المنطوقة، وذكاء اجتماعات المؤسسة، وميزات إمكانية الوصول، وأتمتة خدمة العملاء متعددة اللغات.

من خلال الجمع بين تحسينات زمن الاستجابة القوية ومخرجات التصحيح الذاتي، تراهن Google على أن المطورين يفضلون النصوص التي تُقرأ مثل النص المحرر بدلاً من الالتقاط الصوتي الأولي - مما يؤدي إلى استبدال الإخلاص الحرفي الصارم لسهولة الاستخدام. الفرق التي تحتاج إلى سجلات دقيقة، مثل الناسخين القانونيين أو الطبيين، قد لا تزال ترغب في صيغ حرفية؛ وبالنسبة لأي شخص آخر، فإن الفارق العملي بين سماع شخص ما وفهمه يستمر في التضييق.

مع توفر Gemini 3.5 Transcribe الآن بشكل عام في AI Studio وأدوات المؤسسات، سيكون أول اختبار ذي معنى هو مقاييس الاعتماد من مطوري الوكلاء الصوتيين - وهو قطاع من السوق ينمو بسرعة كافية حتى أن مكاسب الدقة المتزايدة تترجم إلى قرارات تحويل كبيرة.

لماذا يعتبر زمن الاستجابة هو ساحة المعركة الحقيقية؟

تتصدر معدلات الخطأ العناوين الرئيسية، لكن زمن الوصول يحدد بهدوء المنتجات القابلة للتطبيق. يحتاج محرك النسخ الذي يغذي تراكب التسميات التوضيحية المباشرة إلى مواكبة المحادثة، وإلا فإن المشاهدين ينقطعون عن التفاعل. لا يمكن للوكيل الصوتي الذي يتفاوض بشأن مكالمة دعم العملاء أن يتوقف مؤقتًا بشكل غريب أثناء متابعة طبقة الكلام الخاصة به. إن تخفيض Google في التأخير بنسبة 70 بالمائة مقارنةً بـ Chirp 3 يستهدف هذه الفجوة على وجه التحديد - مما يؤدي إلى تقصير المسافة بين المتحدث الذي ينهي الجملة والأنظمة النهائية التي تعمل عليها.

بالنسبة للتطبيقات الفاعلية، يتضاعف هذا الأمر: كل دورة في الحوار المنطوق تتضمن التعرف والتفكير والاستجابة. إن تقليل أجزاء من الثانية من مرحلة التعرف يمنح البناة مجالًا للإنفاق على نماذج تفكير أكثر قدرة - وأبطأ - دون انتهاك ميزانيات توقيت المحادثة.

المقايضة الحرفية

خيار تصميم واحد يستحق التدقيق. بشكل افتراضي، يقوم Gemini 3.5 Transcribe بتنظيم الإخراج: تختفي كلمات الحشو، ويتم تصحيح الأخطاء، ويتم تطبيق التنسيق تلقائيًا. بالنسبة لمعظم الاستخدامات التجارية - الدقائق والتسميات التوضيحية والأرشيفات القابلة للبحث - فهذا هو بالضبط ما يريده المستخدمون.

لكن بعض مسارات العمل تعتمد على السجلات الحرفية. تتطلب الإفادات القانونية، ومراجعات الامتثال، والتحقق الصحفي من الحقائق في بعض الأحيان معرفة ما قيل بدقة، بما في ذلك التردد. ستحتاج المؤسسات في الصناعات الخاضعة للتنظيم إلى توضيح بشأن مقدار التجانس الاختياري والقابل للتكوين قبل ترحيل خطوط الأنابيب الحساسة إلى النموذج الجديد. ستحدد وثائق Google ومعلمات واجهة برمجة التطبيقات (API) بشكل فعال مكان وجود السطر الحرفي مقابل السطر المصقول للصناعة.

بصمة متعددة اللغات كالخندق

إن تغطية أكثر من 85 لغة مع الكشف التلقائي ليست مجرد عنصر في قائمة التحقق من الميزات. يؤدي الوصول متعدد اللغات إلى تركيز القيمة في الأسواق التي يتخلف فيها المنافسون تاريخياً: اللهجات الإقليمية، والتبديل بين اللغات في منتصف الجملة، واللغات منخفضة الموارد، كلها عوامل تعاقب النماذج المدربة بشكل ضيق على نصوص اللغة الإنجليزية الثقيلة.

بالنسبة للمؤسسات العالمية التي تدير مراكز دعم عبر عشرات البلدان، فإن نموذجًا واحدًا يتعامل مع اكتشاف اللغة بشفافية يقلل من تعقيد التكامل - مسار واحد بدلاً من العديد من التكوينات لكل سوق. إلى جانب التوزيع من خلال مليارات عمليات تثبيت Android الخاصة بـ Gboard، تضع Google تعدد اللغات عالي الجودة كبنية أساسية بدلاً من كونها قدرة متميزة.

ما يجب مشاهدته

ستُظهر ثلاث إشارات ما إذا كان برنامج Gemini 3.5 Transcribe سيغير حصته في السوق أم أنه سيرفع التوقعات فقط: ترحيل المطورين في معايير الطرف الثالث خلال الأشهر المقبلة؛ مدى سرعة مطابقة المنافسين لأرقام زمن الوصول بدلاً من ادعاءات الدقة؛ وما إذا كانت خطافات استدعاء الوظائف تولد موجة من العوامل الصوتية الأولى المبنية أصلاً على الجوزاء. لقد أصبح الإطلاق مباشرًا الآن، ويجب أن تجعل مستويات التسعير من خلال AI Studio التجارب رخيصة بما يكفي بحيث تنخفض تكاليف التحويل إلى لا شيء تقريبًا.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →