كشفت شركة ميتا النقاب عن نموذج جديد للذكاء الاصطناعي الصوتي يوم الاثنين يمكنه التمييز بين مكبرات صوت متعددة ونسخ لغات متعددة في الوقت الفعلي، وفقًا لموقع Engadget، في خطوة تدفع الشركة إلى التعمق في سوق الذكاء الاصطناعي للكلام المزدحم بشكل متزايد. أبلغت The Information لأول مرة عن إعلان النموذج الصوتي، بينما تم تفصيل المنتج المصاحب – Muse Voice Transcribe، الذي يوفر الإملاء الصوتي في الوقت الفعلي لنظام Mac – بواسطة 9to5Mac.

تشير الإصدارات المزدوجة إلى أن Meta تتعامل مع الصوت كمدخل من الدرجة الأولى لمكدس الذكاء الاصطناعي الخاص بها، وليس كفكرة لاحقة. إن النسخ في الوقت الفعلي الذي يمكنه التعامل مع مكبرات الصوت المتداخلة، وتبديل اللغة في منتصف المحادثة، والإملاء على مستوى النظام هي الإمكانيات التي تحول الصوت من ميزة جديدة إلى واجهة للاستخدام اليومي. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.

نموذج واحد، أصوات عديدة، لغات عديدة

القدرة الرئيسية، كما ذكرت Engadget، هي قدرة النموذج على التمييز بين متحدثين متعددين ولغات متعددة في الوقت الفعلي. يعالج هذا المزيج أصعب مشكلتين في النسخ العملي في وقت واحد: مذكرات المتحدث - معرفة من قال ماذا - والتعرف على اللغات المتعددة، حيث تنتقل المحادثة بين اللغات دون توقف.

تتعامل معظم مسارات النسخ الحالية مع هذه المراحل على أنها مراحل منفصلة: أولاً يقوم نموذج التدوين بتقسيم المتحدثين، ثم يقوم نموذج التعرف بنسخ كل مقطع. إن دمجها في نموذج واحد في الوقت الفعلي هو ما يجعل التكنولوجيا قابلة للتطبيق لحالات الاستخدام المباشر - الاجتماعات والمقابلات ومكالمات العملاء وتراكبات الترجمة المباشرة - حيث يؤدي انتظار المعالجة اللاحقة إلى إحباط الغرض.

يوفر Muse Voice Transcribe الإملاء لكل تطبيق Mac

إلى جانب النموذج، أطلقت Meta Muse Voice Transcribe لنظام التشغيل macOS. كما أفاد موقع 9to5Mac، توفر الأداة إملاءً صوتيًا في الوقت الفعلي يعمل عبر تطبيقات Mac - وهي طبقة إملاء فعالة على مستوى النظام بدلاً من تطبيق مستقل. وصفته تغطية Gadget Review بأنه يوفر الإملاء في الوقت الفعلي لكل تطبيق Mac.

هذا التصميم مهم لاعتماده. أدوات الإملاء تعيش أو تموت بسبب الاحتكاك: إذا اضطر المستخدمون إلى نسخ نص من نافذة منفصلة، ​​فإنهم يتوقفون عن استخدامه. إن العمل على مستوى النظام يعني أن الإدخال الصوتي يصبح متاحًا في أي مكان يومض فيه المؤشر - البريد الإلكتروني، ومحررات الأكواد، وتطبيقات المراسلة، والمستندات - وهذا هو بالضبط السبب وراء نجاح أدوات الإملاء الأكثر نجاحًا في جذب جماهيرها.

يمثل إصدار Mac أيضًا منطقة بارزة لـ Meta. تركزت جهود الشركة في مجال الذكاء الاصطناعي على تطبيقات الهاتف المحمول، ومساعد Meta AI، ونماذج عائلة Llama وMuse. إن شحن أداة إنتاجية مصقولة لسطح المكتب لمنصة Apple يضع Meta على اتصال مباشر مع قاعدة مستخدمين محترفين كافحت تاريخيًا للوصول إليها - ويضعها في منافسة مع أدوات الإملاء والنسخ الموجودة على النظام الأساسي.

حقل مزدحم يزداد سرعته باستمرار

تدخل Meta سوقًا تمت إعادة تسعيره وإعادة هندسته على مدار العامين الماضيين. تحدد نماذج Whisper مفتوحة المصدر من OpenAI خط الأساس للنسخ متعدد اللغات الذي يمكن الوصول إليه، كما أن واجهة برمجة تطبيقات GPT Transcribe API المدفوعة للشركة تقوض الكثير من السوق التجارية من حيث السعر. وفي الوقت نفسه، دفعت جوجل بقوة في نفس الاتجاه: فقد تم طرح نماذج النسخ المدعومة من جيميني والتي تغطي عشرات اللغات في الوقت الفعلي للمطورين، كما غطينا عندما قامت جوجل بشحن نماذج نسخ الكلام في الوقت الفعلي المكونة من 85 لغة.

على هذه الخلفية، تحول التمايز من الدقة الأولية - حيث يتجمع القادة ضمن ضجيج بعضهم البعض وفقًا للمعايير القياسية - إلى التفاصيل العملية: زمن الاستجابة، والتعامل مع المتحدثين، والتبديل بين اللغات، والتسعير، ومكان تشغيل النموذج. إن تركيز Meta على التعرف المتزامن على المتحدثين المتعددين واللغات المتعددة في الوقت الفعلي يستهدف على وجه التحديد تلك التفاصيل العملية.

لماذا أصبح الصوت فجأة استراتيجيا

التوقيت ليس عرضيًا. أصبح الصوت هو الواجهة الافتراضية لعملاء الذكاء الاصطناعي، والشركات التي تمتلك الطبقة الصوتية - الالتقاط والنسخ والفهم والاستجابة - تتحكم في نقطة الدخول الأكثر طبيعية للتجارب المساعدة. لقد أعلنت شركة Meta علنًا عن طموحاتها فيما يتعلق بنظارات الذكاء الاصطناعي والأجهزة القابلة للارتداء، حيث يكون الصوت هو المدخل العملي الوحيد. يعد النموذج الصوتي السريع والدقيق أثناء التنقل بمثابة البنية التحتية لخريطة الطريق هذه.

هناك أيضًا زاوية المؤسسة. تولد الاجتماعات ومكالمات الدعم والعمل الميداني كميات هائلة من الصوت متعدد المتحدثين الذي تريده المؤسسات بحيث يكون قابلاً للبحث والتنفيذ. إن النموذج الذي يقوم بالنسخ بشكل موثوق أثناء حدوث المحادثة - مع تصنيف المتحدثين والتعامل مع اللغات دون تكوين يدوي - هو الفرق بين العرض التوضيحي والمنتج.

يحمل النسخ في الوقت الفعلي فوائد تتجاوز الراحة أيضًا. تعمل التسميات التوضيحية المباشرة على تسهيل الوصول إلى الاجتماعات والفصول الدراسية وعمليات البث للمستخدمين الصم وضعاف السمع، كما تعمل التسميات التوضيحية الفورية متعددة اللغات على تقليل الحواجز اللغوية أمام الفرق الدولية. عندما يكون النسخ سريعًا بما يكفي لمواكبة الكلام الطبيعي وقويًا بما يكفي لتتبع عدة متحدثين في وقت واحد، فإن ميزات إمكانية الوصول هذه تتوقف عن كونها تسهيلات خاصة وتصبح إعدادات افتراضية مدمجة في الأدوات اليومية.

لم تعلن Meta عن الأسعار أو تفاصيل التوفر الكاملة في التغطية الأولية. لكن الاتجاه واضح لا لبس فيه: الطبقة الصوتية لمكدس الذكاء الاصطناعي، والتي تم التعامل معها منذ فترة طويلة كسلعة، أصبحت الآن جبهة في حرب المنصات - وقد قررت ميتا القتال عليها.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →