به گزارش Engadget، متا روز دوشنبه از یک مدل هوش مصنوعی صوتی جدید رونمایی کرد که می تواند بین چندین بلندگو تمایز قائل شود و چندین زبان را در زمان واقعی رونویسی کند. اطلاعات ابتدا اعلامیه مدل صوتی را گزارش کرد، در حالی که یک محصول همراه - Muse Voice Transcribe که دیکته صوتی بیدرنگ را به مک میآورد - توسط 9to5Mac شرح داده شد.
انتشار دوقلو نشان می دهد که متا صدا را به عنوان ورودی درجه یک برای پشته هوش مصنوعی خود در نظر می گیرد، نه یک فکر بعدی. رونویسی بیدرنگ که میتواند بلندگوهای همپوشانی را مدیریت کند، تغییر زبان در میانه مکالمه، و دیکته در سراسر سیستم، قابلیتهایی هستند که صدا را از یک ویژگی جدید به یک رابط کاربری روزانه تبدیل میکنند. For more context on this story, see our ongoing breaking AI news.
یک مدل، صداهای زیاد، زبان های بسیار
همانطور که Engadget گزارش کرده است، قابلیت عنوان، توانایی این مدل برای تمایز بین چندین سخنران و چندین زبان در زمان واقعی است. این ترکیب به دو مشکل دشوار در رونویسی عملی به طور همزمان پاسخ میدهد: دیاریزاسیون گوینده - فهمیدن اینکه چه کسی چه گفته است - و تشخیص چند زبانه، که در آن مکالمه بدون مکث بین زبانها حرکت میکند.
اکثر خطوط لوله رونویسی موجود این مراحل را به عنوان مراحل جداگانه در نظر می گیرند: ابتدا یک مدل دیاریزاسیون بلندگوها را تقسیم می کند، سپس یک مدل شناسایی هر بخش را رونویسی می کند. ادغام آنها در یک مدل بیدرنگ تنها چیزی است که این فناوری را برای موارد استفاده زنده - جلسات، مصاحبهها، تماسهای مشتری، همپوشانیهای ترجمه زنده - که انتظار برای پردازش پس از آن هدف را شکست میدهد، قابل اجرا میکند.
Muse Voice Transcript دیکته را به هر برنامه مک میآورد
در کنار این مدل، متا Muse Voice Transcript را برای macOS راهاندازی کرد. همانطور که 9to5Mac گزارش کرده است، این ابزار دیکته صوتی بیدرنگ را ارائه میکند که در برنامههای مک کار میکند - به طور موثر یک لایه دیکته در سراسر سیستم به جای یک برنامه مستقل. پوشش گجت ریویو آن را به عنوان ارائه دیکته در زمان واقعی به هر برنامه مک توصیف کرد.
این طراحی برای پذیرش اهمیت دارد. ابزارهای دیکته در اصطکاک زنده می شوند یا می میرند: اگر کاربران مجبور باشند متن را از یک پنجره جداگانه کپی کنند، استفاده از آن را متوقف می کنند. کار در سطح سیستم به این معنی است که ورودی صوتی در هر جایی که مکان نما چشمک می زند در دسترس می شود - ایمیل، ویرایشگرهای کد، برنامه های پیام رسانی، اسناد - که دقیقاً چگونه موفق ترین ابزار دیکته مخاطبان خود را به دست آورده اند.
نسخه مک همچنین قلمرو قابل توجهی را برای متا مشخص می کند. تلاشهای هوش مصنوعی این شرکت بر برنامههای تلفن همراه، دستیار هوش مصنوعی متا و مدلهای خانواده لاما و خانواده موز متمرکز شده است. ارسال یک ابزار بهرهوری دسکتاپ صیقلی برای پلتفرم اپل، متا را در تماس مستقیم با پایگاه کاربر حرفهای قرار میدهد که در طول تاریخ برای رسیدن به آن تلاش کرده است – و آن را در رقابت با ابزارهای دیکته و رونویسی موجود در پلتفرم قرار میدهد.
یک میدان شلوغ که سریعتر می شود
متا در حال ورود به بازاری است که طی دو سال گذشته مجدداً قیمت گذاری و مهندسی شده است. مدلهای منبع باز Whisper OpenAI، پایهای را برای رونویسی چندزبانه در دسترس قرار میدهند، و API GPT Transcribe پولی این شرکت از نظر قیمت، بخش زیادی از بازار تجاری را کاهش داد. در همین حال، گوگل به شدت در همین راستا تلاش کرده است: مدلهای رونویسی مبتنی بر Gemini که دهها زبان را در زمان واقعی پوشش میدهند، برای توسعهدهندگان عرضه شدهاند، همانطور که وقتی گوگل مدلهای رونویسی گفتار 85 زبانی خود را ارسال کرد، پوشش دادیم.
در مقابل این پسزمینه، تمایز از دقت خام - جایی که رهبران در معیارهای استاندارد در نویز یکدیگر قرار میگیرند - به جزئیات عملی تغییر کرده است: تأخیر، مدیریت بلندگو، تغییر کد بین زبانها، قیمتگذاری، و مکان اجرای مدل. تاکید متا بر تشخیص همزمان چند سخنران و چند زبانه در زمان واقعی دقیقاً همان جزئیات عملی را هدف قرار می دهد.
چرا صدا ناگهان استراتژیک است
زمان بندی تصادفی نیست. Voice در حال تبدیل شدن به رابط پیشفرض برای عوامل هوش مصنوعی است و شرکتهایی که دارای لایه صوتی هستند - ضبط، رونویسی، درک، پاسخ - طبیعیترین نقطه ورود به تجربیات دستیار را کنترل میکنند. متا در مورد جاهطلبیهای خود برای عینکهای هوش مصنوعی و دستگاههای پوشیدنی، که صدا اساساً تنها ورودی عملی است، به طور عمومی اعلام کرده است. یک مدل صوتی سریع، دقیق و در حال حرکت، زیرساخت این نقشه راه است.
زاویه سازمانی نیز وجود دارد. جلسات، تماسهای پشتیبانی و کار میدانی حجم عظیمی از صدای چند بلندگو تولید میکنند که سازمانها میخواهند قابل جستجو و عمل باشند. مدلی که در حین انجام مکالمه به طور قابل اعتماد رونویسی می کند - با برچسب بلندگوها و استفاده از زبان ها بدون پیکربندی دستی - تفاوت بین نسخه نمایشی و محصول است.
رونویسی بلادرنگ مزایایی فراتر از راحتی نیز دارد. زیرنویسهای زنده، جلسات، کلاسهای درس و برنامهها را برای کاربران ناشنوا و کم شنوا قابل دسترس میکنند و زیرنویسهای چندزبانه فوری موانع زبانی را برای تیمهای بینالمللی کاهش میدهند. وقتی رونویسی به اندازه کافی سریع باشد تا با گفتار طبیعی همگام شود و به اندازه کافی برای ردیابی چند سخنران به طور همزمان قوی باشد، این ویژگیهای دسترسی دیگر امکانات ویژه نیستند و به پیشفرضهایی تبدیل میشوند که در ابزارهای روزمره تعبیه شدهاند.
متا قیمت یا جزئیات کامل در دسترس بودن را در پوشش اولیه اعلام نکرده است. اما جهت آن غیرقابل انکار است: لایه صوتی پشته هوش مصنوعی، که مدتها به عنوان یک کالا در نظر گرفته میشد، اکنون به جبههای در جنگ پلتفرم تبدیل شده است - و متا تصمیم گرفته است که روی آن بجنگد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
