به گزارش Engadget، متا روز دوشنبه از یک مدل هوش مصنوعی صوتی جدید رونمایی کرد که می تواند بین چندین بلندگو تمایز قائل شود و چندین زبان را در زمان واقعی رونویسی کند. اطلاعات ابتدا اعلامیه مدل صوتی را گزارش کرد، در حالی که یک محصول همراه - Muse Voice Transcribe که دیکته صوتی بی‌درنگ را به مک می‌آورد - توسط 9to5Mac شرح داده شد.

انتشار دوقلو نشان می دهد که متا صدا را به عنوان ورودی درجه یک برای پشته هوش مصنوعی خود در نظر می گیرد، نه یک فکر بعدی. رونویسی بی‌درنگ که می‌تواند بلندگوهای همپوشانی را مدیریت کند، تغییر زبان در میانه مکالمه، و دیکته در سراسر سیستم، قابلیت‌هایی هستند که صدا را از یک ویژگی جدید به یک رابط کاربری روزانه تبدیل می‌کنند. For more context on this story, see our ongoing breaking AI news.

یک مدل، صداهای زیاد، زبان های بسیار

همانطور که Engadget گزارش کرده است، قابلیت عنوان، توانایی این مدل برای تمایز بین چندین سخنران و چندین زبان در زمان واقعی است. این ترکیب به دو مشکل دشوار در رونویسی عملی به طور همزمان پاسخ می‌دهد: دیاریزاسیون گوینده - فهمیدن اینکه چه کسی چه گفته است - و تشخیص چند زبانه، که در آن مکالمه بدون مکث بین زبان‌ها حرکت می‌کند.

اکثر خطوط لوله رونویسی موجود این مراحل را به عنوان مراحل جداگانه در نظر می گیرند: ابتدا یک مدل دیاریزاسیون بلندگوها را تقسیم می کند، سپس یک مدل شناسایی هر بخش را رونویسی می کند. ادغام آنها در یک مدل بی‌درنگ تنها چیزی است که این فناوری را برای موارد استفاده زنده - جلسات، مصاحبه‌ها، تماس‌های مشتری، همپوشانی‌های ترجمه زنده - که انتظار برای پردازش پس از آن هدف را شکست می‌دهد، قابل اجرا می‌کند.

Muse Voice Transcript دیکته را به هر برنامه مک می‌آورد

در کنار این مدل، متا Muse Voice Transcript را برای macOS راه‌اندازی کرد. همانطور که 9to5Mac گزارش کرده است، این ابزار دیکته صوتی بی‌درنگ را ارائه می‌کند که در برنامه‌های مک کار می‌کند - به طور موثر یک لایه دیکته در سراسر سیستم به جای یک برنامه مستقل. پوشش گجت ریویو آن را به عنوان ارائه دیکته در زمان واقعی به هر برنامه مک توصیف کرد.

این طراحی برای پذیرش اهمیت دارد. ابزارهای دیکته در اصطکاک زنده می شوند یا می میرند: اگر کاربران مجبور باشند متن را از یک پنجره جداگانه کپی کنند، استفاده از آن را متوقف می کنند. کار در سطح سیستم به این معنی است که ورودی صوتی در هر جایی که مکان نما چشمک می زند در دسترس می شود - ایمیل، ویرایشگرهای کد، برنامه های پیام رسانی، اسناد - که دقیقاً چگونه موفق ترین ابزار دیکته مخاطبان خود را به دست آورده اند.

نسخه مک همچنین قلمرو قابل توجهی را برای متا مشخص می کند. تلاش‌های هوش مصنوعی این شرکت بر برنامه‌های تلفن همراه، دستیار هوش مصنوعی متا و مدل‌های خانواده لاما و خانواده موز متمرکز شده است. ارسال یک ابزار بهره‌وری دسک‌تاپ صیقلی برای پلتفرم اپل، متا را در تماس مستقیم با پایگاه کاربر حرفه‌ای قرار می‌دهد که در طول تاریخ برای رسیدن به آن تلاش کرده است – و آن را در رقابت با ابزارهای دیکته و رونویسی موجود در پلتفرم قرار می‌دهد.

یک میدان شلوغ که سریعتر می شود

متا در حال ورود به بازاری است که طی دو سال گذشته مجدداً قیمت گذاری و مهندسی شده است. مدل‌های منبع باز Whisper OpenAI، پایه‌ای را برای رونویسی چندزبانه در دسترس قرار می‌دهند، و API GPT Transcribe پولی این شرکت از نظر قیمت، بخش زیادی از بازار تجاری را کاهش داد. در همین حال، گوگل به شدت در همین راستا تلاش کرده است: مدل‌های رونویسی مبتنی بر Gemini که ده‌ها زبان را در زمان واقعی پوشش می‌دهند، برای توسعه‌دهندگان عرضه شده‌اند، همانطور که وقتی گوگل مدل‌های رونویسی گفتار 85 زبانی خود را ارسال کرد، پوشش دادیم.

در مقابل این پس‌زمینه، تمایز از دقت خام - جایی که رهبران در معیارهای استاندارد در نویز یکدیگر قرار می‌گیرند - به جزئیات عملی تغییر کرده است: تأخیر، مدیریت بلندگو، تغییر کد بین زبان‌ها، قیمت‌گذاری، و مکان اجرای مدل. تاکید متا بر تشخیص همزمان چند سخنران و چند زبانه در زمان واقعی دقیقاً همان جزئیات عملی را هدف قرار می دهد.

چرا صدا ناگهان استراتژیک است

زمان بندی تصادفی نیست. Voice در حال تبدیل شدن به رابط پیش‌فرض برای عوامل هوش مصنوعی است و شرکت‌هایی که دارای لایه صوتی هستند - ضبط، رونویسی، درک، پاسخ - طبیعی‌ترین نقطه ورود به تجربیات دستیار را کنترل می‌کنند. متا در مورد جاه‌طلبی‌های خود برای عینک‌های هوش مصنوعی و دستگاه‌های پوشیدنی، که صدا اساساً تنها ورودی عملی است، به طور عمومی اعلام کرده است. یک مدل صوتی سریع، دقیق و در حال حرکت، زیرساخت این نقشه راه است.

زاویه سازمانی نیز وجود دارد. جلسات، تماس‌های پشتیبانی و کار میدانی حجم عظیمی از صدای چند بلندگو تولید می‌کنند که سازمان‌ها می‌خواهند قابل جستجو و عمل باشند. مدلی که در حین انجام مکالمه به طور قابل اعتماد رونویسی می کند - با برچسب بلندگوها و استفاده از زبان ها بدون پیکربندی دستی - تفاوت بین نسخه نمایشی و محصول است.

رونویسی بلادرنگ مزایایی فراتر از راحتی نیز دارد. زیرنویس‌های زنده، جلسات، کلاس‌های درس و برنامه‌ها را برای کاربران ناشنوا و کم شنوا قابل دسترس می‌کنند و زیرنویس‌های چندزبانه فوری موانع زبانی را برای تیم‌های بین‌المللی کاهش می‌دهند. وقتی رونویسی به اندازه کافی سریع باشد تا با گفتار طبیعی همگام شود و به اندازه کافی برای ردیابی چند سخنران به طور همزمان قوی باشد، این ویژگی‌های دسترسی دیگر امکانات ویژه نیستند و به پیش‌فرض‌هایی تبدیل می‌شوند که در ابزارهای روزمره تعبیه شده‌اند.

متا قیمت یا جزئیات کامل در دسترس بودن را در پوشش اولیه اعلام نکرده است. اما جهت آن غیرقابل انکار است: لایه صوتی پشته هوش مصنوعی، که مدت‌ها به عنوان یک کالا در نظر گرفته می‌شد، اکنون به جبهه‌ای در جنگ پلتفرم تبدیل شده است - و متا تصمیم گرفته است که روی آن بجنگد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →