По данным Engadget, в понедельник Meta представила новую модель аудиоИИ, которая может различать нескольких говорящих и расшифровывать несколько языков в режиме реального времени, что подталкивает компанию глубже на все более переполненный рынок речевого искусственного интеллекта. The Information впервые сообщил об анонсе аудиомодели, а 9to5Mac подробно рассказал о сопутствующем продукте — Muse Voice Transcribe, обеспечивающем голосовую диктовку в реальном времени на Mac.
Релиз-близнец сигнализирует о том, что Meta рассматривает голос как первоклассный вклад в свой стек искусственного интеллекта, а не второстепенную мысль. Транскрипция в реальном времени, позволяющая обрабатывать перекрытие говорящих, переключение языка в середине разговора и общесистемную диктовку — это возможности, которые превращают голос из новой функции в интерфейс для ежедневного использования. Подробнее об этой истории — в нашем больше статей об ИИ.
Одна модель, много голосов, много языков
Как сообщает Engadget, возможность заголовка — это способность модели различать нескольких говорящих на нескольких языках в режиме реального времени. Эта комбинация одновременно решает две самые сложные проблемы практической транскрипции: диаризацию говорящего — выяснение того, кто что сказал — и многоязычное распознавание, когда разговор без пауз переходит с одного языка на другой.
Большинство существующих конвейеров транскрипции рассматривают их как отдельные этапы: сначала модель диаризации разделяет говорящих, затем модель распознавания расшифровывает каждый сегмент. Объединение их в единую модель реального времени — вот что делает эту технологию жизнеспособной для живых случаев использования — встреч, интервью, звонков клиентам, наложений живого перевода — где ожидание постобработки бесполезно.
Muse Voice Transcribe добавляет диктовку в каждое приложение Mac
Параллельно с этой моделью Meta запустила Muse Voice Transcribe для macOS. Как сообщает 9to5Mac, этот инструмент обеспечивает голосовую диктовку в реальном времени, которая работает во всех приложениях Mac — фактически это общесистемный уровень диктовки, а не отдельное приложение. В репортаже Gadget Review описывается, что это обеспечивает диктовку в реальном времени для каждого приложения Mac.
Этот дизайн имеет значение для принятия. Инструменты диктовки живут или умирают из-за трения: если пользователям приходится копировать текст из отдельного окна, они перестают его использовать. Работа на системном уровне означает, что голосовой ввод становится доступным везде, где мигает курсор — электронная почта, редакторы кода, приложения для обмена сообщениями, документы — именно так самые успешные инструменты диктовки завоевали свою аудиторию.
Релиз Mac также знаменует собой значительный шаг вперед для Meta. Усилия компании в области искусственного интеллекта сосредоточены на мобильных приложениях, мета-помощнике AI, а также на моделях семейства Llama и семейства Muse. Поставка усовершенствованного инструмента повышения производительности настольных компьютеров для платформы Apple обеспечивает Meta прямой контакт с базой профессиональных пользователей, за которую она исторически боролась, и ставит ее в конкуренцию с признанными на платформе утилитами диктовки и транскрипции.
Многолюдное поле, которое становится все быстрее
Meta выходит на рынок, цены на который были пересмотрены и модернизированы за последние два года. Модели OpenAI Whisper с открытым исходным кодом задают основу для доступной многоязычной транскрипции, а платный API GPT Transcribe компании уступает по цене значительной части коммерческого рынка. Тем временем Google активно продвигается в том же направлении: модели транскрипции на базе Gemini, охватывающие десятки языков в реальном времени, были предоставлены разработчикам, как мы уже говорили, когда Google представил свои модели транскрипции речи в реальном времени для 85 языков.
На этом фоне дифференциация сместилась от простой точности (когда лидеры группируются в шуме друг от друга по стандартным тестам) к практическим деталям: задержке, работе с динамиками, переключению кода между языками, ценам и месту работы модели. Акцент Meta на одновременном распознавании нескольких говорящих и многоязычном языке в реальном времени нацелен именно на эти практические детали.
Почему голос вдруг стал стратегическим
Время выбрано не случайно. Голос становится интерфейсом по умолчанию для агентов ИИ, а компании, владеющие аудиоуровнем — захватом, транскрипцией, пониманием и ответом — контролируют наиболее естественную точку входа в работу помощника. Meta открыто заявляла о своих амбициях в отношении очков искусственного интеллекта и носимых устройств, где голос, по сути, является единственным практическим средством ввода. Быстрая, точная, портативная аудиомодель — это инфраструктура для этой дорожной карты.
Существует также корпоративный подход. Встречи, звонки в службу поддержки и работа на местах создают огромные объемы аудио с несколькими динамиками, которые организации хотят иметь возможность поиска и действия. Разница между демоверсией и продуктом заключается в модели, которая надежно расшифровывает ход разговора (с маркировкой говорящих и языковыми настройками без ручной настройки).
Транскрипция в реальном времени имеет и преимущества, помимо удобства. Живые субтитры делают собрания, классы и трансляции доступными для глухих и слабослышащих пользователей, а мгновенные многоязычные субтитры снижают языковой барьер для международных команд. Когда транскрипция становится достаточно быстрой, чтобы идти в ногу с естественной речью, и достаточно надежной, чтобы отслеживать несколько говорящих одновременно, эти специальные возможности перестают быть специальными приспособлениями и становятся стандартными, встроенными в повседневные инструменты.
Meta не объявила цены или полную информацию о доступности в первоначальном обзоре. Но направление безошибочно: аудиослой стека искусственного интеллекта, долгое время рассматривавшийся как товар, теперь является фронтом в войне платформ — и Meta решила сражаться на нем.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →
