Fish Audio, стартап из Пало-Альто, создающий выразительные голосовые модели с использованием искусственного интеллекта, привлек 50 миллионов долларов в рамках начального раунда для расширения своей платформы как для творческих, так и для корпоративных вариантов использования. Согласно отчету TechCrunch, раунд финансирования возглавили Coreline Ventures и Capital Today при участии 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.

Этот раунд является одним из крупнейших начальных инвестиций в области генерации голоса с помощью искусственного интеллекта, что отражает доверие инвесторов к компании, которая уже добилась значительных успехов. В настоящее время Fish Audio насчитывает более 8 миллионов человек, использующих версии своих моделей с открытым исходным кодом или размещенные на хостинге, и приносит 21 миллион долларов ежегодного регулярного дохода. Быстрый рост стартапа является частью более широкой волны расширения индустрии искусственного интеллекта, которая продолжает привлекать значительный венчурный капитал.

От проекта с одним графическим процессором до 8 миллионов пользователей

Fish Audio начинался как небольшой побочный проект Шицзя Ляо, бывшего исследователя Nvidia, который был разочарован плоскими, невыразительными синтетическими голосами, доступными тогда на рынке. Ляо обучил модель генерации голоса на одном графическом процессоре и открыл ее исходный код. Этот ранний проект, известный как Fish Speech, с тех пор превратился в репозиторий с более чем 31 000 звездами на GitHub, которым пользуются независимые разработчики, дизайнеры видеоигр и создатели контента.

В прошлом году компания выпустила пять моделей: четыре модели генерации речи и одну модель преобразования речи в текст. Компания выложила в открытый доступ три модели генерации речи, а ее последняя версия, S2.1 Pro, доступна только через платный API. Эта гибридная стратегия открытого ядра позволила Fish Audio создать большое сообщество разработчиков, одновременно монетизируя свои самые передовые возможности.

Модель голоса для любого случая использования

По мнению компании, что отличает Fish Audio от других, так это широта предлагаемых ею элементов управления. Платформа включает в себя библиотеку из более чем 15 000 элементов управления на естественном языке, которые позволяют пользователям точно настраивать звучание сгенерированных голосов — регулируя тон, эмоции, темп и стиль.

Генеральный директор и соучредитель Рисса Цао рассказала TechCrunch, что корпоративные клиенты компании удовлетворяют очень разные потребности. Такие компании, как HeyGen, которая использует голоса Fish Audio для создания ИИ-аватаров, отдают приоритет реализму. Игровые студии хотят, чтобы их персонажи имели выразительные голоса. Компаниям, занимающимся голосовыми агентами, таким как LiveKit, нужны естественно звучащие голоса с малой задержкой, которые остаются достаточно выразительными для телефонных звонков в режиме реального времени.

«Каждое предприятие имеет разные варианты использования и разные предпочтения», — сказал Цао. Среди других клиентов — Sanas, компания, специализирующаяся на переводе акцентов, и Plaud, производящая записывающие устройства на базе искусственного интеллекта. Fish Audio предлагает платные ежемесячные планы для создателей и команд, которые разблокируют определенное количество минут генерации и функции клонирования голоса, а также корпоративную версию своих API.

Создание голосовой библиотеки с помощью вкладов пользователей

Один из способов, с помощью которого Fish Audio расширила свою библиотеку голосов, — это предложить пользователям отправлять свои собственные голосовые записи для обучения моделей, выплачивая им компенсацию за использование их голосов. Этот краудсорсинговый подход помог компании создать разнообразный каталог, но также создал проблемы.

Несколько месяцев назад некоторые авторы заявили, что их голоса были загружены на платформу Fish Audio без их согласия. У стартапа был процесс удаления контента DMCA, но этот процесс был медленным. Цао рассказал TechCrunch, что с тех пор компания автоматизировала процесс удаления, чтобы быстрее решать подобные проблемы.

Этот спор подчеркивает растущую напряженность в голосовой индустрии искусственного интеллекта. По мере совершенствования технологии синтетического голоса становится все труднее контролировать грань между разрешенным и несанкционированным использованием. Клонирование голоса, в частности, вызвало обеспокоенность по поводу выдачи себя за другое лицо и мошенничества, а регулирующие органы в нескольких странах начинают изучать правовые рамки, регулирующие звук, генерируемый ИИ.

Конкурентный и переполненный рынок

Fish Audio далеко не единственная компания в сфере голосового ИИ. В число конкурентов входят ElevenLabs, которая собрала сотни миллионов долларов и широко считается лидером рынка, а также предложения крупных технологических компаний. Но упор Fish Audio на модели с открытым исходным кодом и большое сообщество разработчиков придают ей особую позицию.

Посевной раунд стоимостью 50 миллионов долларов дает компании возможность конкурировать за качество моделей, расширять свои усилия по корпоративным продажам и решать юридические и этические вопросы, связанные с технологией клонирования голоса. Имея годовой регулярный доход в 21 миллион долларов, Fish Audio уже приносит значительный доход для компании, находящейся на начальном этапе, что позволяет предположить, что спрос на выразительные, управляемые голоса AI выходит далеко за рамки новизны.

Сможет ли стартап сохранить динамику развития открытого исходного кода и одновременно построить прибыльный корпоративный бизнес, еще неизвестно. Но размер раунда и качество участвующих инвесторов сигнализируют о том, что рынок голоса, генерируемого ИИ, все еще находится на начальной стадии развития — и что инвесторы видят существенный потенциал роста в компании, которая обслуживает как независимых авторов, так и крупные предприятия.

Будьте впереди новостей стартапов в области искусственного интеллекта

Следите за последними разработками в области искусственного интеллекта по мере развития рынков генерации голоса и других генеративных рынков искусственного интеллекта.

Читать больше новостей об искусственном интеллекте →