Fish Audio, стартап із Пало-Альто, що створює виразні голосові моделі штучного інтелекту, зібрав 50 мільйонів доларів у початковому раунді, щоб розширити свою платформу як для творчого, так і для корпоративного використання. Відповідно до звіту TechCrunch, раунд фінансування очолили Coreline Ventures і Capital Today за участю 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners і HF0.

Цей раунд є одним із найбільших початкових фінансувань у сфері генерації голосу ШІ, що відображає довіру інвесторів до компанії, яка вже досягла значного успіху. Fish Audio зараз нараховує понад 8 мільйонів людей, які використовують версії моделей із відкритим вихідним кодом або розміщені на хості, і генерує 21 мільйон доларів щорічного постійного доходу. Швидке зростання стартапу є частиною ширшої хвилі розширення індустрії ШІ, яка продовжує залучати значний венчурний капітал.

Від проекту з одним GPU до 8 мільйонів користувачів

Fish Audio розпочався як невеликий побічний проект Шицзя Ляо, колишнього дослідника Nvidia, який був розчарований рівними, невиразними синтетичними голосами, доступними тоді на ринку. Ляо навчив модель генерації голосу на одному графічному процесорі та відкрив її. Цей ранній проект, відомий як Fish Speech, згодом перетворився на сховище з понад 31 000 зірочок на GitHub, яке використовують незалежні розробники, дизайнери відеоігор і творці контенту.

Минулого року компанія випустила п’ять моделей: чотири моделі генерації мови та одну модель синтезу мови в текст. Він має відкриті вихідні коди для трьох своїх моделей генерації мовлення, тоді як його останній випуск, S2.1 Pro, доступний лише через платний API. Ця гібридна стратегія з відкритим ядром дозволила Fish Audio створити велике співтовариство розробників, одночасно монетизуючи свої передові можливості.

Модель голосу для будь-якого випадку використання

За словами компанії, Fish Audio відрізняє широкі можливості керування, які вона пропонує. Платформа включає в себе бібліотеку з понад 15 000 елементів керування природною мовою, які дозволяють користувачам точно налаштовувати звучання згенерованих голосів — регулюючи тон, емоції, темп і стиль.

Генеральний директор і співзасновник Рісса Као розповіла TechCrunch, що корпоративні клієнти компанії мають дуже різні потреби. Такі компанії, як HeyGen, яка використовує голоси Fish Audio для створення аватарів штучного інтелекту, віддають перевагу реалістичності. Ігрові студії хочуть виразних голосів для своїх персонажів. Компанії голосових агентів, такі як LiveKit, потребують голосів із природним звучанням і малою затримкою, які залишаються достатньо виразними для живих телефонних дзвінків.

«Кожне підприємство має різні випадки використання та різні переваги», — сказав Цао. Серед інших клієнтів – Sanas, компанія, що спеціалізується на перекладі акцентів, і Plaud, яка виробляє пристрої для запису на основі штучного інтелекту. Fish Audio пропонує платні щомісячні плани для творців і команд, які розблоковують певну кількість хвилин генерації та функції клонування голосу, а також корпоративну версію своїх API.

Створення голосової бібліотеки за допомогою внесків користувачів

Один із способів, якими Fish Audio розширила свою бібліотеку голосів, — запросити користувачів надіслати власні записи голосу для тренувальних моделей, компенсуючи їх за використання їхніх голосів. Цей краудсорсинговий підхід допоміг компанії створити різноманітний каталог, але він також створив проблеми.

Кілька місяців тому деякі автори стверджували, що їхні голоси були завантажені на платформу Fish Audio без їхньої згоди. Стартап мав процес видалення вмісту DMCA, але процес був повільним. Цао сказав TechCrunch, що з тих пір компанія автоматизувала процес видалення, щоб швидше вирішувати такі проблеми.

Ця суперечка свідчить про зростаючу напругу в голосовій індустрії ШІ. Оскільки технологія синтетичного голосу вдосконалюється, межу між авторизованим і несанкціонованим використанням стає важче контролювати. Клонування голосу, зокрема, викликало занепокоєння щодо видавання себе за іншу особу та шахрайства, і регулятори в кількох країнах починають вивчати правові рамки, що регулюють аудіо, створене штучним інтелектом.

Конкурентний і багатолюдний ринок

Fish Audio далеко не єдиний у голосовому просторі ШІ. Конкуренти включають ElevenLabs, яка залучила сотні мільйонів доларів і багато хто вважається лідером ринку, а також пропозиції від великих технологічних компаній. Але наголос Fish Audio на моделях з відкритим вихідним кодом і велика спільнота розробників надають їй відмінну позицію.

Початковий раунд у розмірі 50 мільйонів доларів дає компанії можливість конкурувати за якість моделей, розширювати продажі для підприємств і вирішувати юридичні та етичні питання, пов’язані з технологією клонування голосу. Маючи вже 21 мільйон доларів щорічного постійного доходу, Fish Audio генерує значні доходи для початкової компанії, що свідчить про те, що попит на виразні, керовані голоси ШІ виходить далеко за рамки новизни.

Чи зможе стартап зберегти свою динаміку відкритого коду, створюючи прибутковий корпоративний бізнес, ще невідомо. Але розмір раунду та якість інвесторів, які беруть участь, свідчать про те, що ринок голосу, створеного за допомогою штучного інтелекту, все ще тільки розвивається — і що інвестори бачать суттєві переваги в компанії, яка обслуговує як незалежних творців, так і великі підприємства.

Будьте попереду новин AI Startup

Слідкуйте за останніми [розробками штучного інтелекту] (https://aibuzzwire.news) у міру розвитку генерації голосу та інших генеративних ринків штучного інтелекту.

Читати більше новин AI →