Fish Audio, startup z siedzibą w Palo Alto tworzący ekspresyjne modele głosowe AI, zebrał 50 milionów dolarów w rundzie zalążkowej, aby rozszerzyć swoją platformę zarówno do zastosowań kreatywnych, jak i korporacyjnych. Według raportów TechCrunch rundę finansowania poprowadziły Coreline Ventures i Capital Today, przy udziale 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners i HF0.

Ta runda jest jednym z większych finansowania zalążkowego w obszarze generowania głosu AI i odzwierciedla zaufanie inwestorów do firmy, która już wypracowała sobie znaczną przyczepność. Fish Audio liczy obecnie ponad 8 milionów osób korzystających z wersji open source lub hostowanych wersji swoich modeli i generuje 21 milionów dolarów stałych rocznych przychodów. Szybki rozwój startupu jest częścią szerszej fali ekspansji branży sztucznej inteligencji, która w dalszym ciągu przyciąga znaczny kapitał wysokiego ryzyka.

Od projektu z pojedynczą kartą graficzną do 8 milionów użytkowników

Firma Fish Audio rozpoczęła działalność jako mały projekt poboczny Shijii Liao, byłego badacza firmy Nvidia, którego sfrustrowały płaskie, pozbawione ekspresji syntetyczne głosy dostępne wówczas na rynku. Liao wytrenował model generowania głosu na pojedynczym procesorze graficznym i udostępnił go na zasadach open source. Ten wczesny projekt, znany jako Fish Speech, rozrósł się od tego czasu do repozytorium zawierającego ponad 31 000 gwiazdek w serwisie GitHub, z którego korzystają niezależni programiści, projektanci gier wideo i twórcy treści.

W ubiegłym roku firma wprowadziła na rynek pięć modeli: cztery modele generowania mowy i jeden model zamiany mowy na tekst. Posiada trzy modele generowania mowy na zasadach open source, a jego najnowsza wersja, S2.1 Pro, jest dostępna wyłącznie za pośrednictwem płatnego interfejsu API. Ta hybrydowa strategia otwartego rdzenia pozwoliła firmie Fish Audio zbudować dużą społeczność programistów, jednocześnie zarabiając na swoich najbardziej zaawansowanych możliwościach.

Model głosu do każdego zastosowania

Według firmy tym, co wyróżnia Fish Audio, jest szeroki zakres oferowanych przez nią elementów sterujących. Platforma zawiera bibliotekę ponad 15 000 elementów sterujących językiem naturalnym, które pozwalają użytkownikom dostosować sposób brzmienia generowanego głosu — dostosowując ton, emocje, tempo i styl.

Dyrektor generalna i współzałożycielka, Rissa Cao, powiedziała TechCrunch, że klienci korporacyjni firmy mają bardzo różne potrzeby. Firmy takie jak HeyGen, która wykorzystuje głosy Fish Audio do zasilania awatarów AI, priorytetowo traktują realizm. Studia gier chcą wyrazistych głosów dla swoich postaci. Firmy zajmujące się agendą głosową, takie jak LiveKit, potrzebują naturalnie brzmiących głosów o niskim opóźnieniu, które pozostają wystarczająco wyraziste, aby można było prowadzić rozmowy telefoniczne na żywo.

„Każde przedsiębiorstwo ma inne przypadki użycia i różne preferencje” – powiedział Cao. Inni klienci to Sanas, firma specjalizująca się w tłumaczeniach akcentowanych, oraz Plaud, producent urządzeń nagrywających wykorzystujących sztuczną inteligencję. Fish Audio oferuje płatne miesięczne plany dla twórców i zespołów, które odblokowują określoną liczbę minut generacji oraz funkcje klonowania głosu, a także wersję API dla przedsiębiorstw.

Tworzenie biblioteki głosowej dzięki wkładowi użytkowników

Jednym ze sposobów, w jaki Fish Audio rozszerzyło swoją bibliotekę głosów, jest zapraszanie użytkowników do przesyłania własnych nagrań głosu do modeli szkoleniowych, kompensując je w przypadku użycia ich głosu. To podejście oparte na crowdsourcingu pomogło firmie zbudować zróżnicowany katalog, ale stworzyło też wyzwania.

Kilka miesięcy temu niektórzy twórcy zarzucali, że ich głosy zostały przesłane na platformę Fish Audio bez ich zgody. Startup miał wdrożony proces usuwania treści na podstawie ustawy DMCA, ale proces ten był powolny. Cao powiedział TechCrunch, że od tego czasu firma zautomatyzowała proces usuwania, aby szybciej reagować na takie wątpliwości.

Kontrowersje uwydatniają rosnące napięcie w branży głosowej AI. W miarę ulepszania technologii syntetycznego głosu granica między autoryzowanym a nieautoryzowanym użyciem staje się coraz trudniejsza do kontrolowania. W szczególności klonowanie głosu wzbudziło obawy dotyczące podszywania się pod inne osoby i oszustw, a organy regulacyjne w kilku krajach zaczynają badać ramy prawne regulujące dźwięk generowany przez sztuczną inteligencję.

Konkurencyjny i zatłoczony rynek

Fish Audio nie jest osamotniony w przestrzeni głosowej AI. Do konkurentów należy ElevenLabs, które zebrało setki milionów dolarów i jest powszechnie postrzegane jako lider rynku, a także oferty największych firm technologicznych. Jednak nacisk firmy Fish Audio na modele open source i duża społeczność programistów zapewniają jej wyróżniającą się pozycję.

Runda zalążkowa o wartości 50 milionów dolarów umożliwi firmie konkurowanie pod względem jakości modeli, zwiększenie wysiłków w zakresie sprzedaży dla przedsiębiorstw oraz radzenie sobie z kwestiami prawnymi i etycznymi związanymi z technologią klonowania głosu. Mając już 21 milionów dolarów stałych przychodów w wysokości 21 milionów dolarów, Fish Audio generuje znaczące przychody dla firmy w fazie zalążkowej, co sugeruje, że popyt na wyraziste, kontrolowane głosy AI wykracza daleko poza nowość.

Czas pokaże, czy startup będzie w stanie utrzymać dynamikę open source, budując dochodowe przedsiębiorstwo. Jednak wielkość rundy i jakość uczestniczących inwestorów sygnalizują, że rynek głosu generowanego przez sztuczną inteligencję jest wciąż w początkowej fazie rozwoju i że inwestorzy dostrzegają znaczną przewagę w firmie, która obsługuje zarówno niezależnych twórców, jak i duże przedsiębiorstwa.

Bądź na bieżąco z wiadomościami o startach AI

Śledź najnowsze rozwój sztucznej inteligencji w miarę ewolucji rynków generowania głosu i innych generatywnych rynków sztucznej inteligencji.

Przeczytaj więcej aktualności o sztucznej inteligencji →