Fish Audio, startup založený na Palo Alto, který buduje expresivní hlasové modely AI, získal 50 milionů dolarů v počátečním kole na rozšíření své platformy pro kreativní i podnikové případy použití. Kolo financování vedly Coreline Ventures a Capital Today s účastí 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners a HF0, podle zpráv TechCrunch.
Kolo je jedním z největších počátečních financování v oblasti generování hlasu AI, což odráží důvěru investorů ve společnost, která si již vybudovala významnou trakci. Fish Audio nyní čítá více než 8 milionů lidí, kteří používají buď open-source nebo hostované verze svých modelů, a generuje 21 milionů $ v ročních opakujících se příjmech. Rychlý růst startupu je součástí širší vlny expanze odvětví AI, která nadále přitahuje značný rizikový kapitál.
Od projektu s jedním GPU k 8 milionům uživatelů
Fish Audio začal jako malý vedlejší projekt Shijia Liao, bývalého výzkumníka Nvidie, který byl frustrovaný plochými, nevýraznými syntetickými hlasy, které byly tehdy dostupné na trhu. Liao trénoval model generování hlasu na jediném GPU a vytvořil jej jako open source. Tento raný projekt, známý jako Fish Speech, se od té doby rozrostl v úložiště s více než 31 000 hvězdami na GitHubu, které používají nezávislí vývojáři, návrháři videoher a tvůrci obsahu.
V minulém roce společnost uvedla na trh pět modelů: čtyři modely generace řeči a jeden model řeči na text. Má otevřené tři modely generování řeči, zatímco jeho nejnovější verze, S2.1 Pro, je k dispozici pouze prostřednictvím placeného rozhraní API. Tato hybridní strategie s otevřeným jádrem umožnila Fish Audio vybudovat velkou komunitu vývojářů a zároveň zpeněžit své nejpokročilejší schopnosti.
Hlasový model pro každý případ použití
Co odlišuje Fish Audio podle společnosti, je šíře ovládacích prvků, které nabízí. Platforma obsahuje knihovnu více než 15 000 ovládacích prvků přirozeného jazyka, které uživatelům umožňují doladit, jak znějí generované hlasy – nastavením tónu, emocí, tempa a stylu.
Generální ředitel a spoluzakladatel Rissa Cao řekl TechCrunch, že firemní zákazníci společnosti pokrývají velmi odlišné potřeby. Společnosti jako HeyGen, která používá hlasy Fish Audio k napájení avatarů AI, upřednostňují realismus. Herní studia chtějí pro své postavy výrazné hlasy. Společnosti hlasových agentů, jako je LiveKit, potřebují přirozeně znějící hlasy s nízkou latencí, které zůstávají dostatečně výrazné pro živé telefonní hovory.
"Každý podnik má jiné případy použití a různé preference," řekl Cao. Mezi další zákazníky patří Sanas, společnost zaměřená na překládání akcentů, a Plaud, která vyrábí nahrávací zařízení s umělou inteligencí. Fish Audio nabízí placené měsíční plány pro tvůrce a týmy, které odemykají stanovený počet minut generování plus funkce klonování hlasu, stejně jako podnikovou verzi svých API.
Vytváření hlasové knihovny prostřednictvím příspěvků uživatelů
Jedním ze způsobů, jak Fish Audio rozšířila svou knihovnu hlasů, je vyzvat uživatele, aby předložili své vlastní hlasové nahrávky pro tréninkové modely, a kompenzovat je, když jsou jejich hlasy použity. Tento crowdsourcingový přístup pomohl společnosti vybudovat rozmanitý katalog, ale také vytvořil výzvy.
Před několika měsíci někteří tvůrci tvrdili, že jejich hlasy byly nahrány na platformu Fish Audio bez jejich souhlasu. Startup měl proces zastavování obsahu podle zákona DMCA, ale tento proces byl pomalý. Cao řekl TechCrunch, že společnost od té doby zautomatizovala proces zastavení šíření, aby tyto obavy řešila rychleji.
Kontroverze zdůrazňuje rostoucí napětí v hlasovém průmyslu AI. Jak se technologie syntetického hlasu zdokonaluje, hranice mezi autorizovaným a neoprávněným používáním je stále obtížnější kontrolovat. Zejména klonování hlasu vyvolalo obavy z předstírání identity a podvodu a regulační orgány v několika zemích začínají zkoumat právní rámce upravující zvuk generovaný umělou inteligencí.
Konkurenční a přeplněný trh
Fish Audio není v hlasovém prostoru AI zdaleka sám. Mezi konkurenty patří ElevenLabs, která získala stovky milionů dolarů a je všeobecně považována za lídra na trhu, stejně jako nabídky od velkých technologických společností. Důraz Fish Audio na modely s otevřeným zdrojovým kódem a velká komunita vývojářů mu však dávají výrazné postavení.
Startovní kolo ve výši 50 milionů dolarů dává společnosti příležitost soutěžit v kvalitě modelu, rozšířit své podnikové prodejní úsilí a orientovat se v právních a etických otázkách, které přináší technologie klonování hlasu. S ročními opakujícími se příjmy ve výši 21 milionů dolarů již Fish Audio generuje významné příjmy pro společnost v počáteční fázi, což naznačuje, že poptávka po výrazných, ovladatelných hlasech umělé inteligence přesahuje rámec novinek.
Zda si startup dokáže udržet dynamiku open source a zároveň vybudovat ziskový podnik, se teprve uvidí. Ale velikost kola a kvalita zúčastněných investorů signalizují, že trh s hlasem generovaným umělou inteligencí je stále ve svých raných směnách – a že investoři vidí podstatný přínos ve společnosti, která vychází vstříc nezávislým tvůrcům i velkým podnikům.
Udržujte si náskok před novinkami o spouštění AI
Sledujte nejnovější vývoj AI s tím, jak se vyvíjejí generování hlasu a další generativní trhy AI.
Přečtěte si další zprávy o AI →