Fish Audio, een in Palo Alto gevestigde startup die expressieve AI-stemmodellen bouwt, heeft in een startronde $50 miljoen opgehaald om zijn platform uit te breiden voor zowel creatieve als zakelijke toepassingen. De financieringsronde werd geleid door Coreline Ventures en Capital Today, met deelname van 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners en HF0, volgens rapportage door TechCrunch.

De ronde is een van de grotere startfinancieringen op het gebied van AI-spraakgeneratie en weerspiegelt het vertrouwen van investeerders in een bedrijf dat al aanzienlijke tractie heeft opgebouwd. Fish Audio telt nu meer dan 8 miljoen mensen die de open-source of gehoste versies van zijn modellen gebruiken, en genereert jaarlijks $21 miljoen aan terugkerende inkomsten. De snelle groei van de startup maakt deel uit van een bredere golf van uitbreiding van de AI-industrie (https://aibuzzwire.new) die aanzienlijk durfkapitaal blijft aantrekken.

Van één GPU-project naar 8 miljoen gebruikers

Fish Audio begon als een klein zijproject van Shijia Liao, een voormalige Nvidia-onderzoeker die gefrustreerd was door de platte, niet-expressieve synthetische stemmen die toen op de markt verkrijgbaar waren. Liao trainde een spraakgeneratiemodel op een enkele GPU en open source. Dat vroege project, bekend als Fish Speech, is sindsdien uitgegroeid tot een repository met meer dan 31.000 sterren op GitHub, gebruikt door onafhankelijke ontwikkelaars, ontwerpers van videogames en makers van inhoud.

Het afgelopen jaar heeft het bedrijf vijf modellen gelanceerd: vier spraakgeneratiemodellen en één spraak-naar-tekst-model. Het heeft drie van zijn spraakgeneratiemodellen open source, terwijl de nieuwste release, S2.1 Pro, alleen beschikbaar is via een betaalde API. Deze hybride open-core strategie heeft Fish Audio in staat gesteld een grote gemeenschap van ontwikkelaars op te bouwen en tegelijkertijd inkomsten te genereren met de meest geavanceerde mogelijkheden.

Een stemmodel voor elke gebruikssituatie

Wat Fish Audio volgens het bedrijf onderscheidt, is de breedte van de bedieningselementen die het biedt. Het platform bevat een bibliotheek met meer dan 15.000 natuurlijke taalbedieningen waarmee gebruikers kunnen afstemmen hoe gegenereerde stemmen klinken, waarbij de toon, emotie, tempo en stijl worden aangepast.

CEO en mede-oprichter Rissa Cao vertelde TechCrunch dat de zakelijke klanten van het bedrijf zeer verschillende behoeften hebben. Bedrijven als HeyGen, dat Fish Audio-stemmen gebruikt om AI-avatars aan te sturen, geven prioriteit aan realisme. Gamingstudio's willen expressieve stemmen voor hun personages. Spraakagentbedrijven zoals LiveKit hebben natuurlijk klinkende stemmen met lage latentie nodig die expressief genoeg blijven voor live telefoongesprekken.

"Elke onderneming heeft verschillende gebruiksscenario's en verschillende voorkeuren", zegt Cao. Andere klanten zijn onder meer Sanas, een bedrijf dat zich richt op accentvertaling, en Plaud, dat door AI aangedreven opnameapparatuur maakt. Fish Audio biedt betaalde maandabonnementen voor makers en teams die een bepaald aantal minuten aan generatie plus functies voor spraakklonen ontgrendelen, evenals een zakelijke versie van de API's.

Een spraakbibliotheek opbouwen via gebruikersbijdragen

Een van de manieren waarop Fish Audio zijn stemmenbibliotheek heeft uitgebreid, is door gebruikers uit te nodigen hun eigen stemopnames in te dienen voor trainingsmodellen, en hen te compenseren wanneer hun stemmen worden gebruikt. Deze crowdsourced-aanpak heeft het bedrijf geholpen een gevarieerde catalogus op te bouwen, maar zorgde ook voor uitdagingen.

Een paar maanden geleden beweerden sommige makers dat hun stemmen zonder hun toestemming naar het Fish Audio-platform waren geüpload. De startup beschikte over een DMCA-verwijderingsproces voor inhoud, maar het proces verliep traag. Cao vertelde TechCrunch dat het bedrijf sindsdien het verwijderingsproces heeft geautomatiseerd om dergelijke problemen sneller aan te pakken.

De controverse benadrukt een groeiende spanning in de AI-stemindustrie. Naarmate de synthetische stemtechnologie verbetert, wordt de grens tussen geautoriseerd en ongeoorloofd gebruik moeilijker te controleren. Met name het klonen van stemmen heeft aanleiding gegeven tot bezorgdheid over nabootsing van identiteit en fraude, en toezichthouders in verschillende landen beginnen de wettelijke kaders voor door AI gegenereerde audio te onderzoeken.

Een concurrerende en drukke markt

Fish Audio is verre van de enige in de AI-stemruimte. Concurrenten zijn onder meer ElevenLabs, dat honderden miljoenen dollars heeft opgehaald en algemeen wordt gezien als marktleider, evenals aanbiedingen van grote technologiebedrijven. Maar Fish Audio's nadruk op open-sourcemodellen en de grote gemeenschap van ontwikkelaars geven het een onderscheidende positie.

De startronde van $50 miljoen geeft het bedrijf een start- en landingsbaan om te concurreren op modelkwaliteit, de commerciële verkoopinspanningen uit te breiden en de juridische en ethische vragen te beantwoorden die gepaard gaan met de technologie voor het klonen van stemmen. Met al 21 miljoen dollar aan jaarlijkse terugkerende inkomsten genereert Fish Audio betekenisvolle inkomsten voor een start-upbedrijf, wat erop wijst dat de vraag naar expressieve, controleerbare AI-stemmen veel verder reikt dan nieuwigheid.

Of de startup zijn open source-momentum kan behouden en tegelijkertijd een winstgevende onderneming kan opbouwen, valt nog te bezien. Maar de omvang van de ronde en de kwaliteit van de deelnemende investeerders geven aan dat de markt voor door AI gegenereerde stemmen nog in de kinderschoenen staat – en dat investeerders aanzienlijke voordelen zien in een bedrijf dat zich richt op zowel indiemakers als grote ondernemingen.

Blijf het AI-opstartnieuws voor

Volg de laatste AI-ontwikkelingen terwijl spraakgeneratie en andere generatieve AI-markten zich ontwikkelen.

Lees meer AI-nieuws →