Fish Audio, en Palo Alto-baserad startup som bygger uttrycksfulla AI-röstmodeller, har samlat in 50 miljoner dollar i en såddrunda för att utöka sin plattform för både kreativa och företagsanvändningsfall. Finansieringsrundan leddes av Coreline Ventures och Capital Today, med deltagande från 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners och HF0, enligt rapportering från TechCrunch.

Omgången är en av de större såddfinansieringarna inom AI-röstgenereringsutrymmet, vilket återspeglar investerarnas förtroende för ett företag som redan har byggt upp betydande dragkraft. Fish Audio har nu mer än 8 miljoner människor som använder antingen öppen källkod eller värdversioner av sina modeller och genererar 21 miljoner USD i årliga återkommande intäkter. Startupens snabba tillväxt är en del av en bredare våg av AI-industri expansion som fortsätter att locka till sig betydande riskkapital.

Från en-GPU-projekt till 8 miljoner användare

Fish Audio började som ett litet sidoprojekt av Shijia Liao, en före detta Nvidia-forskare som var frustrerad över de platta, icke-expressiva syntetiska rösterna som då fanns på marknaden. Liao tränade en röstgenereringsmodell på en enda GPU och öppnade den. Det tidiga projektet, känt som Fish Speech, har sedan dess vuxit till ett arkiv med mer än 31 000 stjärnor på GitHub, som används av oberoende utvecklare, videospelsdesigners och innehållsskapare.

Under det senaste året har företaget lanserat fem modeller: fyra talgenereringsmodeller och en tal-till-text-modell. Den har öppnat tre av sina talgenereringsmodeller, medan dess senaste utgåva, S2.1 Pro, endast är tillgänglig via ett betald API. Denna hybridstrategi med öppen kärna har gjort det möjligt för Fish Audio att bygga en stor gemenskap av utvecklare samtidigt som den tjänar pengar på dess mest avancerade funktioner.

En röstmodell för varje användningsfall

Det som skiljer Fish Audio enligt företaget är bredden av kontroller som det erbjuder. Plattformen innehåller ett bibliotek med mer än 15 000 naturliga språkkontroller som låter användare finjustera hur genererade röster låter – justera ton, känslor, pacing och stil.

VD och medgrundare Rissa Cao sa till TechCrunch att företagets företagskunder spänner över väldigt olika behov. Företag som HeyGen, som använder Fish Audio-röster för att driva AI-avatarer, prioriterar realism. Spelstudior vill ha uttrycksfulla röster för sina karaktärer. Röstagentföretag som LiveKit behöver naturligt klingande röster med låg latens som förblir tillräckligt uttrycksfulla för direktsända telefonsamtal.

"Varje företag har olika användningsfall och olika preferenser," sa Cao. Andra kunder inkluderar Sanas, ett företag fokuserat på accentöversättning, och Plaud, som tillverkar AI-drivna inspelningsenheter. Fish Audio erbjuder betalda månatliga planer för kreatörer och team som låser upp ett visst antal minuter av generation plus röstkloningsfunktioner, såväl som en företagsversion av dess API:er.

Bygga ett röstbibliotek genom användarbidrag

Ett av sätten som Fish Audio har utökat sitt röstbibliotek är genom att bjuda in användare att skicka in sina egna röstinspelningar för träningsmodeller och kompensera dem när deras röster används. Detta tillvägagångssätt med crowdsourcing har hjälpt företaget att bygga en mångsidig katalog, men det skapade också utmaningar.

För några månader sedan påstod några kreatörer att deras röster hade laddats upp till Fish Audios plattform utan deras medgivande. Uppstarten hade en process för borttagning av DMCA-innehåll på plats, men processen var långsam. Cao berättade för TechCrunch att företaget sedan dess har automatiserat borttagningsprocessen för att lösa sådana problem snabbare.

Kontroversen belyser en växande spänning inom AI-röstbranschen. När syntetisk röstteknik förbättras blir gränsen mellan auktoriserad och obehörig användning svårare för polisen. Röstkloning, i synnerhet, har väckt oro för identitetsstöld och bedrägeri, och tillsynsmyndigheter i flera länder börjar undersöka de rättsliga ramarna för AI-genererat ljud.

En konkurrenskraftig och trång marknad

Fish Audio är långt ifrån ensam i AI-röstutrymmet. Konkurrenter inkluderar ElevenLabs, som har samlat in hundratals miljoner dollar och ses allmänt som marknadsledare, samt erbjudanden från stora teknikföretag. Men Fish Audios betoning på modeller med öppen källkod och dess stora gemenskap av utvecklare ger den en distinkt position.

Seed-rundan på 50 miljoner dollar ger företaget en startbana för att konkurrera om modellkvalitet, utöka sina försäljningsinsatser för företag och navigera i de juridiska och etiska frågorna som kommer med teknik för röstkloning. Med 21 miljoner dollar i årliga återkommande intäkter redan, genererar Fish Audio meningsfulla intäkter för ett företag på startstadiet, vilket tyder på att efterfrågan på uttrycksfulla, kontrollerbara AI-röster sträcker sig långt bortom nyhet.

Huruvida startupen kan behålla sin öppen källkod samtidigt som den bygger en lönsam företagsverksamhet återstår att se. Men omgångens storlek, och kvaliteten på investerarna som deltar, signalerar att marknaden för AI-genererad röst fortfarande är i början – och att investerare ser en betydande uppsida i ett företag som vänder sig till både indieskapare och stora företag.

Ligg före AI Startup News

Följ den senaste AI-utvecklingen när röstgenerering och andra generativa AI-marknader utvecklas.

Läs mer AI-nyheter →