Fish Audio, un startup cu sediul în Palo Alto care construiește modele expresive de voce AI, a strâns 50 de milioane de dolari într-o rundă de început pentru a-și extinde platforma atât pentru cazuri de utilizare creative, cât și pentru întreprinderi. Runda de finanțare a fost condusă de Coreline Ventures și Capital Today, cu participarea 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners și HF0, potrivit raportării TechCrunch.
Runda este una dintre cele mai mari finanțări de bază din spațiul de generare a vocii AI, reflectând încrederea investitorilor într-o companie care și-a dezvoltat deja o tracțiune semnificativă. Fish Audio numără acum peste 8 milioane de oameni care folosesc fie versiunile open-source, fie versiunile găzduite ale modelelor sale și generează 21 de milioane de dolari în venituri anuale recurente. Creșterea rapidă a startup-ului face parte dintr-un val mai larg de expansiune industrie AI care continuă să atragă capital de risc substanțial.
De la proiectul cu un singur GPU la 8 milioane de utilizatori
Fish Audio a început ca un mic proiect secundar al lui Shijia Liao, un fost cercetător Nvidia care a fost frustrat de vocile sintetice plate și neexpresive disponibile atunci pe piață. Liao a antrenat un model de generare a vocii pe un singur GPU și l-a creat în sursă deschisă. Acest proiect timpuriu, cunoscut sub numele de Fish Speech, a devenit de atunci un depozit cu peste 31.000 de stele pe GitHub, folosit de dezvoltatori independenți, designeri de jocuri video și creatori de conținut.
În ultimul an, compania a lansat cinci modele: patru modele de generare a vorbirii și un model de vorbire în text. Are trei dintre modelele sale de generare a vorbirii în sursă deschisă, în timp ce cea mai recentă versiune, S2.1 Pro, este disponibilă numai printr-un API plătit. Această strategie hibridă open-core a permis Fish Audio să construiască o comunitate mare de dezvoltatori, în timp ce monetizează cele mai avansate capabilități ale sale.
Un model de voce pentru fiecare caz de utilizare
Ceea ce diferențiază Fish Audio, conform companiei, este amploarea controalelor pe care le oferă. Platforma include o bibliotecă de peste 15.000 de comenzi în limbaj natural care le permit utilizatorilor să ajusteze modul în care sună vocile generate – ajustând tonul, emoția, ritmul și stilul.
CEO-ul și co-fondatorul Rissa Cao a declarat pentru TechCrunch că clienții întreprinderii ai companiei au nevoi foarte diferite. Companii precum HeyGen, care folosește voci Fish Audio pentru a alimenta avatarurile AI, acordă prioritate realismului. Studiourile de jocuri doresc voci expresive pentru personajele lor. Companiile de agenți vocali precum LiveKit au nevoie de voci cu sunet natural, cu latență scăzută, care să rămână suficient de expresive pentru apeluri telefonice live.
„Fiecare întreprindere are cazuri de utilizare diferite și preferințe diferite”, a spus Cao. Alți clienți includ Sanas, o companie axată pe traducerea accentului, și Plaud, care produce dispozitive de înregistrare bazate pe inteligență artificială. Fish Audio oferă planuri lunare plătite pentru creatori și echipe care deblochează un anumit număr de minute de generare plus funcții de clonare a vocii, precum și o versiune de întreprindere a API-urilor sale.
Construirea unei biblioteci de voce prin contribuțiile utilizatorilor
Una dintre modalitățile prin care Fish Audio și-a extins biblioteca de voci este prin a invita utilizatorii să-și trimită propriile înregistrări vocale pentru modelele de antrenament, compensându-le atunci când vocile lor sunt folosite. Această abordare crowdsource a ajutat compania să construiască un catalog divers, dar a creat și provocări.
În urmă cu câteva luni, unii creatori au susținut că vocile lor au fost încărcate pe platforma Fish Audio fără acordul lor. Startup-ul avea un proces de eliminare a conținutului DMCA, dar procesul a fost lent. Cao a declarat pentru TechCrunch că, de atunci, compania a automatizat procesul de eliminare pentru a rezolva mai rapid astfel de preocupări.
Controversa evidențiază o tensiune în creștere în industria vocii AI. Pe măsură ce tehnologia vocală sintetică se îmbunătățește, linia dintre utilizarea autorizată și cea neautorizată devine mai greu de controlat. Clonarea vocii, în special, a stârnit îngrijorări cu privire la uzurparea identității și frauda, iar autoritățile de reglementare din mai multe țări încep să examineze cadrele legale care guvernează sunetul generat de AI.
O piață competitivă și aglomerată
Fish Audio este departe de a fi singur în spațiul vocal AI. Printre concurenți se numără ElevenLabs, care a strâns sute de milioane de dolari și este văzută pe scară largă drept lider de piață, precum și oferte de la marile companii de tehnologie. Dar accentul pus de Fish Audio pe modelele open-source și comunitatea sa mare de dezvoltatori îi conferă o poziție distinctivă.
Runda de semințe de 50 de milioane de dolari îi oferă companiei să concureze în ceea ce privește calitatea modelului, să-și extindă eforturile de vânzări ale întreprinderii și să navigheze între întrebările legale și etice care vin cu tehnologia de clonare a vocii. Cu 21 de milioane de dolari în venituri anuale recurente deja, Fish Audio generează venituri semnificative pentru o companie de început, sugerând că cererea de voci AI expresive și controlabile se extinde cu mult dincolo de noutate.
Rămâne de văzut dacă startup-ul își poate menține impulsul open-source în timp ce construiește o afacere profitabilă. Dar dimensiunea rundei și calitatea investitorilor care participă, semnalează faptul că piața vocii generate de AI este încă la începutul ei – și că investitorii văd un avantaj substanțial într-o companie care se adresează atât creatorilor indie, cât și întreprinderilor mari.
Rămâi înaintea știrilor AI Startup
Urmărește cele mai recente dezvoltări AI pe măsură ce generarea vocii și alte piețe generative de AI evoluează.
Citiți mai multe știri AI →