Fish Audio, une startup basée à Palo Alto qui crée des modèles vocaux d'IA expressifs, a levé 50 millions de dollars lors d'un tour de table pour étendre sa plate-forme aux cas d'utilisation créatifs et d'entreprise. Le cycle de financement a été mené par Coreline Ventures et Capital Today, avec la participation de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners et HF0, selon les informations de TechCrunch.

Il s'agit de l'un des financements d'amorçage les plus importants dans le domaine de la génération de voix par l'IA, reflétant la confiance des investisseurs dans une entreprise qui a déjà acquis une traction significative. Fish Audio compte désormais plus de 8 millions de personnes utilisant les versions open source ou hébergées de ses modèles et génère 21 millions de dollars de revenus récurrents annuels. La croissance rapide de la startup fait partie d'une vague plus large d'expansion de l'industrie de l'IA qui continue d'attirer un capital-risque important.

Du projet mono-GPU à 8 millions d'utilisateurs

Fish Audio a commencé comme un petit projet parallèle de Shijia Liao, un ancien chercheur de Nvidia frustré par les voix synthétiques plates et non expressives alors disponibles sur le marché. Liao a formé un modèle de génération vocale sur un seul GPU et l'a publié en open source. Ce premier projet, connu sous le nom de Fish Speech, est depuis devenu un référentiel de plus de 31 000 étoiles sur GitHub, utilisé par des développeurs indépendants, des concepteurs de jeux vidéo et des créateurs de contenu.

Au cours de la dernière année, la société a lancé cinq modèles : quatre modèles de génération vocale et un modèle de synthèse vocale. Il propose trois de ses modèles de génération vocale en open source, tandis que sa dernière version, S2.1 Pro, n'est disponible que via une API payante. Cette stratégie hybride à noyau ouvert a permis à Fish Audio de constituer une large communauté de développeurs tout en monétisant ses capacités les plus avancées.

Un modèle vocal pour chaque cas d'utilisation

Ce qui distingue Fish Audio, selon la société, c'est l'étendue des commandes qu'elle propose. La plate-forme comprend une bibliothèque de plus de 15 000 commandes en langage naturel qui permettent aux utilisateurs d'affiner le son des voix générées, en ajustant le ton, l'émotion, le rythme et le style.

Le PDG et co-fondateur Rissa Cao a déclaré à TechCrunch que les entreprises clientes de l'entreprise couvrent des besoins très différents. Des entreprises comme HeyGen, qui utilise les voix Fish Audio pour alimenter les avatars IA, donnent la priorité au réalisme. Les studios de jeux vidéo veulent des voix expressives pour leurs personnages. Les sociétés d'agents vocaux comme LiveKit ont besoin de voix naturelles et à faible latence qui restent suffisamment expressives pour les appels téléphoniques en direct.

« Chaque entreprise a des cas d'utilisation et des préférences différents », a déclaré Cao. Parmi les autres clients figurent Sanas, une société axée sur la traduction d'accents, et Plaud, qui fabrique des appareils d'enregistrement alimentés par l'IA. Fish Audio propose des forfaits mensuels payants pour les créateurs et les équipes qui débloquent un nombre défini de minutes de génération ainsi que des fonctionnalités de clonage vocal, ainsi qu'une version entreprise de ses API.

Création d'une bibliothèque vocale grâce aux contributions des utilisateurs

L'une des façons dont Fish Audio a élargi sa bibliothèque de voix consiste à inviter les utilisateurs à soumettre leurs propres enregistrements vocaux pour former des modèles, en les rémunérant lorsque leurs voix sont utilisées. Cette approche participative a aidé l'entreprise à créer un catalogue diversifié, mais elle a également créé des défis.

Il y a quelques mois, certains créateurs ont affirmé que leurs voix avaient été téléchargées sur la plateforme Fish Audio sans leur consentement. La startup avait mis en place un processus de retrait de contenu DMCA, mais le processus était lent. Cao a déclaré à TechCrunch que la société avait depuis automatisé le processus de retrait pour répondre plus rapidement à ces problèmes.

La controverse met en évidence une tension croissante dans l’industrie de la voix IA. À mesure que la technologie de la voix synthétique s’améliore, la frontière entre utilisation autorisée et non autorisée devient plus difficile à contrôler. Le clonage vocal, en particulier, a suscité des inquiétudes quant à l’usurpation d’identité et à la fraude, et les régulateurs de plusieurs pays commencent à examiner les cadres juridiques régissant l’audio généré par l’IA.

Un marché compétitif et encombré

Fish Audio est loin d'être seul dans l'espace vocal de l'IA. Les concurrents incluent ElevenLabs, qui a levé des centaines de millions de dollars et est largement considéré comme le leader du marché, ainsi que les offres de grandes entreprises technologiques. Mais l'accent mis par Fish Audio sur les modèles open source et sa large communauté de développeurs lui confèrent une position distinctive.

Le cycle de démarrage de 50 millions de dollars donne à l'entreprise la possibilité de rivaliser sur la qualité des modèles, d'étendre ses efforts de vente aux entreprises et de répondre aux questions juridiques et éthiques liées à la technologie de clonage vocal. Avec déjà 21 millions de dollars de revenus annuels récurrents, Fish Audio génère des revenus significatifs pour une entreprise en phase de démarrage, ce qui suggère que la demande de voix IA expressives et contrôlables s'étend bien au-delà de la nouveauté.

Reste à savoir si la startup pourra maintenir sa dynamique open source tout en créant une entreprise rentable. Mais l’ampleur du cycle et la qualité des investisseurs participants indiquent que le marché de la voix générée par l’IA en est encore à ses débuts – et que les investisseurs voient un potentiel considérable dans une entreprise qui s’adresse à la fois aux créateurs indépendants et aux grandes entreprises.

Gardez une longueur d'avance sur l'actualité des startups d'IA

Suivez les derniers développements de l'IA à mesure que la génération vocale et d'autres marchés de l'IA générative évoluent.

Lire plus d'actualités sur l'IA →