Fish Audio, uma startup com sede em Palo Alto que cria modelos de voz de IA expressivos, arrecadou US$ 50 milhões em uma rodada inicial para expandir sua plataforma para casos de uso criativos e empresariais. A rodada de financiamento foi liderada pela Coreline Ventures e Capital Today, com a participação de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners e HF0, de acordo com reportagem do TechCrunch.
A rodada é um dos maiores financiamentos iniciais no espaço de geração de voz de IA, refletindo a confiança dos investidores em uma empresa que já construiu uma tração significativa. A Fish Audio agora conta com mais de 8 milhões de pessoas usando versões de código aberto ou hospedadas de seus modelos e gera US$ 21 milhões em receitas recorrentes anuais. O rápido crescimento da startup faz parte de uma onda mais ampla de expansão da indústria de IA que continua a atrair capital de risco substancial.
Do projeto de GPU única para 8 milhões de usuários
Fish Audio começou como um pequeno projeto paralelo de Shijia Liao, um ex-pesquisador da Nvidia que estava frustrado com as vozes sintéticas planas e não expressivas disponíveis no mercado. Liao treinou um modelo de geração de voz em uma única GPU e o abriu. Esse projeto inicial, conhecido como Fish Speech, desde então cresceu e se tornou um repositório com mais de 31.000 estrelas no GitHub, usado por desenvolvedores independentes, designers de videogames e criadores de conteúdo.
No ano passado, a empresa lançou cinco modelos: quatro modelos de geração de voz e um modelo de fala para texto. Possui código aberto para três de seus modelos de geração de voz, enquanto seu lançamento mais recente, S2.1 Pro, está disponível apenas por meio de uma API paga. Essa estratégia híbrida de núcleo aberto permitiu que a Fish Audio construísse uma grande comunidade de desenvolvedores enquanto monetizava seus recursos mais avançados.
Um modelo de voz para cada caso de uso
O que diferencia o Fish Audio, segundo a empresa, é a amplitude de controles que oferece. A plataforma inclui uma biblioteca de mais de 15.000 controles de linguagem natural que permitem aos usuários ajustar o som das vozes geradas – ajustando tom, emoção, ritmo e estilo.
A CEO e cofundadora Rissa Cao disse ao TechCrunch que os clientes corporativos da empresa atendem a necessidades muito diferentes. Empresas como a HeyGen, que usa vozes Fish Audio para alimentar avatares de IA, priorizam o realismo. Os estúdios de jogos querem vozes expressivas para seus personagens. Empresas de agentes de voz como a LiveKit precisam de vozes com som natural e de baixa latência que permaneçam expressivas o suficiente para chamadas telefônicas ao vivo.
“Cada empresa tem casos de uso e preferências diferentes”, disse Cao. Outros clientes incluem a Sanas, uma empresa focada na tradução de sotaques, e a Plaud, que fabrica dispositivos de gravação com tecnologia de IA. Fish Audio oferece planos mensais pagos para criadores e equipes que desbloqueiam um determinado número de minutos de geração, além de recursos de clonagem de voz, bem como uma versão empresarial de suas APIs.
Construindo uma biblioteca de voz por meio de contribuições de usuários
Uma das maneiras pelas quais a Fish Audio expandiu sua biblioteca de vozes foi convidando os usuários a enviar suas próprias gravações de voz para modelos de treinamento, compensando-os quando suas vozes forem usadas. Esta abordagem de crowdsourcing ajudou a empresa a construir um catálogo diversificado, mas também criou desafios.
Há alguns meses, alguns criadores alegaram que suas vozes foram carregadas na plataforma da Fish Audio sem o seu consentimento. A startup tinha um processo de remoção de conteúdo DMCA em vigor, mas o processo era lento. Cao disse ao TechCrunch que desde então a empresa automatizou o processo de remoção para resolver essas preocupações mais rapidamente.
A controvérsia destaca uma tensão crescente na indústria de voz de IA. À medida que a tecnologia de voz sintética melhora, a linha entre uso autorizado e não autorizado torna-se mais difícil de policiar. A clonagem de voz, em particular, levantou preocupações sobre a falsificação de identidade e a fraude, e os reguladores de vários países estão a começar a examinar os quadros jurídicos que regem o áudio gerado por IA.
Um mercado competitivo e lotado
Fish Audio está longe de estar sozinho no espaço de voz de IA. Os concorrentes incluem a ElevenLabs, que arrecadou centenas de milhões de dólares e é amplamente vista como líder de mercado, bem como ofertas de grandes empresas de tecnologia. Mas a ênfase da Fish Audio em modelos de código aberto e sua grande comunidade de desenvolvedores conferem-lhe uma posição distinta.
A rodada inicial de US$ 50 milhões dá à empresa espaço para competir em qualidade de modelo, expandir seus esforços de vendas empresariais e navegar pelas questões legais e éticas que acompanham a tecnologia de clonagem de voz. Já com US$ 21 milhões em receitas recorrentes anuais, a Fish Audio está gerando receitas significativas para uma empresa em estágio inicial, sugerindo que a demanda por vozes de IA expressivas e controláveis vai muito além da novidade.
Ainda não se sabe se a startup conseguirá manter seu impulso de código aberto enquanto constrói um negócio empresarial lucrativo. Mas a dimensão da ronda e a qualidade dos investidores participantes sinalizam que o mercado de voz gerada por IA ainda está nos seus primórdios – e que os investidores veem vantagens substanciais numa empresa que atende tanto criadores independentes como grandes empresas.
Fique por dentro das novidades sobre startups de IA
Acompanhe os mais recentes desenvolvimentos de IA à medida que a geração de voz e outros mercados generativos de IA evoluem.
Leia mais notícias sobre IA →