Palo Alto에 본사를 두고 표현력이 풍부한 AI 음성 모델을 구축하는 스타트업인 Fish Audio는 창의적인 사용 사례와 기업 사용 사례 모두를 위한 플랫폼을 확장하기 위해 시드 라운드에서 5천만 달러를 모금했습니다. TechCrunch의 보고에 따르면 자금 조달 라운드는 Coreline Ventures와 Capital Today가 주도했으며 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners 및 HF0이 참여했습니다.
이번 라운드는 AI 음성 생성 공간에서 가장 큰 시드 파이낸싱 중 하나이며, 이미 상당한 견인력을 구축한 회사에 대한 투자자의 신뢰를 반영합니다. Fish Audio는 현재 해당 모델의 오픈 소스 또는 호스팅 버전을 사용하는 사람이 800만 명 이상이며 연간 2,100만 달러의 반복 수익을 창출하고 있습니다. 스타트업의 급속한 성장은 상당한 벤처 캐피탈을 지속적으로 유치하는 AI 산업 확장의 광범위한 물결의 일부입니다.
단일 GPU 프로젝트에서 800만 사용자로
Fish Audio는 당시 시장에 나와 있던 단조롭고 표현력이 없는 합성 음성에 좌절했던 전직 Nvidia 연구원 Shijia Liao의 작은 사이드 프로젝트로 시작되었습니다. Liao는 단일 GPU에서 음성 생성 모델을 훈련하고 이를 오픈 소스로 제공했습니다. Fish Speech로 알려진 초기 프로젝트는 이후 GitHub에서 독립 개발자, 비디오 게임 디자이너 및 콘텐츠 제작자가 사용하는 31,000개 이상의 별이 있는 저장소로 성장했습니다.
작년에 회사는 4개의 음성 생성 모델과 1개의 음성-텍스트 모델 등 5개의 모델을 출시했습니다. 세 가지 음성 생성 모델을 오픈 소스로 제공했으며 최신 릴리스인 S2.1 Pro는 유료 API를 통해서만 사용할 수 있습니다. 이 하이브리드 오픈 코어 전략을 통해 Fish Audio는 대규모 개발자 커뮤니티를 구축하는 동시에 가장 발전된 기능으로 수익을 창출할 수 있었습니다.
모든 사용 사례에 적합한 음성 모델
회사에 따르면 Fish Audio가 차별화되는 점은 제공되는 컨트롤의 폭입니다. 이 플랫폼에는 사용자가 생성된 음성 소리를 미세 조정할 수 있는 15,000개 이상의 자연어 컨트롤 라이브러리가 포함되어 있습니다(톤, 감정, 속도 및 스타일 조정).
CEO이자 공동 창업자인 Rissa Cao는 TechCrunch에 회사의 기업 고객의 요구 사항이 매우 다양하다고 말했습니다. Fish Audio 음성을 사용하여 AI 아바타를 구동하는 HeyGen과 같은 회사는 현실감을 우선시합니다. 게임 스튜디오는 캐릭터에 표현력이 풍부한 목소리를 원합니다. LiveKit과 같은 음성 에이전트 회사에는 실시간 전화 통화에 충분히 표현력을 유지하면서 자연스럽고 지연 시간이 짧은 음성이 필요합니다.
Cao는 "기업마다 사용 사례와 선호도가 다릅니다."라고 말했습니다. 다른 고객으로는 악센트 번역에 주력하는 회사인 Sanas와 AI 기반 녹음 장치를 만드는 Plaud가 있습니다. Fish Audio는 제작자와 팀을 위해 정해진 생성 시간(분)과 음성 복제 기능, 엔터프라이즈 버전의 API를 잠금 해제하는 유료 월간 요금제를 제공합니다.
사용자 기여를 통해 음성 라이브러리 구축
Fish Audio가 음성 라이브러리를 확장한 방법 중 하나는 사용자가 훈련 모델을 위해 자신의 음성 녹음을 제출하도록 초대하고 음성이 사용될 때 이를 보상하는 것입니다. 이러한 크라우드소싱 접근 방식은 회사가 다양한 카탈로그를 구축하는 데 도움이 되었지만 문제도 발생했습니다.
몇 달 전, 일부 제작자들은 자신의 목소리가 동의 없이 Fish Audio의 플랫폼에 업로드되었다고 주장했습니다. 스타트업에는 DMCA 콘텐츠 게시 중단 프로세스가 있었지만 프로세스가 느렸습니다. Cao는 TechCrunch에 회사가 이후 이러한 문제를 보다 신속하게 해결하기 위해 게시 중단 프로세스를 자동화했다고 말했습니다.
이번 논란은 AI 음성 업계의 긴장감이 고조되고 있다는 점을 강조한다. 합성 음성 기술이 향상됨에 따라 승인된 사용과 무단 사용 사이의 경계가 경찰이 더욱 어려워지고 있습니다. 특히 음성 복제는 명의 도용과 사기에 대한 우려를 불러일으켰으며, 여러 국가의 규제 당국은 AI 생성 오디오를 관리하는 법적 프레임워크를 조사하기 시작했습니다.
경쟁적이고 혼잡한 시장
Fish Audio는 AI 음성 공간에서 결코 혼자가 아닙니다. 경쟁업체로는 수억 달러를 모금했으며 시장 선두주자로 널리 알려진 ElevenLabs와 주요 기술 회사의 제품이 있습니다. 그러나 오픈 소스 모델과 대규모 개발자 커뮤니티에 대한 Fish Audio의 강조는 독특한 위치를 제공합니다.
5천만 달러 규모의 시드 라운드를 통해 회사는 모델 품질을 놓고 경쟁하고, 기업 판매 노력을 확장하고, 음성 복제 기술과 관련된 법적, 윤리적 문제를 해결할 수 있는 기회를 얻었습니다. 연간 반복 수익이 이미 2,100만 달러에 달하는 Fish Audio는 초기 단계 회사에 의미 있는 수익을 창출하고 있으며, 이는 표현력 있고 제어 가능한 AI 음성에 대한 수요가 참신함을 훨씬 뛰어넘는 것임을 시사합니다.
스타트업이 수익성 있는 엔터프라이즈 비즈니스를 구축하면서 오픈 소스 추진력을 유지할 수 있는지 여부는 아직 밝혀지지 않았습니다. 그러나 라운드의 규모와 참여하는 투자자의 질은 AI 생성 음성 시장이 아직 초기 단계에 있으며 투자자들이 인디 창작자와 대기업 모두를 만족시키는 회사에서 상당한 상승 가능성을 보고 있음을 나타냅니다.
AI 스타트업 뉴스에 앞서가세요
음성 생성 및 기타 생성 AI 시장이 발전함에 따라 최신 AI 개발을 팔로우하세요.
AI 뉴스 자세히 보기 →