Fish Audio 是一家位于帕洛阿尔托的初创公司,致力于构建富有表现力的人工智能语音模型,该公司已在种子轮融资中筹集了 5000 万美元,以扩展其创意和企业用例平台。据 TechCrunch 报道,本轮融资由 Coreline Ventures 和 Capital Today 领投,参投方包括 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0。
该轮融资是人工智能语音生成领域规模较大的种子融资之一,反映了投资者对这家已经建立了巨大吸引力的公司的信心。 Fish Audio 目前有超过 800 万人使用其模型的开源或托管版本,每年产生 2100 万美元的经常性收入。这家初创公司的快速增长是更广泛的人工智能行业扩张浪潮的一部分,该浪潮持续吸引大量风险投资。
从单 GPU 项目到 800 万用户
Fish Audio 最初是 Nvidia 前研究员 Shijia Liao 的一个小项目,他对当时市场上平淡、缺乏表现力的合成声音感到沮丧。 Liao 在单个 GPU 上训练了语音生成模型并将其开源。这个名为 Fish Speech 的早期项目现已发展成为 GitHub 上拥有超过 31,000 颗星的存储库,供独立开发人员、视频游戏设计师和内容创作者使用。
在过去的一年里,该公司推出了五种模型:四种语音生成模型和一种语音转文本模型。它开源了三个语音生成模型,而其最新版本 S2.1 Pro 只能通过付费 API 获得。这种混合开放核心策略使 Fish Audio 能够建立一个大型开发者社区,同时将其最先进的功能货币化。
适用于每个用例的语音模型
据该公司称,Fish Audio 的与众不同之处在于它提供的控制范围广泛。该平台包括一个包含 15,000 多个自然语言控件的库,允许用户微调生成的声音的声音 - 调整语气、情感、节奏和风格。
首席执行官兼联合创始人 Rissa Cao 告诉 TechCrunch,该公司的企业客户有着截然不同的需求。像 HeyGen 这样的公司,使用 Fish Audio 声音来驱动人工智能化身,优先考虑真实感。游戏工作室希望他们的角色拥有富有表现力的声音。像 LiveKit 这样的语音代理公司需要声音自然、低延迟的语音,并且在实时电话通话中保持足够的表现力。
“每个企业都有不同的用例和不同的偏好,”曹说。其他客户包括专注于口音翻译的 Sanas 和生产人工智能录音设备的 Plaud。 Fish Audio 为创作者和团队提供按月付费计划,解锁一定分钟的生成时间以及语音克隆功能,以及其 API 的企业版。
通过用户贡献构建语音库
Fish Audio 扩展语音库的方法之一是邀请用户提交自己的录音用于训练模型,并在使用其语音时进行补偿。这种众包方法帮助该公司建立了多样化的产品目录,但也带来了挑战。
几个月前,一些创作者声称他们的声音在未经他们同意的情况下被上传到 Fish Audio 的平台。该初创公司制定了 DMCA 内容删除流程,但该流程进展缓慢。曹告诉 TechCrunch,该公司已将删除流程自动化,以更快地解决此类问题。
这场争议凸显了人工智能语音行业日益紧张的局势。随着合成语音技术的进步,授权和未经授权的使用之间的界限变得更难监管。尤其是语音克隆引起了人们对假冒和欺诈的担忧,一些国家的监管机构正在开始审查管理人工智能生成音频的法律框架。
竞争激烈且拥挤的市场
Fish Audio 在人工智能语音领域并不孤单。竞争对手包括已筹集数亿美元资金并被广泛视为市场领导者的 ElevenLabs,以及主要科技公司的产品。但 Fish Audio 对开源模型的重视及其庞大的开发者社区赋予了它独特的地位。
5000 万美元的种子轮融资为该公司提供了在模型质量方面展开竞争、扩大企业销售力度以及解决语音克隆技术带来的法律和道德问题的平台。 Fish Audio 的年度经常性收入已达 2100 万美元,正在为一家种子阶段公司带来可观的收入,这表明对富有表现力、可控的人工智能语音的需求远远超出了新颖性。
这家初创公司能否在建立盈利的企业业务的同时保持其开源势头还有待观察。但本轮融资的规模和参与投资者的质量表明,人工智能语音市场仍处于早期发展阶段,投资者看到了一家同时满足独立创作者和大型企业需求的公司的巨大优势。
保持领先的人工智能初创公司新闻
随着语音生成和其他生成 AI 市场的发展,关注最新的 AI 发展。
阅读更多人工智能新闻 →