Fish Audio, một công ty khởi nghiệp có trụ sở tại Palo Alto xây dựng các mô hình giọng nói AI biểu cảm, đã huy động được 50 triệu USD trong vòng hạt giống để mở rộng nền tảng của mình cho cả trường hợp sử dụng sáng tạo và doanh nghiệp. Vòng tài trợ được dẫn đầu bởi Coreline Ventures và Capital Today, với sự tham gia của 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners và HF0, theo báo cáo của TechCrunch.

Vòng này là một trong những khoản tài trợ hạt giống lớn hơn trong lĩnh vực tạo giọng nói AI, phản ánh niềm tin của nhà đầu tư vào một công ty đã tạo dựng được lực kéo đáng kể. Fish Audio hiện có hơn 8 triệu người sử dụng phiên bản nguồn mở hoặc phiên bản được lưu trữ của các mô hình của mình và tạo ra doanh thu định kỳ hàng năm là 21 triệu USD. Sự tăng trưởng nhanh chóng của công ty khởi nghiệp này là một phần trong làn sóng mở rộng ngành công nghiệp AI rộng lớn hơn đang tiếp tục thu hút vốn đầu tư mạo hiểm đáng kể.

Từ dự án GPU đơn tới 8 triệu người dùng

Fish Audio bắt đầu như một dự án phụ nhỏ của Shijia Liao, một cựu nhà nghiên cứu của Nvidia, người đã thất vọng vì những giọng nói tổng hợp phẳng lặng, không biểu cảm hiện có trên thị trường. Liao đã đào tạo mô hình tạo giọng nói trên một GPU duy nhất và mã nguồn mở cho nó. Dự án ban đầu đó, được gọi là Fish Speech, kể từ đó đã phát triển thành một kho lưu trữ với hơn 31.000 sao trên GitHub, được sử dụng bởi các nhà phát triển độc lập, nhà thiết kế trò chơi điện tử và người sáng tạo nội dung.

Trong năm qua, công ty đã tung ra năm mô hình: bốn mô hình tạo giọng nói và một mô hình chuyển giọng nói thành văn bản. Nó có ba mô hình tạo giọng nói có nguồn mở, trong khi bản phát hành mới nhất, S2.1 Pro, chỉ khả dụng thông qua API trả phí. Chiến lược lõi mở kết hợp này đã cho phép Fish Audio xây dựng một cộng đồng lớn các nhà phát triển đồng thời kiếm tiền từ các khả năng tiên tiến nhất của mình.

Mẫu giọng nói cho mọi trường hợp sử dụng

Theo công ty, điều làm nên sự khác biệt của Fish Audio là phạm vi điều khiển mà nó cung cấp. Nền tảng này bao gồm một thư viện gồm hơn 15.000 điều khiển ngôn ngữ tự nhiên cho phép người dùng tinh chỉnh cách phát ra âm thanh giọng nói - điều chỉnh âm sắc, cảm xúc, nhịp độ và phong cách.

Giám đốc điều hành và đồng sáng lập Rissa Cao nói với TechCrunch rằng khách hàng doanh nghiệp của công ty có những nhu cầu rất khác nhau. Các công ty như HeyGen, sử dụng giọng nói của Fish Audio để hỗ trợ hình đại diện AI, ưu tiên chủ nghĩa hiện thực. Các studio chơi game muốn có giọng nói biểu cảm cho nhân vật của họ. Các công ty hỗ trợ giọng nói như LiveKit cần giọng nói có âm thanh tự nhiên, độ trễ thấp nhưng vẫn đủ biểu cảm cho các cuộc gọi điện thoại trực tiếp.

“Mỗi doanh nghiệp đều có những trường hợp sử dụng khác nhau và sở thích khác nhau”, Cao nói. Các khách hàng khác bao gồm Sanas, một công ty tập trung vào dịch giọng và Plaud, công ty sản xuất các thiết bị ghi âm hỗ trợ AI. Fish Audio cung cấp các gói trả phí hàng tháng cho người sáng tạo và nhóm mở khóa số phút tạo cộng với các tính năng sao chép giọng nói cũng như phiên bản doanh nghiệp của API.

Xây dựng thư viện giọng nói thông qua đóng góp của người dùng

Một trong những cách Fish Audio đã mở rộng thư viện giọng nói của mình là mời người dùng gửi bản ghi âm giọng nói của chính họ cho các mô hình đào tạo, đền bù cho họ khi giọng nói của họ được sử dụng. Cách tiếp cận huy động nguồn lực từ cộng đồng này đã giúp công ty xây dựng một danh mục đa dạng nhưng cũng tạo ra nhiều thách thức.

Vài tháng trước, một số người sáng tạo đã cáo buộc rằng giọng nói của họ đã được tải lên nền tảng của Fish Audio mà không có sự đồng ý của họ. Công ty khởi nghiệp này đã áp dụng quy trình gỡ bỏ nội dung DMCA nhưng quá trình này diễn ra rất chậm. Cao nói với TechCrunch rằng công ty đã tự động hóa quy trình gỡ xuống để giải quyết những lo ngại đó nhanh hơn.

Cuộc tranh cãi làm nổi bật sự căng thẳng ngày càng tăng trong ngành giọng nói AI. Khi công nghệ giọng nói tổng hợp được cải thiện, ranh giới giữa việc sử dụng được phép và trái phép trở nên khó khăn hơn đối với cảnh sát. Đặc biệt, việc nhân bản giọng nói đã làm dấy lên lo ngại về việc mạo danh và lừa đảo, đồng thời các cơ quan quản lý ở một số quốc gia đang bắt đầu kiểm tra các khung pháp lý quản lý âm thanh do AI tạo ra.

Một thị trường cạnh tranh và đông đúc

Fish Audio không hề đơn độc trong không gian giọng nói AI. Các đối thủ cạnh tranh bao gồm ElevenLabs, công ty đã huy động được hàng trăm triệu đô la và được nhiều người coi là công ty dẫn đầu thị trường, cũng như các dịch vụ từ các công ty công nghệ lớn. Nhưng sự nhấn mạnh của Fish Audio vào các mô hình nguồn mở và cộng đồng các nhà phát triển lớn đã mang lại cho nó một vị thế đặc biệt.

Vòng hạt giống trị giá 50 triệu đô la giúp công ty cạnh tranh về chất lượng mô hình, mở rộng nỗ lực bán hàng cho doanh nghiệp và giải quyết các câu hỏi về pháp lý và đạo đức đi kèm với công nghệ nhân bản giọng nói. Với doanh thu định kỳ hàng năm là 21 triệu USD, Fish Audio đang tạo ra doanh thu đáng kể cho một công ty đang ở giai đoạn hạt giống, cho thấy rằng nhu cầu về giọng nói AI có tính biểu cảm và có thể kiểm soát vượt xa sự mới lạ.

Liệu công ty khởi nghiệp có thể duy trì động lực nguồn mở của mình trong khi xây dựng một doanh nghiệp kinh doanh có lợi nhuận hay không vẫn còn phải xem. Nhưng quy mô của vòng này và chất lượng của các nhà đầu tư tham gia, báo hiệu rằng thị trường cho giọng nói do AI tạo ra vẫn đang ở giai đoạn đầu - và các nhà đầu tư nhìn thấy lợi thế đáng kể ở một công ty phục vụ cả những người sáng tạo độc lập và các doanh nghiệp lớn.

Đi trước tin tức khởi nghiệp AI

Theo dõi sự phát triển AI mới nhất khi việc tạo giọng nói và các thị trường AI tổng hợp khác phát triển.

Đọc thêm tin tức về AI →