Fish Audio, sebuah model suara AI ekspresif berasaskan Palo Alto, telah mengumpulkan $50 juta dalam pusingan benih untuk mengembangkan platformnya untuk kedua-dua kes penggunaan kreatif dan perusahaan. Pusingan pembiayaan itu diketuai oleh Coreline Ventures dan Capital Today, dengan penyertaan daripada 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners, dan HF0, menurut laporan oleh TechCrunch.
Pusingan itu adalah salah satu pembiayaan benih yang lebih besar dalam ruang penjanaan suara AI, mencerminkan keyakinan pelabur terhadap syarikat yang telah membina daya tarikan yang ketara. Audio Ikan kini mengira lebih daripada 8 juta orang menggunakan sama ada versi sumber terbuka atau dihoskan modelnya, dan menjana pendapatan berulang tahunan sebanyak $21 juta. Pertumbuhan pesat syarikat permulaan adalah sebahagian daripada gelombang pengembangan industri AI yang lebih luas yang terus menarik modal teroka yang besar.
Daripada Projek GPU Tunggal kepada 8 Juta Pengguna
Audio Ikan bermula sebagai projek sampingan kecil oleh Shijia Liao, bekas penyelidik Nvidia yang kecewa dengan suara sintetik yang rata dan tidak ekspresif yang tersedia di pasaran. Liao melatih model penjanaan suara pada GPU tunggal dan menggunakan sumber terbuka. Projek awal itu, yang dikenali sebagai Fish Speech, telah berkembang menjadi repositori dengan lebih daripada 31,000 bintang di GitHub, yang digunakan oleh pembangun bebas, pereka permainan video dan pencipta kandungan.
Pada tahun lalu, syarikat itu telah melancarkan lima model: empat model penjanaan pertuturan dan satu model pertuturan ke teks. Ia mempunyai tiga model penjanaan pertuturan sumber terbukanya, manakala keluaran terbarunya, S2.1 Pro, tersedia hanya melalui API berbayar. Strategi teras terbuka hibrid ini telah membolehkan Audio Ikan membina komuniti pembangun yang besar sambil mengewangkan keupayaannya yang paling maju.
Model Suara untuk Setiap Kes Penggunaan
Apa yang membezakan Audio Ikan, menurut syarikat itu, adalah keluasan kawalan yang ditawarkannya. Platform ini termasuk perpustakaan lebih daripada 15,000 kawalan bahasa semula jadi yang membolehkan pengguna memperhalusi cara suara yang dihasilkan berbunyi — melaraskan nada, emosi, rentak dan gaya.
Ketua Pegawai Eksekutif dan pengasas bersama Rissa Cao memberitahu TechCrunch bahawa pelanggan perusahaan syarikat itu merangkumi keperluan yang sangat berbeza. Syarikat seperti HeyGen, yang menggunakan suara Audio Ikan untuk menggerakkan avatar AI, mengutamakan realisme. Studio permainan mahukan suara ekspresif untuk watak mereka. Syarikat ejen suara seperti LiveKit memerlukan suara semula jadi, kependaman rendah yang kekal cukup ekspresif untuk panggilan telefon secara langsung.
"Setiap perusahaan mempunyai kes penggunaan yang berbeza dan pilihan yang berbeza," kata Cao. Pelanggan lain termasuk Sanas, sebuah syarikat yang memfokuskan pada terjemahan aksen, dan Plaud, yang membuat peranti rakaman berkuasa AI. Audio Ikan menawarkan pelan bulanan berbayar untuk pencipta dan pasukan yang membuka kunci beberapa minit penjanaan serta ciri pengklonan suara, serta versi perusahaan APInya.
Membina Pustaka Suara Melalui Sumbangan Pengguna
Salah satu cara Fish Audio telah mengembangkan perpustakaan suaranya ialah dengan menjemput pengguna untuk menyerahkan rakaman suara mereka sendiri untuk model latihan, memberi pampasan kepada mereka apabila suara mereka digunakan. Pendekatan sumber ramai ini telah membantu syarikat membina katalog yang pelbagai, tetapi ia juga mencipta cabaran.
Beberapa bulan lalu, beberapa pencipta mendakwa bahawa suara mereka telah dimuat naik ke platform Audio Ikan tanpa persetujuan mereka. Permulaan mempunyai proses alih keluar kandungan DMCA, tetapi prosesnya perlahan. Cao memberitahu TechCrunch bahawa syarikat itu telah mengautomasikan proses alih keluar untuk menangani kebimbangan sedemikian dengan lebih cepat.
Kontroversi itu menyerlahkan ketegangan yang semakin meningkat dalam industri suara AI. Apabila teknologi suara sintetik bertambah baik, garis antara penggunaan yang dibenarkan dan tidak dibenarkan menjadi lebih sukar untuk dikawal. Pengklonan suara, khususnya, telah menimbulkan kebimbangan mengenai penyamaran dan penipuan, dan pengawal selia di beberapa negara mula meneliti rangka kerja undang-undang yang mengawal audio yang dijana AI.
Pasaran yang Berdaya Saing dan Sesak
Audio Ikan tidak begitu sahaja dalam ruang suara AI. Pesaing termasuk ElevenLabs, yang telah mengumpul ratusan juta dolar dan dilihat secara meluas sebagai peneraju pasaran, serta tawaran daripada syarikat teknologi utama. Tetapi penekanan Fish Audio pada model sumber terbuka dan komuniti pembangunnya yang besar memberikannya kedudukan tersendiri.
Pusingan benih bernilai $50 juta memberikan syarikat landasan untuk bersaing dalam kualiti model, mengembangkan usaha jualan perusahaannya, dan menavigasi persoalan undang-undang dan etika yang datang dengan teknologi pengklonan suara. Dengan pendapatan berulang tahunan sebanyak $21 juta, Audio Ikan sedang menjana hasil yang bermakna untuk sebuah syarikat peringkat benih, menunjukkan bahawa permintaan untuk suara AI yang ekspresif dan boleh dikawal menjangkaui kebaharuan.
Sama ada syarikat permulaan boleh mengekalkan momentum sumber terbukanya sambil membina perniagaan perusahaan yang menguntungkan masih belum dapat dilihat. Tetapi saiz pusingan itu, dan kualiti pelabur yang mengambil bahagian, menandakan bahawa pasaran untuk suara yang dijana AI masih berada di peringkat awal - dan pelabur melihat peningkatan yang ketara dalam syarikat yang memenuhi keperluan pencipta indie dan perusahaan besar.
Kekal Mendahului Berita Permulaan AI
Ikuti [perkembangan AI] terkini (https://aibuzzwire.news) apabila penjanaan suara dan pasaran AI generatif lain berkembang.
Baca lebih banyak berita AI →