Etkileyici yapay zeka ses modelleri geliştiren Palo Alto merkezli bir girişim olan Fish Audio, platformunu hem yaratıcı hem de kurumsal kullanım örnekleri için genişletmek amacıyla bir tohum turunda 50 milyon dolar topladı. TechCrunch'ın raporuna göre finansman turu, 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners ve HF0'ın katılımıyla Coreline Ventures ve Capital Today tarafından yönetildi.
Bu tur, yapay zeka ses üretimi alanındaki en büyük başlangıç finansmanlarından biri olup, yatırımcıların hâlihazırda kayda değer bir ilgi kazanmış bir şirkete olan güvenini yansıtıyor. Fish Audio şu anda modellerinin açık kaynaklı veya barındırılan sürümlerini kullanan 8 milyondan fazla kişi sayıyor ve yıllık 21 milyon dolar sürekli gelir elde ediyor. Yeni girişimin hızlı büyümesi, önemli risk sermayesi çekmeye devam eden daha geniş bir AI endüstrisi genişleme dalgasının bir parçası.
Tek GPU Projesinden 8 Milyon Kullanıcıya
Fish Audio, o zamanlar piyasada mevcut olan düz, anlamlı olmayan sentetik seslerden hayal kırıklığına uğrayan eski bir Nvidia araştırmacısı olan Shijia Liao tarafından küçük bir yan proje olarak başladı. Liao, tek bir GPU üzerinde bir ses oluşturma modeli eğitti ve bunu açık kaynaklı hale getirdi. Fish Speech olarak bilinen bu ilk proje, o zamandan beri GitHub'da bağımsız geliştiriciler, video oyunu tasarımcıları ve içerik yaratıcıları tarafından kullanılan 31.000'den fazla yıldızın bulunduğu bir depoya dönüştü.
Geçtiğimiz yıl şirket beş model piyasaya sürdü: dört konuşma üretme modeli ve bir konuşmayı metne dönüştürme modeli. Konuşma oluşturma modellerinden üçü açık kaynaklıdır ve en son sürümü olan S2.1 Pro yalnızca ücretli bir API aracılığıyla kullanılabilir. Bu hibrit açık çekirdek stratejisi, Fish Audio'nun en gelişmiş özelliklerinden para kazanırken geniş bir geliştirici topluluğu oluşturmasına olanak tanıdı.
Her Kullanım Durumuna Uygun Bir Ses Modeli
Şirkete göre Fish Audio'yu diğerlerinden ayıran şey, sunduğu kontrollerin genişliğidir. Platform, kullanıcıların oluşturulan seslerin nasıl seslendirileceğine, tonu, duyguyu, tempoyu ve stili ayarlayarak ince ayar yapmasına olanak tanıyan 15.000'den fazla doğal dil kontrolünden oluşan bir kütüphane içerir.
CEO ve kurucu ortak Rissa Cao, TechCrunch'a şirketin kurumsal müşterilerinin çok farklı ihtiyaçlara sahip olduğunu söyledi. Yapay zeka avatarlarını güçlendirmek için Fish Audio seslerini kullanan HeyGen gibi şirketler gerçekçiliğe öncelik veriyor. Oyun stüdyoları karakterleri için etkileyici sesler istiyor. LiveKit gibi ses aracısı şirketleri, canlı telefon görüşmeleri için yeterince etkileyici olan doğal sese sahip, düşük gecikmeli seslere ihtiyaç duyuyor.
Cao, "Her işletmenin farklı kullanım durumları ve farklı tercihleri vardır" dedi. Diğer müşteriler arasında aksanlı çeviriye odaklanan bir şirket olan Sanas ve yapay zeka destekli kayıt cihazları üreten Plaud yer alıyor. Fish Audio, içerik oluşturucular ve ekipler için belirli sayıda dakikalık üretim artı ses klonlama özelliklerinin yanı sıra API'lerinin kurumsal sürümünün kilidini açan ücretli aylık planlar sunar.
Kullanıcı Katkılarıyla Ses Kitaplığı Oluşturma
Fish Audio'nun ses kitaplığını genişletmenin yollarından biri, kullanıcıları eğitim modelleri için kendi ses kayıtlarını göndermeye davet etmek ve sesleri kullanıldığında bunu telafi etmektir. Bu kitle kaynaklı yaklaşım, şirketin çeşitlilik içeren bir katalog oluşturmasına yardımcı oldu, ancak aynı zamanda zorluklar da yarattı.
Birkaç ay önce bazı içerik oluşturucular, seslerinin Fish Audio platformuna kendi rızaları olmadan yüklendiğini iddia etmişti. Başlangıçta bir DMCA içerik kaldırma süreci vardı, ancak süreç yavaştı. Cao, TechCrunch'a şirketin bu tür endişeleri daha hızlı gidermek için kaldırma sürecini otomatikleştirdiğini söyledi.
Tartışma, yapay zeka ses endüstrisinde artan gerilimi vurguluyor. Sentetik ses teknolojisi geliştikçe, yetkili ve yetkisiz kullanım arasındaki çizginin polis tarafından kontrol edilmesi zorlaşıyor. Özellikle ses klonlama, kimliğe bürünme ve dolandırıcılık konusundaki endişeleri artırdı ve birçok ülkedeki düzenleyiciler, yapay zeka tarafından üretilen sesi düzenleyen yasal çerçeveleri incelemeye başlıyor.
Rekabetçi ve Kalabalık Bir Pazar
Fish Audio, yapay zeka ses alanında yalnız olmaktan çok uzaktır. Rakipler arasında yüz milyonlarca dolar toplayan ve yaygın olarak pazar lideri olarak görülen ElevenLabs'ın yanı sıra büyük teknoloji şirketlerinin teklifleri de yer alıyor. Ancak Fish Audio'nun açık kaynak modellere verdiği önem ve geniş geliştirici topluluğu ona farklı bir konum kazandırıyor.
50 milyon dolarlık başlangıç turu, şirkete model kalitesi konusunda rekabet etme, kurumsal satış çabalarını genişletme ve ses klonlama teknolojisinin getirdiği yasal ve etik soruları çözme olanağı sağlıyor. Halihazırda yıllık 21 milyon dolarlık sürekli geliriyle Fish Audio, tohum aşamasındaki bir şirket için anlamlı bir gelir elde ediyor; bu da etkileyici, kontrol edilebilir yapay zeka seslerine olan talebin yeniliğin çok ötesine uzandığını gösteriyor.
Startup'ın kârlı bir kurumsal iş kurarken açık kaynak ivmesini koruyup sürdüremeyeceği henüz bilinmiyor. Ancak turun boyutu ve katılan yatırımcıların kalitesi, yapay zeka tarafından üretilen ses pazarının hâlâ başlangıç aşamasında olduğunu ve yatırımcıların hem bağımsız yaratıcılara hem de büyük işletmelere hitap eden bir şirkette önemli bir avantaj gördüklerini gösteriyor.
Yapay Zeka Başlangıç Haberlerinin Önünde Olun
Ses üretimi ve diğer üretken yapay zeka pazarları geliştikçe en son Yapay Zeka gelişmelerini takip edin.
Daha fazla AI haberini okuyun →