Fish Audio ซึ่งเป็นสตาร์ทอัพที่ใช้ Palo Alto ที่สร้างโมเดลเสียง AI ที่แสดงออกได้ ได้ระดมทุน 50 ล้านดอลลาร์ในรอบเริ่มต้นเพื่อขยายแพลตฟอร์มสำหรับกรณีการใช้งานเชิงสร้างสรรค์และระดับองค์กร รอบการระดมทุนนำโดย Coreline Ventures และ Capital Today โดยมีส่วนร่วมจาก 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners และ HF0 ตามรายงานของ TechCrunch
รอบนี้เป็นหนึ่งในการจัดหาเงินทุนขนาดใหญ่ในพื้นที่การสร้างเสียงของ AI ซึ่งสะท้อนถึงความเชื่อมั่นของนักลงทุนในบริษัทที่สร้างแรงผลักดันที่สำคัญแล้ว ปัจจุบัน Fish Audio มีจำนวนผู้คนมากกว่า 8 ล้านคนที่ใช้โมเดลเวอร์ชันโอเพ่นซอร์สหรือโฮสต์ และสร้างรายได้ประจำต่อปีถึง 21 ล้านดอลลาร์ การเติบโตอย่างรวดเร็วของสตาร์ทอัพนี้เป็นส่วนหนึ่งของการขยายวงกว้างของ อุตสาหกรรม AI ซึ่งยังคงดึงดูดเงินทุนร่วมลงทุนจำนวนมาก
จากโครงการ Single-GPU สู่ผู้ใช้ 8 ล้านคน
Fish Audio เริ่มต้นจากโปรเจ็กต์เล็ก ๆ โดย Shijia Liao อดีตนักวิจัยของ Nvidia ผู้ซึ่งรู้สึกหงุดหงิดกับเสียงสังเคราะห์ที่ไม่แสดงออกและไม่แสดงออกที่มีอยู่ในตลาด Liao ฝึกฝนโมเดลการสร้างเสียงบน GPU ตัวเดียวและเปิดแหล่งที่มา โปรเจ็กต์ในช่วงแรกๆ ที่เรียกว่า Fish Speech ได้เติบโตขึ้นจนกลายเป็นแหล่งเก็บข้อมูลที่มีดาวมากกว่า 31,000 ดวงบน GitHub ซึ่งนักพัฒนาอิสระ นักออกแบบวิดีโอเกม และผู้สร้างเนื้อหาใช้งาน
ในปีที่ผ่านมา บริษัทได้เปิดตัวโมเดล 5 รุ่น ได้แก่ โมเดลการสร้างเสียงพูด 4 โมเดล และโมเดลการแปลงคำพูดเป็นข้อความ 1 โมเดล มีโมเดลการสร้างคำพูดแบบโอเพ่นซอร์สสามแบบ ในขณะที่รุ่นล่าสุด S2.1 Pro มีให้บริการผ่าน API แบบชำระเงินเท่านั้น กลยุทธ์โอเพ่นคอร์แบบไฮบริดนี้ทำให้ Fish Audio สามารถสร้างชุมชนนักพัฒนาขนาดใหญ่ ขณะเดียวกันก็สร้างรายได้จากความสามารถขั้นสูงสุด
โมเดลเสียงสำหรับทุกกรณีการใช้งาน
สิ่งที่ทำให้ Fish Audio แตกต่างออกไป ตามที่บริษัทระบุคือการควบคุมที่หลากหลายที่มีให้ แพลตฟอร์มดังกล่าวมีไลบรารีการควบคุมภาษาธรรมชาติมากกว่า 15,000 ภาษาที่อนุญาตให้ผู้ใช้ปรับแต่งวิธีการสร้างเสียง — การปรับโทน อารมณ์ การเว้นจังหวะ และสไตล์
Rissa Cao ซีอีโอและผู้ร่วมก่อตั้งบอกกับ TechCrunch ว่าลูกค้าองค์กรของบริษัทมีความต้องการที่แตกต่างกันมาก บริษัทต่างๆ เช่น HeyGen ซึ่งใช้เสียง Fish Audio เพื่อขับเคลื่อนอวตารของ AI ให้ความสำคัญกับความสมจริง สตูดิโอเกมต้องการเสียงที่แสดงออกถึงตัวละครของพวกเขา บริษัทตัวแทนเสียงอย่าง LiveKit ต้องการเสียงที่ฟังดูเป็นธรรมชาติและมีความหน่วงต่ำ ซึ่งยังคงแสดงอารมณ์ได้เพียงพอสำหรับการโทรสด
“ทุกองค์กรมีกรณีการใช้งานและความชอบที่แตกต่างกัน” Cao กล่าว ลูกค้ารายอื่นๆ ได้แก่ Sanas บริษัทที่เน้นการแปลสำเนียง และ Plaud ซึ่งผลิตอุปกรณ์บันทึกเสียงที่ขับเคลื่อนด้วย AI Fish Audio เสนอแผนรายเดือนแบบชำระเงินสำหรับผู้สร้างและทีมที่ปลดล็อกจำนวนนาทีในการสร้างพร้อมคุณสมบัติการโคลนเสียง รวมถึง API เวอร์ชันองค์กร
การสร้างคลังเสียงผ่านการมีส่วนร่วมของผู้ใช้
หนึ่งในวิธีที่ Fish Audio ได้ขยายคลังเสียงคือการเชิญชวนให้ผู้ใช้ส่งการบันทึกเสียงของตนเองสำหรับโมเดลการฝึก เพื่อชดเชยเมื่อมีการใช้เสียงของพวกเขา วิธีการระดมทุนจากมวลชนช่วยให้บริษัทสร้างแคตตาล็อกที่หลากหลาย แต่ก็สร้างความท้าทายเช่นกัน
เมื่อไม่กี่เดือนที่ผ่านมา ผู้สร้างบางรายกล่าวหาว่าเสียงของพวกเขาถูกอัปโหลดไปยังแพลตฟอร์มของ Fish Audio โดยไม่ได้รับความยินยอม การเริ่มต้นใช้งานมีกระบวนการลบเนื้อหา DMCA อยู่ แต่กระบวนการนี้ช้า Cao บอกกับ TechCrunch ว่าบริษัทได้ดำเนินการกระบวนการลบออกโดยอัตโนมัติเพื่อแก้ไขข้อกังวลดังกล่าวได้รวดเร็วยิ่งขึ้น
ข้อโต้แย้งดังกล่าวเน้นย้ำถึงความตึงเครียดที่เพิ่มขึ้นในอุตสาหกรรมเสียงของ AI เมื่อเทคโนโลยีเสียงสังเคราะห์พัฒนาขึ้น เส้นแบ่งระหว่างการใช้งานที่ได้รับอนุญาตและไม่ได้รับอนุญาตจะยากขึ้นสำหรับตำรวจ โดยเฉพาะอย่างยิ่งการโคลนเสียงทำให้เกิดความกังวลเกี่ยวกับการแอบอ้างบุคคลอื่นและการฉ้อโกง และหน่วยงานกำกับดูแลในหลายประเทศกำลังเริ่มตรวจสอบกรอบทางกฎหมายที่ควบคุมเสียงที่สร้างโดย AI
ตลาดที่มีการแข่งขันและแออัด
Fish Audio ไม่ได้อยู่คนเดียวในพื้นที่เสียง AI คู่แข่ง ได้แก่ ElevenLabs ซึ่งระดมทุนได้หลายร้อยล้านดอลลาร์ และได้รับการยอมรับอย่างกว้างขวางว่าเป็นผู้นำตลาด รวมถึงข้อเสนอจากบริษัทเทคโนโลยีรายใหญ่ แต่การที่ Fish Audio ให้ความสำคัญกับโมเดลโอเพ่นซอร์สและชุมชนนักพัฒนาขนาดใหญ่ ทำให้ Fish Audio มีจุดยืนที่โดดเด่น
การระดมทุนรอบ Seed Round มูลค่า 50 ล้านดอลลาร์ช่วยให้บริษัทแข่งขันด้านคุณภาพของโมเดล ขยายความพยายามในการขายระดับองค์กร และตอบคำถามทางกฎหมายและจริยธรรมที่มาพร้อมกับเทคโนโลยีการโคลนเสียง ด้วยรายรับต่อปีที่ 21 ล้านดอลลาร์ Fish Audio กำลังสร้างรายได้ที่สำคัญให้กับบริษัทในระยะเริ่มต้น โดยแนะนำว่าความต้องการเสียง AI ที่แสดงออกและควบคุมได้นั้นขยายไปไกลกว่าความแปลกใหม่
ไม่ว่าสตาร์ทอัพจะสามารถรักษาโมเมนตัมโอเพ่นซอร์สไปพร้อมกับการสร้างธุรกิจองค์กรที่ทำกำไรได้หรือไม่นั้นยังคงต้องรอดูกันต่อไป แต่ขนาดของรอบและคุณภาพของนักลงทุนที่เข้าร่วม ส่งสัญญาณว่าตลาดสำหรับเสียงที่สร้างโดย AI ยังอยู่ในช่วงเริ่มต้น และนักลงทุนมองเห็นข้อดีที่สำคัญในบริษัทที่ให้ความสำคัญกับทั้งผู้สร้างอินดี้และองค์กรขนาดใหญ่
ก้าวนำหน้าข่าวสตาร์ทอัพ AI
ติดตาม [การพัฒนา AI] (https://aibuzzwire.news) ล่าสุดในขณะที่ตลาดการสร้างเสียงและตลาด AI อื่น ๆ พัฒนาขึ้น
อ่านข่าว AI เพิ่มเติม →