Fish Audio، یک استارتآپ مبتنی بر پالو آلتو که مدلهای صوتی گویا هوش مصنوعی را میسازد، 50 میلیون دلار در یک دور اولیه جمعآوری کرده است تا پلتفرم خود را برای موارد استفاده خلاق و سازمانی گسترش دهد. بر اساس گزارش TechCrunch، دور تأمین مالی توسط Coreline Ventures و Capital Today، با مشارکت 359 Capital، Parable، Play Time، Alphalist Partners، Bayhouse Ventures، Carya Venture Partners، و HF0 انجام شد.
این راند یکی از منابع مالی بزرگتر در فضای تولید صدای هوش مصنوعی است که نشاندهنده اعتماد سرمایهگذاران به شرکتی است که قبلاً کشش قابل توجهی ایجاد کرده است. Fish Audio اکنون بیش از 8 میلیون نفر را از نسخه های منبع باز یا میزبان مدل های خود استفاده می کند و سالانه 21 میلیون دلار درآمد مکرر ایجاد می کند. رشد سریع این استارتآپ بخشی از موج گستردهتر گسترش [صنعت هوش مصنوعی] (https://aibuzzwire.news) است که همچنان به جذب سرمایههای مخاطرهآمیز قابل توجهی ادامه میدهد.
از پروژه تک GPU تا 8 میلیون کاربر
Fish Audio به عنوان یک پروژه جانبی کوچک توسط Shijia Liao، محقق سابق Nvidia که از صداهای مصنوعی مسطح و غیر گویا در بازار موجود بود، شروع شد. لیائو یک مدل تولید صدا را روی یک GPU آموزش داد و آن را منبع باز کرد. آن پروژه اولیه که به عنوان Fish Speech شناخته می شود، از آن زمان به یک مخزن با بیش از 31000 ستاره در GitHub تبدیل شده است که توسط توسعه دهندگان مستقل، طراحان بازی های ویدیویی و سازندگان محتوا استفاده می شود.
در سال گذشته، این شرکت پنج مدل را روانه بازار کرده است: چهار مدل تولید گفتار و یک مدل گفتار به متن. این سه مدل از مدل های تولید گفتار خود منبع باز است، در حالی که آخرین نسخه آن، S2.1 Pro، تنها از طریق یک API پولی در دسترس است. این استراتژی هسته باز ترکیبی به Fish Audio اجازه میدهد تا در عین کسب درآمد از پیشرفتهترین قابلیتهای خود، جامعه بزرگی از توسعهدهندگان ایجاد کند.
یک مدل صدا برای هر مورد استفاده
آنچه که Fish Audio را متمایز می کند، به گفته این شرکت، وسعت کنترل هایی است که ارائه می دهد. این پلتفرم شامل کتابخانه ای از بیش از 15000 کنترل زبان طبیعی است که به کاربران اجازه می دهد تا نحوه صدای تولید شده را تنظیم کنند - تنظیم لحن، احساسات، سرعت و سبک.
مدیرعامل و یکی از بنیانگذاران ریسا کائو به TechCrunch گفت که مشتریان سازمانی این شرکت نیازهای بسیار متفاوتی دارند. شرکتهایی مانند HeyGen که از صدای Fish Audio برای تقویت آواتارهای هوش مصنوعی استفاده میکنند، واقعگرایی را در اولویت قرار میدهند. استودیوهای بازی خواهان صداهای رسا برای شخصیت های خود هستند. شرکتهای عامل صوتی مانند LiveKit به صداهایی با صدای طبیعی و کم تأخیر نیاز دارند که برای تماسهای تلفنی زنده به اندازه کافی رسا باشند.
کائو گفت: "هر شرکتی موارد استفاده متفاوت و ترجیحات متفاوتی دارد." سایر مشتریان عبارتند از Sanas، یک شرکت متمرکز بر ترجمه لهجه، و Plaud، که دستگاههای ضبط مبتنی بر هوش مصنوعی را تولید میکند. Fish Audio برنامههای ماهانه پولی را برای سازندگان و تیمهایی ارائه میدهد که تعداد مجموعهای از دقیقههای تولید بهعلاوه ویژگیهای شبیهسازی صدا را باز میکنند، و همچنین نسخهای از APIهای سازمانی آن را باز میکنند.
ساخت کتابخانه صوتی از طریق مشارکت کاربران
یکی از راههایی که Fish Audio کتابخانه صداهای خود را گسترش داده است، دعوت از کاربران برای ارسال صدای ضبطشده خود برای مدلهای آموزشی، جبران آنها هنگام استفاده از صدایشان است. این رویکرد جمعسپاری به شرکت کمک کرده است تا کاتالوگ متنوعی بسازد، اما چالشهایی نیز ایجاد کرده است.
چند ماه پیش، برخی سازندگان ادعا کردند که صدای آنها بدون رضایت آنها در پلتفرم Fish Audio آپلود شده است. این استارتآپ یک فرآیند حذف محتوای DMCA داشت، اما این روند کند بود. کائو به TechCrunch گفت که این شرکت از آن زمان فرآیند حذف را برای رسیدگی سریعتر به چنین نگرانیهایی خودکار کرده است.
این جنجال بر تنش فزاینده در صنعت صدای هوش مصنوعی تاکید می کند. با بهبود فناوری صدای مصنوعی، مرز بین استفاده مجاز و غیرمجاز برای پلیس سخت تر می شود. شبیه سازی صدا، به ویژه، نگرانی هایی را در مورد جعل هویت و تقلب ایجاد کرده است، و تنظیم کننده ها در چندین کشور شروع به بررسی چارچوب های قانونی حاکم بر صدای تولید شده توسط هوش مصنوعی کرده اند.
بازار رقابتی و شلوغ
Fish Audio در فضای صوتی هوش مصنوعی به دور از تنهایی است. رقبا عبارتند از ElevenLabs که صدها میلیون دلار جمع آوری کرده است و به طور گسترده به عنوان رهبر بازار شناخته می شود، و همچنین پیشنهادات شرکت های فناوری بزرگ. اما تأکید Fish Audio بر مدلهای منبع باز و جامعه بزرگ توسعهدهندگان آن، موقعیتی متمایز به آن میدهد.
دور اولیه 50 میلیون دلاری به شرکت این امکان را می دهد تا بر سر کیفیت مدل رقابت کند، تلاش های فروش سازمانی خود را گسترش دهد و سؤالات قانونی و اخلاقی مربوط به فناوری شبیه سازی صدا را بررسی کند. با 21 میلیون دلار درآمد مکرر سالانه، Fish Audio درآمد قابل توجهی برای یک شرکت مرحله اولیه ایجاد می کند، که نشان می دهد تقاضا برای صداهای AI قابل کنترل و رسا فراتر از تازگی است.
اینکه آیا استارتاپ میتواند حرکت منبع باز خود را در حین ایجاد یک کسبوکار سازمانی سودآور حفظ کند، باید دید. اما اندازه دور، و کیفیت سرمایهگذاران شرکتکننده، نشان میدهد که بازار صدای تولید شده با هوش مصنوعی هنوز در مراحل اولیه خود است – و سرمایهگذاران در شرکتی که هم به سازندگان مستقل و هم برای شرکتهای بزرگ پاسخ میدهد، پیشرفت قابلتوجهی میبینند.
از اخبار راه اندازی هوش مصنوعی جلوتر باشید
آخرین [توسعههای هوش مصنوعی] (https://aibuzzwire.news) را با تکامل تولید صدا و سایر بازارهای هوش مصنوعی مولد دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →