Fish Audio، یک استارت‌آپ مبتنی بر پالو آلتو که مدل‌های صوتی گویا هوش مصنوعی را می‌سازد، 50 میلیون دلار در یک دور اولیه جمع‌آوری کرده است تا پلتفرم خود را برای موارد استفاده خلاق و سازمانی گسترش دهد. بر اساس گزارش TechCrunch، دور تأمین مالی توسط Coreline Ventures و Capital Today، با مشارکت 359 Capital، Parable، Play Time، Alphalist Partners، Bayhouse Ventures، Carya Venture Partners، و HF0 انجام شد.

این راند یکی از منابع مالی بزرگ‌تر در فضای تولید صدای هوش مصنوعی است که نشان‌دهنده اعتماد سرمایه‌گذاران به شرکتی است که قبلاً کشش قابل توجهی ایجاد کرده است. Fish Audio اکنون بیش از 8 میلیون نفر را از نسخه های منبع باز یا میزبان مدل های خود استفاده می کند و سالانه 21 میلیون دلار درآمد مکرر ایجاد می کند. رشد سریع این استارت‌آپ بخشی از موج گسترده‌تر گسترش [صنعت هوش مصنوعی] (https://aibuzzwire.news) است که همچنان به جذب سرمایه‌های مخاطره‌آمیز قابل توجهی ادامه می‌دهد.

از پروژه تک GPU تا 8 میلیون کاربر

Fish Audio به عنوان یک پروژه جانبی کوچک توسط Shijia Liao، محقق سابق Nvidia که از صداهای مصنوعی مسطح و غیر گویا در بازار موجود بود، شروع شد. لیائو یک مدل تولید صدا را روی یک GPU آموزش داد و آن را منبع باز کرد. آن پروژه اولیه که به عنوان Fish Speech شناخته می شود، از آن زمان به یک مخزن با بیش از 31000 ستاره در GitHub تبدیل شده است که توسط توسعه دهندگان مستقل، طراحان بازی های ویدیویی و سازندگان محتوا استفاده می شود.

در سال گذشته، این شرکت پنج مدل را روانه بازار کرده است: چهار مدل تولید گفتار و یک مدل گفتار به متن. این سه مدل از مدل های تولید گفتار خود منبع باز است، در حالی که آخرین نسخه آن، S2.1 Pro، تنها از طریق یک API پولی در دسترس است. این استراتژی هسته باز ترکیبی به Fish Audio اجازه می‌دهد تا در عین کسب درآمد از پیشرفته‌ترین قابلیت‌های خود، جامعه بزرگی از توسعه‌دهندگان ایجاد کند.

یک مدل صدا برای هر مورد استفاده

آنچه که Fish Audio را متمایز می کند، به گفته این شرکت، وسعت کنترل هایی است که ارائه می دهد. این پلتفرم شامل کتابخانه ای از بیش از 15000 کنترل زبان طبیعی است که به کاربران اجازه می دهد تا نحوه صدای تولید شده را تنظیم کنند - تنظیم لحن، احساسات، سرعت و سبک.

مدیرعامل و یکی از بنیانگذاران ریسا کائو به TechCrunch گفت که مشتریان سازمانی این شرکت نیازهای بسیار متفاوتی دارند. شرکت‌هایی مانند HeyGen که از صدای Fish Audio برای تقویت آواتارهای هوش مصنوعی استفاده می‌کنند، واقع‌گرایی را در اولویت قرار می‌دهند. استودیوهای بازی خواهان صداهای رسا برای شخصیت های خود هستند. شرکت‌های عامل صوتی مانند LiveKit به صداهایی با صدای طبیعی و کم تأخیر نیاز دارند که برای تماس‌های تلفنی زنده به اندازه کافی رسا باشند.

کائو گفت: "هر شرکتی موارد استفاده متفاوت و ترجیحات متفاوتی دارد." سایر مشتریان عبارتند از Sanas، یک شرکت متمرکز بر ترجمه لهجه، و Plaud، که دستگاه‌های ضبط مبتنی بر هوش مصنوعی را تولید می‌کند. Fish Audio برنامه‌های ماهانه پولی را برای سازندگان و تیم‌هایی ارائه می‌دهد که تعداد مجموعه‌ای از دقیقه‌های تولید به‌علاوه ویژگی‌های شبیه‌سازی صدا را باز می‌کنند، و همچنین نسخه‌ای از APIهای سازمانی آن را باز می‌کنند.

ساخت کتابخانه صوتی از طریق مشارکت کاربران

یکی از راه‌هایی که Fish Audio کتابخانه صداهای خود را گسترش داده است، دعوت از کاربران برای ارسال صدای ضبط‌شده خود برای مدل‌های آموزشی، جبران آن‌ها هنگام استفاده از صدایشان است. این رویکرد جمع‌سپاری به شرکت کمک کرده است تا کاتالوگ متنوعی بسازد، اما چالش‌هایی نیز ایجاد کرده است.

چند ماه پیش، برخی سازندگان ادعا کردند که صدای آنها بدون رضایت آنها در پلتفرم Fish Audio آپلود شده است. این استارت‌آپ یک فرآیند حذف محتوای DMCA داشت، اما این روند کند بود. کائو به TechCrunch گفت که این شرکت از آن زمان فرآیند حذف را برای رسیدگی سریع‌تر به چنین نگرانی‌هایی خودکار کرده است.

این جنجال بر تنش فزاینده در صنعت صدای هوش مصنوعی تاکید می کند. با بهبود فناوری صدای مصنوعی، مرز بین استفاده مجاز و غیرمجاز برای پلیس سخت تر می شود. شبیه سازی صدا، به ویژه، نگرانی هایی را در مورد جعل هویت و تقلب ایجاد کرده است، و تنظیم کننده ها در چندین کشور شروع به بررسی چارچوب های قانونی حاکم بر صدای تولید شده توسط هوش مصنوعی کرده اند.

بازار رقابتی و شلوغ

Fish Audio در فضای صوتی هوش مصنوعی به دور از تنهایی است. رقبا عبارتند از ElevenLabs که صدها میلیون دلار جمع آوری کرده است و به طور گسترده به عنوان رهبر بازار شناخته می شود، و همچنین پیشنهادات شرکت های فناوری بزرگ. اما تأکید Fish Audio بر مدل‌های منبع باز و جامعه بزرگ توسعه‌دهندگان آن، موقعیتی متمایز به آن می‌دهد.

دور اولیه 50 میلیون دلاری به شرکت این امکان را می دهد تا بر سر کیفیت مدل رقابت کند، تلاش های فروش سازمانی خود را گسترش دهد و سؤالات قانونی و اخلاقی مربوط به فناوری شبیه سازی صدا را بررسی کند. با 21 میلیون دلار درآمد مکرر سالانه، Fish Audio درآمد قابل توجهی برای یک شرکت مرحله اولیه ایجاد می کند، که نشان می دهد تقاضا برای صداهای AI قابل کنترل و رسا فراتر از تازگی است.

اینکه آیا استارتاپ می‌تواند حرکت منبع باز خود را در حین ایجاد یک کسب‌وکار سازمانی سودآور حفظ کند، باید دید. اما اندازه دور، و کیفیت سرمایه‌گذاران شرکت‌کننده، نشان می‌دهد که بازار صدای تولید شده با هوش مصنوعی هنوز در مراحل اولیه خود است – و سرمایه‌گذاران در شرکتی که هم به سازندگان مستقل و هم برای شرکت‌های بزرگ پاسخ می‌دهد، پیشرفت قابل‌توجهی می‌بینند.

از اخبار راه اندازی هوش مصنوعی جلوتر باشید

آخرین [توسعه‌های هوش مصنوعی] (https://aibuzzwire.news) را با تکامل تولید صدا و سایر بازارهای هوش مصنوعی مولد دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →