Η Fish Audio, μια startup με βάση το Palo Alto που κατασκευάζει εκφραστικά μοντέλα φωνής AI, συγκέντρωσε 50 εκατομμύρια δολάρια σε πρώτο γύρο για να επεκτείνει την πλατφόρμα της τόσο για περιπτώσεις δημιουργικής όσο και για επιχειρηματική χρήση. Ο γύρος χρηματοδότησης ηγήθηκε από την Coreline Ventures και την Capital Today, με συμμετοχή από 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners και HF0, σύμφωνα με αναφορές του TechCrunch.
Ο γύρος είναι μία από τις μεγαλύτερες χρηματοδοτήσεις εκκίνησης στον χώρο παραγωγής φωνής AI, αντικατοπτρίζοντας την εμπιστοσύνη των επενδυτών σε μια εταιρεία που έχει ήδη δημιουργήσει σημαντική έλξη. Η Fish Audio αριθμεί πλέον περισσότερους από 8 εκατομμύρια ανθρώπους που χρησιμοποιούν είτε τις εκδόσεις ανοιχτού κώδικα είτε τις φιλοξενούμενες εκδόσεις των μοντέλων της και παράγει 21 εκατομμύρια δολάρια σε ετήσια επαναλαμβανόμενα έσοδα. Η ταχεία ανάπτυξη της startup αποτελεί μέρος ενός ευρύτερου κύματος επέκτασης της [βιομηχανίας AI] (https://aibuzzwire.news) που συνεχίζει να προσελκύει σημαντικά επιχειρηματικά κεφάλαια.
Από έργο Single-GPU σε 8 εκατομμύρια χρήστες
Το Fish Audio ξεκίνησε ως ένα μικρό δευτερεύον έργο από τον Shijia Liao, έναν πρώην ερευνητή της Nvidia που απογοητεύτηκε από τις επίπεδες, μη εκφραστικές συνθετικές φωνές που τότε ήταν διαθέσιμες στην αγορά. Ο Liao εκπαίδευσε ένα μοντέλο δημιουργίας φωνής σε μια ενιαία GPU και το παρήγαγε ανοιχτού κώδικα. Αυτό το πρώιμο έργο, γνωστό ως Fish Speech, έχει από τότε εξελιχθεί σε ένα αποθετήριο με περισσότερα από 31.000 αστέρια στο GitHub, το οποίο χρησιμοποιείται από ανεξάρτητους προγραμματιστές, σχεδιαστές βιντεοπαιχνιδιών και δημιουργούς περιεχομένου.
Τον περασμένο χρόνο, η εταιρεία κυκλοφόρησε πέντε μοντέλα: τέσσερα μοντέλα παραγωγής ομιλίας και ένα μοντέλο ομιλίας σε κείμενο. Διαθέτει τρία από τα μοντέλα παραγωγής ομιλίας ανοιχτού κώδικα, ενώ η τελευταία του έκδοση, το S2.1 Pro, είναι διαθέσιμη μόνο μέσω API επί πληρωμή. Αυτή η υβριδική στρατηγική ανοιχτού πυρήνα επέτρεψε στο Fish Audio να δημιουργήσει μια μεγάλη κοινότητα προγραμματιστών, ενώ παράλληλα αξιοποιεί έσοδα από τις πιο προηγμένες δυνατότητές του.
Ένα μοντέλο φωνής για κάθε περίπτωση χρήσης
Αυτό που ξεχωρίζει το Fish Audio, σύμφωνα με την εταιρεία, είναι το εύρος των χειριστηρίων που προσφέρει. Η πλατφόρμα περιλαμβάνει μια βιβλιοθήκη με περισσότερα από 15.000 χειριστήρια φυσικής γλώσσας που επιτρέπουν στους χρήστες να ρυθμίζουν με ακρίβεια τον τρόπο που ακούγονται οι φωνές που δημιουργούνται — προσαρμόζοντας τον τόνο, το συναίσθημα, τον ρυθμό και το στυλ.
Η Διευθύνουσα Σύμβουλος και συνιδρυτής Rissa Cao είπε στο TechCrunch ότι οι εταιρικοί πελάτες της εταιρείας καλύπτουν πολύ διαφορετικές ανάγκες. Εταιρείες όπως η HeyGen, που χρησιμοποιεί φωνές Fish Audio για να τροφοδοτήσει τα avatar της τεχνητής νοημοσύνης, δίνουν προτεραιότητα στον ρεαλισμό. Τα στούντιο παιχνιδιών θέλουν εκφραστικές φωνές για τους χαρακτήρες τους. Οι εταιρείες φωνητικών πρακτόρων όπως το LiveKit χρειάζονται φωνές με φυσικό ήχο, χαμηλής καθυστέρησης που να παραμένουν αρκετά εκφραστικές για ζωντανές τηλεφωνικές κλήσεις.
«Κάθε επιχείρηση έχει διαφορετικές περιπτώσεις χρήσης και διαφορετικές προτιμήσεις», είπε ο Cao. Άλλοι πελάτες περιλαμβάνουν τη Sanas, μια εταιρεία που επικεντρώνεται στη μετάφραση προφοράς, και την Plaud, η οποία κατασκευάζει συσκευές εγγραφής με τεχνητή νοημοσύνη. Το Fish Audio προσφέρει μηνιαία προγράμματα επί πληρωμή για δημιουργούς και ομάδες που ξεκλειδώνουν έναν καθορισμένο αριθμό λεπτών παραγωγής συν λειτουργίες κλωνοποίησης φωνής, καθώς και μια εταιρική έκδοση των API του.
Δημιουργία φωνητικής βιβλιοθήκης μέσω συνεισφορών χρηστών
Ένας από τους τρόπους με τους οποίους η Fish Audio έχει επεκτείνει τη βιβλιοθήκη φωνών της είναι προσκαλώντας τους χρήστες να υποβάλουν τις δικές τους ηχογραφήσεις φωνής για μοντέλα εκπαίδευσης, αποζημιώνοντάς τους όταν χρησιμοποιούνται οι φωνές τους. Αυτή η προσέγγιση crowdsourced βοήθησε την εταιρεία να δημιουργήσει έναν ποικίλο κατάλογο, αλλά δημιούργησε επίσης προκλήσεις.
Πριν από λίγους μήνες, ορισμένοι δημιουργοί ισχυρίστηκαν ότι οι φωνές τους είχαν ανέβει στην πλατφόρμα του Fish Audio χωρίς τη συγκατάθεσή τους. Η εκκίνηση είχε μια διαδικασία κατάργησης περιεχομένου DMCA, αλλά η διαδικασία ήταν αργή. Ο Cao είπε στο TechCrunch ότι έκτοτε η εταιρεία έχει αυτοματοποιήσει τη διαδικασία κατάργησης για να αντιμετωπίσει αυτές τις ανησυχίες πιο γρήγορα.
Η διαμάχη υπογραμμίζει μια αυξανόμενη ένταση στη βιομηχανία φωνής AI. Καθώς η τεχνολογία συνθετικής φωνής βελτιώνεται, η γραμμή μεταξύ της εξουσιοδοτημένης και της μη εξουσιοδοτημένης χρήσης γίνεται πιο δύσκολη για την αστυνόμευση. Η κλωνοποίηση φωνής, ειδικότερα, έχει εγείρει ανησυχίες σχετικά με την πλαστοπροσωπία και την απάτη, και οι ρυθμιστικές αρχές σε αρκετές χώρες αρχίζουν να εξετάζουν τα νομικά πλαίσια που διέπουν τον ήχο που δημιουργείται από την τεχνητή νοημοσύνη.
Μια ανταγωνιστική και πολυσύχναστη αγορά
Το Fish Audio δεν απέχει πολύ από το να είναι μόνο του στον φωνητικό χώρο AI. Οι ανταγωνιστές περιλαμβάνουν την ElevenLabs, η οποία έχει συγκεντρώσει εκατοντάδες εκατομμύρια δολάρια και θεωρείται ευρέως ως ηγέτης της αγοράς, καθώς και προσφορές από μεγάλες εταιρείες τεχνολογίας. Αλλά η έμφαση που δίνει η Fish Audio στα μοντέλα ανοιχτού κώδικα και η μεγάλη κοινότητα προγραμματιστών της δίνουν μια ξεχωριστή θέση.
Ο γύρος εκκίνησης 50 εκατομμυρίων δολαρίων δίνει στην εταιρεία τον διάδρομο να ανταγωνιστεί στην ποιότητα των μοντέλων, να επεκτείνει τις επιχειρηματικές της προσπάθειες πωλήσεων και να πλοηγηθεί στα νομικά και ηθικά ερωτήματα που έρχονται με την τεχνολογία κλωνοποίησης φωνής. Με ετήσια επαναλαμβανόμενα έσοδα 21 εκατομμυρίων δολαρίων ήδη, η Fish Audio παράγει σημαντικά έσοδα για μια εταιρεία που βρίσκεται στο στάδιο της παραγωγής, υποδηλώνοντας ότι η ζήτηση για εκφραστικές, ελεγχόμενες φωνές τεχνητής νοημοσύνης εκτείνεται πολύ πέρα από την καινοτομία.
Το αν η startup μπορεί να διατηρήσει τη δυναμική ανοιχτού κώδικα ενώ δημιουργεί μια κερδοφόρα επιχειρηματική επιχείρηση μένει να φανεί. Αλλά το μέγεθος του γύρου και η ποιότητα των επενδυτών που συμμετέχουν, σηματοδοτούν ότι η αγορά φωνής που δημιουργείται από AI βρίσκεται ακόμα στα πρώτα της βήματα — και ότι οι επενδυτές βλέπουν ουσιαστικά θετικά αποτελέσματα σε μια εταιρεία που απευθύνεται τόσο σε indie δημιουργούς όσο και σε μεγάλες επιχειρήσεις.
Μείνετε μπροστά από τις ειδήσεις εκκίνησης AI
Ακολουθήστε τις τελευταίες εξελίξεις AI καθώς εξελίσσονται η παραγωγή φωνής και άλλες παραγωγικές αγορές τεχνητής νοημοσύνης.
Διαβάστε περισσότερα νέα AI →