Meta melancarkan model AI audio baharu pada hari Isnin yang boleh membezakan antara berbilang pembesar suara dan menyalin berbilang bahasa dalam masa nyata, menurut Engadget, dalam satu langkah yang mendorong syarikat itu lebih mendalam ke dalam pasaran AI pertuturan yang semakin sesak. Maklumat pertama kali melaporkan pengumuman model audio, manakala produk pendamping — Muse Voice Transcribe, membawa imlak suara masa nyata kepada Mac — diperincikan oleh 9to5Mac.

Kembar itu mengeluarkan isyarat bahawa Meta menganggap suara sebagai input kelas pertama untuk timbunan AInya, bukan renungan. Transkripsi masa nyata yang boleh mengendalikan pembesar suara yang bertindih, pertukaran bahasa pada pertengahan perbualan dan imlak seluruh sistem ialah keupayaan yang menukar suara daripada ciri baharu kepada antara muka penggunaan harian. For more context on this story, see our ongoing AI industry coverage.

Satu model, banyak suara, banyak bahasa

Keupayaan tajuk, seperti yang dilaporkan Engadget, ialah keupayaan model untuk membezakan antara berbilang pembesar suara dan berbilang bahasa dalam masa nyata. Gabungan itu menangani dua masalah paling sukar dalam transkripsi praktikal secara serentak: diarisasi pembesar suara — memikirkan siapa yang berkata apa — dan pengecaman berbilang bahasa, di mana perbualan melayang antara bahasa tanpa jeda.

Kebanyakan saluran paip transkripsi sedia ada menganggap ini sebagai peringkat berasingan: pertama model diarisasi membahagi pembesar suara, kemudian model pengecaman menyalin setiap segmen. Menyatukan mereka ke dalam model masa nyata tunggal adalah perkara yang menjadikan teknologi itu berdaya maju untuk kes penggunaan langsung — mesyuarat, temu bual, panggilan pelanggan, tindanan terjemahan langsung — di mana menunggu pasca pemprosesan tidak dapat menyelesaikannya.

Transkripsi Suara Muse membawa imlak kepada setiap apl Mac

Di samping model, Meta melancarkan Muse Voice Transcribe untuk macOS. Seperti yang dilaporkan 9to5Mac, alat ini menyediakan imlak suara masa nyata yang berfungsi merentas aplikasi Mac — secara berkesan lapisan imlak seluruh sistem dan bukannya apl kendiri. Liputan Gadget Review menggambarkannya sebagai membawa imlak masa nyata kepada setiap apl Mac.

Reka bentuk itu penting untuk diterima pakai. Alat imlak hidup atau mati semasa geseran: jika pengguna perlu menyalin teks daripada tetingkap berasingan, mereka berhenti menggunakannya. Bekerja di peringkat sistem bermakna input suara tersedia di mana-mana sahaja kursor berkelip — e-mel, penyunting kod, apl pemesejan, dokumen — betul-betul cara alat imlak yang paling berjaya memenangi khalayak mereka.

Keluaran Mac juga menandakan wilayah yang ketara untuk Meta. Usaha AI syarikat telah tertumpu pada aplikasi mudah alihnya, pembantu Meta AInya, dan model keluarga Llama dan keluarga Musenya. Menghantar alat produktiviti desktop yang digilap untuk platform Apple meletakkan Meta berhubung secara langsung dengan pangkalan pengguna profesional yang secara sejarah sukar dicapai — dan meletakkannya dalam persaingan dengan utiliti imlak dan transkripsi yang mantap pada platform.

Padang sesak yang semakin laju

Meta memasuki pasaran yang telah dinilai semula dan direkayasa semula sejak dua tahun lalu. Model sumber terbuka Whisper OpenAI menetapkan garis dasar untuk transkripsi berbilang bahasa yang boleh diakses, dan API Transkripsi GPT berbayar syarikat mengurangkan sebahagian besar pasaran komersial pada harga. Sementara itu, Google telah berusaha keras ke arah yang sama: Model transkripsi berkuasa Gemini yang meliputi berpuluh-puluh bahasa dalam masa nyata telah dilancarkan kepada pembangun, seperti yang kami bincangkan apabila Google menghantar model transkripsi pertuturan masa nyata 85 bahasanya.

Berdasarkan latar belakang itu, pembezaan telah beralih daripada ketepatan mentah — di mana pemimpin dikelompokkan dalam kebisingan antara satu sama lain pada penanda aras standard — kepada butiran praktikal: kependaman, pengendalian pembesar suara, penukaran kod antara bahasa, harga dan tempat model dijalankan. Penekanan Meta pada pengecaman berbilang pembesar suara dan berbilang bahasa serentak dalam masa nyata menyasarkan dengan tepat butiran praktikal tersebut.

Mengapa suara tiba-tiba strategik

Masanya bukan kebetulan. Suara menjadi antara muka lalai untuk ejen AI, dan syarikat yang memiliki lapisan audio — tangkapan, transkripsi, pemahaman, tindak balas — mengawal titik masuk paling semula jadi kepada pengalaman pembantu. Meta telah mendedahkan tentang cita-citanya untuk cermin mata AI dan peranti boleh pakai, di mana suara pada asasnya adalah satu-satunya input praktikal. Model audio yang pantas, tepat, semasa dalam perjalanan ialah infrastruktur untuk peta jalan itu.

Terdapat juga sudut perusahaan. Mesyuarat, panggilan sokongan dan kerja lapangan menjana volum besar audio berbilang pembesar suara yang organisasi inginkan boleh dicari dan boleh diambil tindakan. Model yang menyalin dengan pasti semasa perbualan berlaku — dengan pembesar suara berlabel dan bahasa dikendalikan tanpa konfigurasi manual — ialah perbezaan antara demo dan produk.

Transkripsi masa nyata membawa manfaat di luar kemudahan juga. Kapsyen langsung menjadikan mesyuarat, bilik darjah dan siaran boleh diakses oleh pengguna pekak dan kurang pendengaran, dan kapsyen berbilang bahasa segera mengurangkan halangan bahasa untuk pasukan antarabangsa. Apabila transkripsi cukup pantas untuk bersaing dengan pertuturan semula jadi dan cukup teguh untuk menjejak berbilang pembesar suara serentak, ciri kebolehaksesan tersebut berhenti menjadi penginapan istimewa dan menjadi lalai terbina dalam alatan harian.

Meta belum mengumumkan harga atau butiran ketersediaan penuh dalam liputan awal. Tetapi arahnya tidak dapat disangkal: lapisan audio timbunan AI, yang telah lama dianggap sebagai komoditi, kini menjadi barisan hadapan dalam perang platform — dan Meta telah memutuskan untuk melawannya.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →