Meta mbukak model AI audio anyar ing dina Senin sing bisa mbedakake antarane macem-macem penutur lan nerjemahake pirang-pirang basa ing wektu nyata, miturut Engadget, minangka langkah sing nyurung perusahaan luwih jero menyang pasar sing tambah akeh kanggo pidato AI. Informasi pisanan nglaporake woro-woro model audio, dene produk pendamping - Muse Voice Transcribe, nggawa dikte swara nyata-wektu menyang Mac - dirinci dening 9to5Mac.
Kembar kasebut ngeculake sinyal yen Meta nganggep swara minangka input kelas siji kanggo tumpukan AI, dudu sawise dipikirake. Transkripsi nyata-wektu sing bisa nangani penutur sing tumpang tindih, ganti basa ing tengah-tengah obrolan, lan dikte ing saindenging sistem minangka kemampuan sing ngowahi swara saka fitur anyar dadi antarmuka saben dina. For more context on this story, see our ongoing AI trends.
Model siji, akeh swara, akeh basa
Kapabilitas judhul, kaya sing dilaporake Engadget, yaiku kemampuan model kanggo mbedakake macem-macem penutur lan pirang-pirang basa ing wektu nyata. Kombinasi kasebut ngatasi rong masalah sing paling angel ing transkripsi praktis kanthi bebarengan: diarisasi speaker - ngerteni sapa sing ngomong apa - lan pangenalan multibasa, ing ngendi obrolan mabur ing antarane basa tanpa ngaso.
Umume saluran pipa transkripsi sing ana nganggep iki minangka tahap sing kapisah: pisanan model diarisasi pamisah speaker, banjur model pangenalan transkripsi saben segmen. Nggabungake dadi model wektu nyata siji yaiku sing ndadekake teknologi bisa digunakake kanggo kasus panggunaan langsung - rapat, wawancara, telpon pelanggan, overlay terjemahan langsung - ing ngendi nunggu pasca-proses ora bisa ditindakake.
Muse Voice Transcribe nggawa ndhikte menyang saben aplikasi Mac
Saliyane model kasebut, Meta ngluncurake Muse Voice Transcribe kanggo macOS. Kaya sing dilaporake 9to5Mac, alat kasebut nyedhiyakake dikte swara wektu nyata sing bisa digunakake ing aplikasi Mac - kanthi efektif lapisan dikte ing sistem tinimbang aplikasi mandiri. Jangkoan Gadget Review diterangake minangka nggawa ndhikte wektu nyata kanggo saben app Mac.
Desain kasebut penting kanggo diadopsi. Piranti dikte urip utawa mati amarga gesekan: yen pangguna kudu nyalin teks metu saka jendela sing kapisah, dheweke bakal mandheg nggunakake. Makarya ing tingkat sistem tegese input swara kasedhiya ing ngendi wae kursor kedhip - email, editor kode, aplikasi olahpesen, dokumen - sing persis carane alat dikte sing paling sukses wis menangake pamirsa.
Rilis Mac uga menehi tandha wilayah penting kanggo Meta. Upaya AI perusahaan wis fokus ing aplikasi seluler, asisten Meta AI, lan model kulawarga Llama lan Muse. Ngirim alat produktivitas desktop sing dipoles kanggo platform Apple ndadekake Meta kontak langsung karo basis pangguna profesional sing wis angel digayuh kanthi historis - lan ndadekake saingan karo ndhikte lan transkripsi sing wis mapan ing platform kasebut.
Lapangan rame sing terus saya cepet
Meta mlebu pasar sing wis diregani maneh lan direkayasa maneh sajrone rong taun kepungkur. Model open-source OpenAI's Whisper nyetel garis dasar kanggo transkripsi multibasa sing bisa diakses, lan GPT Transcribe API sing dibayar perusahaan nyuda akeh rega pasar komersial. Google, sauntara, wis di-push hard ing arah sing padha: model transkripsi Gemini-powered nutupi Welasan basa ing wektu nyata wis mbalek metu kanggo pangembang, minangka kita nutupi nalika Google dikirim sawijining 85-basa model transkripsi wicara nyata-wektu.
Ing latar mburi kasebut, diferensiasi wis owah saka akurasi mentah - ing ngendi para pamimpin diklumpukake kanthi swara siji-sijine ing pathokan standar - menyang rincian praktis: latensi, penanganan speaker, ngalih kode ing antarane basa, rega, lan ing ngendi model kasebut mlaku. Penekanan Meta ing pangenalan multi-speaker lan multibasa simultan kanthi target wektu nyata persis rincian praktis kasebut.
Suara kok mendadak strategis
Wektu ora sengaja. Voice dadi antarmuka standar kanggo agen AI, lan perusahaan sing duwe lapisan audio - panangkepan, transkripsi, pangerten, respon - ngontrol titik entri paling alami menyang pengalaman asisten. Meta wis umum babagan ambisi kanggo kacamata AI lan piranti sing bisa dipakai, ing ngendi swara mung minangka input praktis. Model audio sing cepet, akurat lan on-the-go minangka infrastruktur kanggo peta dalan kasebut.
Ana uga sudut perusahaan. Rapat, telpon dhukungan, lan kerja lapangan ngasilake volume audio multi-speaker sing dikarepake organisasi bisa ditelusuri lan bisa ditindakake. Model sing nerjemahake kanthi andal nalika obrolan kedadeyan - kanthi label speaker lan basa sing ditangani tanpa konfigurasi manual - yaiku prabédan antarane demo lan produk.
Transkripsi wektu nyata uga entuk manfaat ngluwihi penak. Katrangan langsung nggawe rapat, ruang kelas, lan siaran bisa diakses dening pangguna sing budheg lan angel ngrungokake, lan katrangan multibasa cepet ngedhunake alangan basa kanggo tim internasional. Nalika transkripsi cukup cepet kanggo ngimbangi wicara alami lan cukup kuat kanggo nglacak macem-macem pamicara sekaligus, fitur aksesibilitas kasebut mandheg dadi akomodasi khusus lan dadi standar sing dibangun ing piranti saben dina.
Meta durung ngumumake rega utawa rincian kasedhiyan lengkap ing jangkoan awal. Nanging arah kasebut ora jelas: lapisan audio tumpukan AI, sing wis suwe dianggep minangka komoditas, saiki dadi ngarep ing perang platform - lan Meta wis mutusake kanggo nglawan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
