Meta เปิดตัวโมเดล AI เสียงใหม่ในวันจันทร์ ซึ่งสามารถแยกแยะระหว่างผู้พูดหลายคนและถอดเสียงหลายภาษาแบบเรียลไทม์ ตามข้อมูลของ Engadget ซึ่งเป็นการเคลื่อนไหวที่ผลักดันบริษัทให้ลึกเข้าไปในตลาด AI คำพูดที่มีผู้คนหนาแน่นมากขึ้น ข้อมูลจะรายงานการประกาศเกี่ยวกับโมเดลเสียงเป็นครั้งแรก ในขณะที่ผลิตภัณฑ์คู่หูอย่าง Muse Voice Transcribe ซึ่งนำการเขียนตามคำบอกด้วยเสียงแบบเรียลไทม์มาสู่ Mac ได้รับรายละเอียดโดย 9to5Mac

แฝดปล่อยสัญญาณว่า Meta ถือว่าเสียงเป็นอินพุตชั้นหนึ่งสำหรับสแต็ก AI ไม่ใช่ความคิดในภายหลัง การถอดเสียงแบบเรียลไทม์ที่สามารถรองรับผู้พูดที่ทับซ้อนกัน การสลับภาษาระหว่างการสนทนา และการเขียนตามคำบอกทั่วทั้งระบบคือความสามารถที่เปลี่ยนเสียงจากฟีเจอร์แปลกใหม่ให้กลายเป็นอินเทอร์เฟซที่ใช้งานทุกวัน For more context on this story, see our ongoing more AI stories.

รุ่นเดียว หลายเสียง หลายภาษา

ความสามารถพาดหัวตามรายงานของ Engadget คือความสามารถของโมเดลในการแยกแยะระหว่างผู้พูดหลายคนและหลายภาษาในแบบเรียลไทม์ การรวมกันดังกล่าวช่วยแก้ปัญหาที่ยากที่สุดสองประการในการถอดความในทางปฏิบัติไปพร้อมๆ กัน ได้แก่ การแยกเสียงของผู้พูด การหาว่าใครพูดอะไร และการรู้จำหลายภาษา โดยที่การสนทนาจะลอยไปมาระหว่างภาษาต่างๆ โดยไม่หยุด

ไปป์ไลน์การถอดเสียงที่มีอยู่ส่วนใหญ่ถือว่าสิ่งเหล่านี้เป็นขั้นตอนที่แยกจากกัน ขั้นแรกโมเดลการแยกเสียงจะแยกผู้พูด จากนั้นโมเดลการจดจำจะถอดเสียงแต่ละส่วน การหลอมรวมสิ่งเหล่านี้ให้เป็นโมเดลเรียลไทม์เดียวคือสิ่งที่ทำให้เทคโนโลยีนี้ใช้งานได้จริงสำหรับกรณีการใช้งานจริง เช่น การประชุม การสัมภาษณ์ การโทรศัพท์กับลูกค้า การซ้อนทับการแปลสด ซึ่งการรอหลังการประมวลผลจะเอาชนะวัตถุประสงค์ได้

Muse Voice Transcribe นำการเขียนตามคำบอกมาสู่ทุกแอป Mac

นอกจากโมเดลดังกล่าวแล้ว Meta ยังได้เปิดตัว Muse Voice Transcribe สำหรับ macOS ตามที่ 9to5Mac รายงาน เครื่องมือนี้ให้การเขียนตามคำบอกด้วยเสียงแบบเรียลไทม์ซึ่งใช้ได้กับแอปพลิเคชัน Mac — เป็นเลเยอร์การเขียนตามคำบอกทั่วทั้งระบบแทนที่จะเป็นแอปแบบสแตนด์อโลน ความครอบคลุมของ Gadget Review อธิบายว่าเป็นการนำการป้อนตามคำบอกแบบเรียลไทม์มาสู่แอพ Mac ทุกตัว

การออกแบบนั้นสำคัญสำหรับการนำไปใช้ เครื่องมือเขียนตามคำบอกอยู่หรือตายได้ด้วยการเสียดสี: หากผู้ใช้ต้องคัดลอกข้อความออกจากหน้าต่างที่แยกจากกัน ผู้ใช้จะหยุดใช้งาน การทำงานในระดับระบบหมายถึงการป้อนข้อมูลด้วยเสียงจะสามารถใช้งานได้ทุกที่ที่เคอร์เซอร์กะพริบ เช่น อีเมล โปรแกรมแก้ไขโค้ด แอพส่งข้อความ เอกสาร ซึ่งเป็นวิธีที่เครื่องมือเขียนตามคำบอกที่ประสบความสำเร็จสูงสุดสามารถเอาชนะใจผู้ฟังได้

การเปิดตัว Mac ยังถือเป็นอาณาเขตที่โดดเด่นสำหรับ Meta ความพยายามด้าน AI ของบริษัทมุ่งเน้นไปที่แอปบนอุปกรณ์เคลื่อนที่, ผู้ช่วย Meta AI และโมเดลตระกูล Llama และตระกูล Muse การจัดส่งเครื่องมือเพิ่มประสิทธิภาพการทำงานบนเดสก์ท็อปที่สวยงามสำหรับแพลตฟอร์มของ Apple ทำให้ Meta ติดต่อโดยตรงกับฐานผู้ใช้มืออาชีพที่พยายามจะเข้าถึงในอดีต และแข่งขันกับยูทิลิตี้การเขียนตามคำบอกและการถอดเสียงที่จัดตั้งขึ้นบนแพลตฟอร์ม

สนามที่หนาแน่นซึ่งเริ่มเร็วขึ้นเรื่อยๆ

Meta กำลังเข้าสู่ตลาดที่ได้รับการปรับราคาและออกแบบใหม่ในช่วงสองปีที่ผ่านมา โมเดลโอเพ่นซอร์ส Whisper ของ OpenAI ได้สร้างพื้นฐานสำหรับการถอดเสียงหลายภาษาที่เข้าถึงได้ และ GPT Transcribe API แบบชำระเงินของบริษัทก็ได้ตัดราคาตลาดเชิงพาณิชย์ไปมาก ในขณะเดียวกัน Google ได้ผลักดันอย่างหนักไปในทิศทางเดียวกัน: โมเดลการถอดเสียงที่ขับเคลื่อนโดย Gemini ซึ่งครอบคลุมหลายภาษาแบบเรียลไทม์ได้ถูกเผยแพร่ให้กับนักพัฒนาแล้ว ตามที่เราได้กล่าวถึงเมื่อ Google ส่งโมเดลการถอดเสียงคำพูดแบบเรียลไทม์ 85 ภาษา

เมื่อเทียบกับฉากหลังนั้น ความแตกต่างได้เปลี่ยนจากความแม่นยำดิบ โดยที่ผู้นำจะรวมตัวกันภายใต้เสียงรบกวนของกันและกันบนการวัดประสิทธิภาพมาตรฐาน ไปเป็นรายละเอียดในทางปฏิบัติ: เวลาแฝง การจัดการผู้พูด การสลับรหัสระหว่างภาษา ราคา และตำแหน่งที่โมเดลทำงาน การเน้นย้ำของ Meta ในเรื่องลำโพงหลายตัวพร้อมกันและการจดจำได้หลายภาษาในแบบเรียลไทม์มีเป้าหมายที่แม่นยำในรายละเอียดเชิงปฏิบัติเหล่านั้น

ทำไมเสียงถึงจู่ๆ ก็กลายเป็นเรื่องเชิงกลยุทธ์

เวลาไม่ใช่เรื่องบังเอิญ เสียงกำลังกลายเป็นอินเทอร์เฟซเริ่มต้นสำหรับตัวแทน AI และบริษัทที่เป็นเจ้าของเลเยอร์เสียง เช่น การจับภาพ การถอดเสียง การทำความเข้าใจ และการตอบสนอง จะควบคุมจุดเริ่มต้นที่เป็นธรรมชาติที่สุดสำหรับประสบการณ์ผู้ช่วย Meta ได้รับการเปิดเผยต่อสาธารณะเกี่ยวกับความทะเยอทะยานสำหรับแว่นตา AI และอุปกรณ์สวมใส่ โดยที่เสียงเป็นเพียงอินพุตที่ใช้งานได้จริงเท่านั้น โมเดลเสียงที่รวดเร็ว แม่นยำ ขณะเดินทางคือโครงสร้างพื้นฐานสำหรับแผนการทำงานดังกล่าว

นอกจากนี้ยังมีมุมองค์กร การประชุม การโทรเพื่อการสนับสนุน และการทำงานภาคสนามทำให้เกิดเสียงจากลำโพงหลายตัวในปริมาณมหาศาลซึ่งองค์กรต้องการให้สามารถค้นหาและดำเนินการได้ โมเดลที่ถอดความได้อย่างน่าเชื่อถือในขณะที่บทสนทนาเกิดขึ้น โดยมีป้ายกำกับผู้พูดและภาษาที่จัดการโดยไม่ต้องกำหนดค่าด้วยตนเอง คือความแตกต่างระหว่างการสาธิตและผลิตภัณฑ์

การถอดเสียงแบบเรียลไทม์ยังให้ประโยชน์ที่มากกว่าความสะดวกสบายอีกด้วย คำบรรยายสดทำให้การประชุม ห้องเรียน และการออกอากาศสามารถเข้าถึงได้โดยผู้ใช้ที่หูหนวกและมีปัญหาในการได้ยิน และคำบรรยายหลายภาษาแบบทันทีช่วยลดอุปสรรคด้านภาษาสำหรับทีมงานต่างประเทศ เมื่อการถอดเสียงเป็นคำเร็วพอที่จะก้าวให้ทันกับเสียงพูดที่เป็นธรรมชาติและทนทานพอที่จะติดตามผู้พูดหลายคนพร้อมกัน ฟีเจอร์การช่วยการเข้าถึงเหล่านั้นจะไม่เป็นเพียงสิ่งอำนวยความสะดวกพิเศษและกลายเป็นค่าเริ่มต้นที่มีอยู่ในเครื่องมือประจำวัน

Meta ยังไม่ได้ประกาศราคาหรือรายละเอียดความพร้อมใช้งานทั้งหมดในการครอบคลุมเบื้องต้น แต่ทิศทางนั้นไม่มีข้อผิดพลาด: ชั้นเสียงของ AI Stack ซึ่งถือเป็นสินค้าโภคภัณฑ์มายาวนาน ตอนนี้กลายเป็นแนวหน้าในสงครามแพลตฟอร์ม และ Meta ได้ตัดสินใจที่จะต่อสู้กับมัน

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →