Google ได้เปิดตัว Gemini 3.5 Transcribe โมเดลคำพูดเป็นข้อความใหม่ที่สร้างขึ้นเพื่อการถอดเสียงแบบเรียลไทม์ที่จดจำได้มากกว่า 85 ภาษา โดยอัตโนมัติ และขัดเกลาเอาต์พุตไปพร้อมกัน ขจัดคำเติมและแก้ไขคำพูดที่สะดุดโดยไม่ต้องถาม

การเปิดตัวดังกล่าวทำให้กลุ่มคำพูดของ Google กลายเป็นผู้ท้าทายโดยตรงในตลาดการถอดเสียงที่เติบโตอย่างรวดเร็ว โดยความแม่นยำและเวลาแฝงจะตัดสินมากขึ้นเรื่อยๆ ว่านักพัฒนาซอฟต์แวร์จะเลือกใช้บริการใดสำหรับการโทร การประชุม คำบรรยาย และอินเทอร์เฟซเสียง For more context on this story, see our ongoing AI news.

สิ่งที่โมเดลสามารถทำได้

ตามประกาศของ Google การรายงานข่าวซึ่งเผยแพร่โดย The Decoder นั้น Gemini 3.5 Transcribe เป็นมากกว่าการแปลงคำพูดเป็นข้อความ:

  • การตรวจจับภาษาอัตโนมัติ ในกว่า 85 ภาษา โดยไม่ต้องกำหนดค่าใดๆ
  • การลบคำเติม การล้าง "อืม" "เอ่อ" และความไม่สอดคล้องที่คล้ายกัน
  • แก้ไขลิ้นหลุด ทำให้เกิดร้อยแก้วที่อ่านง่าย แทนที่จะเป็นเสียงคำต่อคำ
  • การจัดรูปแบบข้อความอัตโนมัติ รวมถึงเครื่องหมายวรรคตอนและโครงสร้าง

บริษัทรายงาน อัตราความผิดพลาดของคำที่ 4.0 เปอร์เซ็นต์สำหรับการสตรีมเสียง และ 2.6 เปอร์เซ็นต์สำหรับเสียงที่บันทึกไว้ ควบคู่ไปกับ การลดเวลาแฝงประมาณ 70 เปอร์เซ็นต์ เมื่อเทียบกับรุ่นก่อน Chirp 3 ซึ่งเป็นส่วนสำคัญอย่างมากในสถานการณ์คำบรรยายสดที่ความล่าช้าทำให้การสนทนาหยุดชะงัก

สองอินเทอร์เฟซสำหรับสองงาน

นักพัฒนาสามารถเข้าถึงอินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชันที่แตกต่างกันสองแบบ:

Live API — `gemini-3.5-transcribe-live`

จัดการการสตรีมแบบเรียลไทม์ด้วยเวลาแฝงที่ต่ำมาก โดยกำหนดเป้าหมายคำบรรยายสด เอเจนต์เสียง และผู้ช่วยแบบโต้ตอบที่เวลาตอบสนองมีความสำคัญที่สุด

API การโต้ตอบ — `gemini-3.5-transcribe`

ประมวลผลเสียงที่บันทึกไว้และส่งกลับข้อความถอดเสียงพร้อมการระบุแหล่งที่มาของผู้พูดและการประทับเวลา ซึ่งเป็นขั้นตอนการทำงานทั่วไปสำหรับการประชุม การสัมภาษณ์ พ็อดแคสต์ และขั้นตอนหลังการผลิตสื่อ

นอกเหนือจากการถอดเสียง โมเดลดังกล่าวยังรองรับ การเรียกใช้ฟังก์ชัน ซึ่งหมายความว่าสามารถมอบหมายงานติดตามผลให้กับโมเดลอื่นๆ ในตระกูล Gemini ได้ เช่น การทริกเกอร์คำขอสร้างภาพหรือการค้นหาเว็บโดยอิงจากสิ่งที่พูดในระหว่างเซสชัน ซึ่งจะเปลี่ยนกลไกการถอดเสียงให้เป็นเลเยอร์อินเทอร์เฟซที่ควบคุมได้สำหรับแอปพลิเคชันที่ขับเคลื่อนด้วยเสียง

จัดส่งผลิตภัณฑ์ต่างๆ ของ Google แล้ว

โมเดลดังกล่าวเผยแพร่แล้วใน Google AI Studio และบน Gemini Enterprise Agent Platform สำหรับนักพัฒนาในปัจจุบัน นอกจากนี้ Google ยังเชื่อมต่ออุปกรณ์นี้เข้ากับแพลตฟอร์มสำหรับผู้บริโภค: Gboard บน Android ใช้ผ่านส่วนประกอบภายในที่เรียกว่า Rambler เพื่อเขียนตามคำบอก แอป Gemini บน macOS ใช้กับการป้อนข้อมูลด้วยเสียง และจะมีการผสานรวม Chrome ตามมาด้วย

การกระจายนั้นมีความสำคัญ การรู้จำเสียงได้รับการพัฒนาอย่างต่อเนื่อง และการฝังโมเดลไว้ในคีย์บอร์ด แอพเดสก์ท็อป และเบราว์เซอร์ทำให้โมเดลอยู่หน้าการโต้ตอบอินพุตนับพันล้านครั้งต่อวัน ในขณะที่ป้อนลูปการประเมินที่จำเป็นเพื่อรักษาอัตราข้อผิดพลาดให้ตกไปตามสำเนียง ภาษาถิ่น และสภาพแวดล้อมที่มีเสียงดัง

เดิมพันการแข่งขันใน Speech AI

การถอดเสียงกลายเป็นสมรภูมิการแข่งขันอย่างเงียบๆ ระหว่างห้องปฏิบัติการชายแดนและผู้จำหน่ายที่เชี่ยวชาญ การเข้าใจคำพูดที่แม่นยำและมีเวลาแฝงต่ำคือตั๋วเริ่มต้นสำหรับผลิตภัณฑ์ตัวแทนที่ดำเนินการตามคำสั่งเสียง ระบบอัจฉริยะในการประชุมระดับองค์กร คุณลักษณะการเข้าถึง และระบบอัตโนมัติของบริการลูกค้าหลายภาษา

ด้วยการจับคู่การปรับปรุงเวลาแฝงเชิงรุกกับเอาต์พุตที่แก้ไขตัวเอง Google กำลังเดิมพันว่านักพัฒนาต้องการการถอดเสียงที่อ่านเหมือนข้อความที่มีการแก้ไขมากกว่าการบันทึกการออกเสียงแบบดิบ - แลกเปลี่ยนความเที่ยงตรงของคำต่อคำที่เข้มงวดเพื่อการใช้งาน ทีมที่ต้องการบันทึกที่แน่นอน เช่น ผู้ถอดเสียงทางกฎหมายหรือทางการแพทย์ อาจยังต้องการโหมดคำต่อคำ สำหรับคนอื่นๆ ความแตกต่างในทางปฏิบัติระหว่างการได้ยินใครบางคนและการทำความเข้าใจพวกเขายังคงแคบลง

ขณะนี้ Gemini 3.5 Transcribe พร้อมใช้งานโดยทั่วไปแล้วใน AI Studio และเครื่องมือระดับองค์กร การทดสอบที่มีความหมายครั้งแรกจะเป็นการวัดการใช้งานจากนักพัฒนาตัวแทนเสียง ซึ่งเป็นกลุ่มตลาดที่เติบโตอย่างรวดเร็วเพียงพอที่แม้แต่ความแม่นยำที่เพิ่มขึ้นก็แปลไปสู่การตัดสินใจเปลี่ยนขนาดใหญ่ได้

เหตุใดความล่าช้าจึงเป็นสมรภูมิที่แท้จริง

อัตราข้อผิดพลาดเป็นหัวข้อข่าว แต่ความล่าช้าจะตัดสินอย่างเงียบๆ ว่าผลิตภัณฑ์ใดสามารถทำงานได้ เครื่องมือถอดเสียงที่ใส่คำบรรยายสดซ้อนทับต้องตามให้ทันการสนทนา มิฉะนั้นผู้ชมจะเลิกสนใจ ตัวแทนเสียงที่กำลังเจรจาสายสนับสนุนลูกค้าไม่สามารถหยุดอย่างเชื่องช้าในขณะที่เลเยอร์คำพูดไล่ตาม Google รายงานความล่าช้าลดลง 70 เปอร์เซ็นต์เมื่อเทียบกับ Chirp 3 กำหนดเป้าหมายช่องว่างนั้นอย่างแม่นยำ - ลดระยะห่างระหว่างผู้พูดที่จบประโยคและระบบดาวน์สตรีมที่ทำหน้าที่นั้น

สำหรับการใช้งานเชิงตัวแทน สารประกอบนี้: ทุกรอบของบทสนทนาเกี่ยวข้องกับการจดจำ การใช้เหตุผล และการตอบสนอง การลดเสี้ยววินาทีจากขั้นตอนการจดจำช่วยให้ผู้สร้างสามารถใช้โมเดลการให้เหตุผลที่มีความสามารถมากขึ้นและช้าลงได้ โดยไม่กระทบต่องบประมาณด้านเวลาของการสนทนา

การแลกเปลี่ยนคำต่อคำ

ทางเลือกการออกแบบทางหนึ่งสมควรได้รับการตรวจสอบอย่างละเอียด ตามค่าเริ่มต้น Gemini 3.5 Transcribe จะรวบรวมเอาต์พุต: คำที่เติมหายไป คำที่สะดุดจะได้รับการแก้ไข และใช้การจัดรูปแบบโดยอัตโนมัติ สำหรับการใช้งานทางธุรกิจส่วนใหญ่ — นาที, คำบรรยาย, ไฟล์เก็บถาวรที่ค้นหาได้ — นั่นคือสิ่งที่ผู้ใช้ต้องการ

แต่ขั้นตอนการทำงานบางอย่างขึ้นอยู่กับบันทึกคำต่อคำ การเรียบเรียงทางกฎหมาย การตรวจสอบการปฏิบัติตามข้อกำหนด และการตรวจสอบข้อเท็จจริงของนักข่าวบางครั้งจำเป็นต้องรู้อย่างแน่ชัดว่าพูดอะไร รวมถึงการลังเลด้วย องค์กรในอุตสาหกรรมที่ได้รับการควบคุมจะต้องการความชัดเจนว่าการปรับให้เรียบนั้นเป็นทางเลือกและกำหนดค่าได้มากน้อยเพียงใด ก่อนที่จะย้ายไปป์ไลน์ที่มีความละเอียดอ่อนไปยังโมเดลใหม่ เอกสารประกอบและพารามิเตอร์ API ของ Google จะกำหนดจุดที่บรรทัดแบบคำต่อคำและแบบขัดเงานั้นอยู่อย่างมีประสิทธิภาพสำหรับอุตสาหกรรม

รอยเท้าหลายภาษาเหมือนคูน้ำ

ความครอบคลุมกว่า 85 ภาษาพร้อมการตรวจจับอัตโนมัติไม่ได้เป็นเพียงรายการตรวจสอบคุณสมบัติเท่านั้น การเข้าถึงได้หลายภาษามุ่งเน้นไปที่คุณค่าในตลาดที่คู่แข่งมีความล่าช้าในอดีต เช่น สำเนียงในระดับภูมิภาค การสลับรหัสระหว่างภาษาที่มีประโยคกลาง และภาษาที่มีทรัพยากรต่ำ ล้วนลงโทษโมเดลที่ได้รับการฝึกฝนอย่างหวุดหวิดเกี่ยวกับองค์กรที่เน้นภาษาอังกฤษเป็นหลัก

สำหรับองค์กรระดับโลกที่มีศูนย์สนับสนุนในหลายสิบประเทศ โมเดลเดียวที่จัดการการตรวจจับภาษาจะช่วยลดความซับซ้อนในการบูรณาการอย่างโปร่งใส — ไปป์ไลน์เดียวแทนการกำหนดค่าหลายรายการต่อตลาด เมื่อรวมกับการเผยแพร่ผ่านการติดตั้ง Android นับพันล้านรายการของ Gboard แล้ว Google กำลังวางตำแหน่งการถอดเสียงหลายภาษาที่มีคุณภาพเป็นโครงสร้างพื้นฐานมากกว่าความสามารถระดับพรีเมียม

สิ่งที่ต้องดู

สัญญาณสามประการจะแสดงให้เห็นว่า Gemini 3.5 Transcribe เปลี่ยนแปลงส่วนแบ่งการตลาดหรือเพียงเพิ่มความคาดหวัง: การโยกย้ายของนักพัฒนาในการวัดประสิทธิภาพของบุคคลที่สามในอีกไม่กี่เดือนข้างหน้า; คู่แข่งจับคู่ตัวเลขแฝงได้เร็วแค่ไหนมากกว่าการอ้างความถูกต้อง และฮุคการเรียกใช้ฟังก์ชันจะสร้างคลื่นของเอเจนต์ที่เน้นเสียงเป็นหลักซึ่งสร้างขึ้นบนราศีเมถุนหรือไม่ การเปิดตัวใช้งานได้แล้วในขณะนี้ และระดับการกำหนดราคาผ่าน AI Studio น่าจะทำให้การทดลองมีราคาถูกมากพอที่ต้นทุนการเปลี่ยนจะลดลงจนแทบไม่มีอะไรเลย

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →