Google ได้เปิดตัวโมเดลการอ่านออกเสียงข้อความใหม่สองรุ่นในวันพุธ ได้แก่ Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS ซึ่งเรียกโมเดลเหล่านี้ว่าเป็นโมเดลการสร้างเสียงที่แสดงออกมากที่สุด โมเดลดังกล่าวมีให้บริการใน Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook และ Google Vids ตามประกาศของ Google จาก Leland Rechis ผู้จัดการผลิตภัณฑ์กลุ่ม และ Alan Cowen ผู้อำนวยการฝ่ายวิทยาศาสตร์การวิจัยของทีมเสียง Gemini

การเปิดตัวครั้งนี้ย้ายการสร้างเสียงนอกเหนือจากเสียงคงที่ที่ตั้งไว้ล่วงหน้าไปสู่สิ่งที่ Google เรียกว่าเป็นสตูดิโอสร้างสรรค์: เสียงที่ออกแบบจากข้อความแจ้ง การแสดงที่กำกับทีละบรรทัด และโครงความปลอดภัยที่ติดตั้งในตัวตั้งแต่เริ่มต้น หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับเรื่องนี้และข่าวประชาสัมพันธ์อื่นๆ โปรดดู ข่าวโมเดล AI ของเรา

สองรุ่น สองงาน

ทั้งคู่แบ่งภาระงานในลักษณะที่คุ้นเคยของ Google Gemini 3.8 Flash TTS ได้รับการออกแบบมาเพื่อการกำกับเชิงสร้างสรรค์และการออกแบบตัวละคร — สร้างเสียงใหม่ทั้งหมดตั้งแต่ต้นผ่านภาษาที่เป็นธรรมชาติสำหรับการเล่นเกม หนังสือเสียงที่ดื่มด่ำ พ็อดแคสต์ และสื่อเชิงโต้ตอบ พร้อมการควบคุมการแสดง จังหวะ การเปลี่ยนภาษาถิ่น และ backchanneling อย่างละเอียด Gemini 3.8 Flash-Lite TTS คือการเล่นเสียง: ปรับให้เหมาะสมสำหรับการพากย์เสียงสูง การสร้างเนื้อหาเสียง และตัวแทนเสียงที่แสดงออกในวงกว้าง พร้อมการควบคุมโทนเสียง จังหวะ และความแตกต่างที่ละเอียดในราคาที่ต่ำกว่า

การวางตำแหน่งของ Google วางกรอบทั้งคู่เป็นการเปลี่ยนการสร้างเสียง "จากค่าที่ตั้งล่วงหน้าแบบคงที่เป็นสตูดิโอสร้างสรรค์แบบไดนามิก" บริษัทชี้ว่าหนังสือเสียง เกม และพอดแคสต์เป็นจุดหมายปลายทางตามธรรมชาติสำหรับรุ่นเรือธง ในขณะที่รุ่น Lite มุ่งเป้าไปที่ตลาดที่ไม่สวยงามแต่ใหญ่โตสำหรับการพากย์เสียงและตัวแทนเสียงที่ทำงานตลอดเวลา ซึ่งต้นทุนต่อนาทีที่สร้างมีความสำคัญมากกว่าพลังดารา ทั้งสองรุ่นถูกรวมเข้ากับผลิตภัณฑ์ของ Google เช่น Gemini Notebook และ Google Vids ซึ่งเป็นการส่งสัญญาณว่าเทคโนโลยีนี้จะปรากฏในเครื่องมือที่ผู้บริโภคต้องเผชิญแทนที่จะยังคงเล่นได้เฉพาะ API เท่านั้น

สตูดิโอแกนนำเต็มรูปแบบ จาก 30 เสียงไปจนถึงไม่มีที่สิ้นสุด

Google กล่าวว่าขณะนี้นักพัฒนาซอฟต์แวร์สามารถปรับขนาดจากเสียงต้นฉบับ 30 เสียงไปจนถึงสิ่งที่เรียกว่าไลบรารีที่ไม่มีที่สิ้นสุด ระบบการออกแบบเสียงแบบกำเนิดช่วยให้ผู้ใช้สามารถสร้างเสียงที่ตรงตามความต้องการโดยการระบุบทบาท สำเนียง และลักษณะเสียงของภาษาและภาษาถิ่นมากกว่า 100 ภาษา การสาธิตของ Google มีตั้งแต่เสียงดีเจที่มีพลังสูงจากเมลเบิร์นไปจนถึง "หุ่นยนต์เสียงเดียวสุดแกร่ง" และมังกรญี่ปุ่น

นอกจากรุ่นแล้ว โมเดลดังกล่าวยังมาพร้อมกับคลังเสียงที่พร้อมสำหรับการผลิตมากกว่า 2,000 รายการ รวมถึงเสียงในระดับภูมิภาค เช่น ภาษาสเปนเม็กซิกัน ภาษาฝรั่งเศสควิเบก และภาษาอังกฤษแบบสก็อต

การจำลองเสียงรวมอยู่ใน Guardrails: ผู้ใช้สามารถสร้างโปรไฟล์เสียงร้องที่สอดคล้องกันขึ้นมาใหม่จากตัวอย่างเสียงเพียง 30 วินาที — เสียงของตัวเองหรือที่มีสิทธิ์ใช้ — ได้รับการสนับสนุนจากการตรวจสอบความยินยอมในตัว ลายน้ำ SynthID และข้อมูลรับรอง C2PA นอกจากนี้ Google ยังเพิ่มฟังก์ชันการบันทึกและปรับขนาดเพื่อให้เสียงที่กำหนดเองสอดคล้องกันทั่วทั้งโปรเจ็กต์ ด้วยการรีมิกซ์เสียง — ปรับแต่งเสียงต่ำ ระดับเสียง จังหวะ และสำเนียงผ่านข้อความแจ้ง — จะแสดงเร็วๆ นี้

กำกับการแสดงทีละบรรทัด

ทั้งสองรุ่นรองรับทิศทางต่อเส้นที่แม่นยำ นักพัฒนาสามารถเขียนทิศทางบนเวทีของตัวเองหรือปล่อยให้โมเดลควบคุมการนำเสนอตามสคริปต์ที่เป็นธรรมชาติ — ความแตกต่างระหว่างตัวแทนฝ่ายบริการลูกค้าที่สงบและฉากที่กระซิบกระซาบ เสียงร้องที่เขียนด้วยสคริปต์ เช่น , และ เพิ่มเนื้อสัมผัสที่เป็นอวัจนภาษา ในขณะที่คำอุทานฟังอย่างกระตือรือร้น เช่น |mhm| และ |ใช่| จัดการกับกาวการสนทนาที่ทำให้บทสนทนาฟังดูเป็นมนุษย์

คุณสมบัติสองประการมุ่งเป้าไปที่การทำงานในรูปแบบที่ยาวขึ้นและหลายเสียง การสร้างรูปแบบยาวจะรักษาคุณภาพเสียงและการเว้นจังหวะของเสียงต่อเนื่องหลายชั่วโมงโดยมีการเบี่ยงเบนของลำโพงน้อยที่สุด โดยมุ่งเป้าไปที่พอดแคสต์และหนังสือเสียง ในขณะที่การจัดฉากด้วยลำโพงสองตัวแบบเนทีฟจะกำหนดทิศทางการสนทนาหลายรอบจากสคริปต์เดียวโดยมีการผลัดเปลี่ยนกันอย่างเป็นธรรมชาติและเสียงที่แยกออกจากกันอย่างชัดเจน

เกณฑ์มาตรฐาน: อันดับ 1 ใน Hume AI

Google เป็นผู้นำการประกาศด้วยหมายเลขบุคคลที่สาม Gemini 3.8 Flash TTS ครองอันดับ 1 โดยรวมในเกณฑ์มาตรฐานการออกแบบเสียงของ Hume AI ด้วยคะแนน 71.4 และเป็นผู้นำในการสร้างแบบจำลองสำเนียงที่ 60.8 ในดัชนีคุณภาพโดยรวมของ Hume AI รุ่นใหม่ทั้งสองอ้างว่าอยู่ในอันดับที่ 1 และ 2 ตามลำดับ

ควรอ่านคำกล่าวอ้างมาตรฐานจากผู้ขายด้วยความระมัดระวังเสมอ แต่ Hume AI ซึ่งเป็นบริษัทวิจัย AI เสียงอิสระ เป็นผู้ตัดสินที่สมเหตุสมผลในด้านคุณภาพเสียงพูด และคะแนนดังกล่าวทำให้ Google มีจุดพูดคุยที่เป็นรูปธรรมต่อคู่แข่งในการสร้างเสียง

การแข่งขัน Audio Arms ยังคงดำเนินต่อไป

รุ่นใหม่เข้าร่วมตระกูลเสียง Gemini ที่เติบโตอย่างรวดเร็วซึ่งประกอบด้วย 3.5 Live Translate, 3.5 Transcribe, 3.8 Live และ 3.8 Live Extended Thinking ซึ่งเป็นโมเดลเสียงแบบเรียลไทม์ที่ Google เปิดตัวเมื่อต้นเดือนนี้ จังหวะไม่ใช่เรื่องบังเอิญ การสังเคราะห์เสียงที่แสดงออกและเชื่อถือได้กำลังกลายเป็นโครงสร้างพื้นฐานหลักสำหรับตัวแทนเสียง การสนับสนุนลูกค้า เครื่องมือช่วยการเข้าถึง และการผลิตสื่อ และ Google ต้องการให้ Gemini เป็นเลเยอร์เริ่มต้นสำหรับทั้งหมด

สำหรับนักพัฒนา การดำเนินการทันทีนั้นใช้งานได้จริงมากกว่าอนาคต: เสียงของแบรนด์ที่กำหนดเอง การพากย์หลายภาษา และการบรรยายที่มีความยาวหลายชั่วโมงตอนนี้สามารถทำได้ทันทีภายใน Gemini API และ AI Studio โดยมีลายน้ำแนบอยู่

เศรษฐศาสตร์จะเป็นผู้ตัดสินว่าจะใช้ศักยภาพนั้นไปมากน้อยเพียงใด Google ไม่ได้เน้นการกำหนดราคาในเอกสารการเปิดตัว แต่การมีอยู่ของระดับ Flash-Lite บ่งบอกถึงตัวเลือกที่มีต้นทุนต่ำสำหรับปริมาณงานจำนวนมาก โดยสะท้อนถึงกลยุทธ์การแบ่งระดับที่ใช้กับตระกูลโมเดล Gemini องค์กรต่างๆ ใน ​​Gemini Enterprise จะได้รับความสามารถแบบเดียวกันเบื้องหลังข้อตกลงที่มีอยู่ ซึ่งเป็นจุดที่ Google คาดหวังว่าการผลิตเสียงปริมาณมากจำนวนมากจะเริ่มลงมือ

สิ่งที่ยังคงต้องติดตามก็คืออุตสาหกรรมสร้างสรรค์นำคำบรรยายสังเคราะห์มาใช้ได้รวดเร็วเพียงใด ลายน้ำและการตรวจสอบความยินยอมช่วยลดอุปสรรคทางกฎหมายและจริยธรรม และตัวเลขมาตรฐานบ่งชี้ว่าคุณภาพไม่ใช่ปัญหาคอขวดอีกต่อไป หากคำกล่าวอ้างของ Google ยังคงอยู่ในทางปฏิบัติ ช่องว่างระหว่างเสียงพากย์ของมนุษย์ที่บันทึกไว้กับเสียงที่สร้างขึ้นนั้นแคบลงมากพอที่ต้นทุนและการฟื้นตัว (ไม่ใช่ความถูกต้อง) จะเป็นการตัดสินใจสำหรับโครงการส่วนใหญ่

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →