Google ได้เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งเป็นโมเดลการสนทนาสดคู่หนึ่งที่บริษัทอธิบายว่าเป็นขั้นสูงที่สุดสำหรับการสนทนาด้วยเสียงที่เป็นธรรมชาติ โมเดลดังกล่าวเริ่มเปิดตัวในวันที่ 15 กันยายนทั่วทั้ง Gemini API, Google AI Studio, Search Live, Gemini Live และ Google Workspace พร้อมการเข้าถึงระดับองค์กรในการดูตัวอย่างแบบส่วนตัวผ่าน Gemini Enterprise

การประกาศดังกล่าวมาจาก Tom Ouyang วิศวกรหลัก และ Malini Jaganathan สมาชิกเจ้าหน้าที่ด้านเทคนิค เขียนในนามของทีม Gemini Audio โดยขยายตระกูล Gemini 3.8 ที่เปิดตัวเมื่อต้นเดือนนี้ด้วยรุ่น Flash และ Flash Cyber ​​และถือเป็นการผลักดันเชิงรุกที่สุดของ Google ไปสู่การช่วยเหลือด้วยเสียงแบบเรียลไทม์และต่อเนื่องหลายรูปแบบ ซึ่งเป็นตลาดที่โหมดเสียงของ OpenAI และการเริ่มต้นคลื่นเสียงพูดกำลังแข่งขันกันในกรณีการใช้งานรายวันเดียวกัน

การเปิดตัวครั้งนี้สอดคล้องกับกลุ่มโมเดลของ Google ที่มีผู้คนหนาแน่นอย่างน่าทึ่ง ความครอบคลุมของ การพัฒนา AI ล่าสุด แสดงให้เห็นว่าขณะนี้บริษัทมีการจัดส่งซ้ำแล้วซ้ำอีกในช่วงไม่กี่สัปดาห์ เนื่องจากต้องต่อสู้กับคู่แข่งในด้านราคา การเข้ารหัส และเสียงในปัจจุบัน

สร้างขึ้นเพื่อการสนทนาแบบเรียลไทม์

สิ่งที่ทำให้โมเดล Live แตกต่างจากโมเดลแชทมาตรฐานที่มีไมโครโฟนติดอยู่คือเวลาแฝงและสถานะ เอกสาร Live API ของ Google อธิบายถึงอินเทอร์เฟซที่มีเวลาแฝงต่ำซึ่งประมวลผลสตรีมเสียง รูปภาพ และข้อความอย่างต่อเนื่องผ่านการเชื่อมต่อ WebSocket แบบมีสถานะ ยอมรับเสียงดิบ PCM 16kHz ภาพ JPEG ที่สูงสุดหนึ่งเฟรมต่อวินาที และข้อความ และส่งคืนเสียงพูดแบบเรียลไทม์

โมเดลต่างๆ ประมวลผลอินพุตภาพในเวลาใกล้เคียงเรียลไทม์ ทำให้ผู้ช่วยเห็นสิ่งที่ผู้ใช้เห็น วิดีโอสาธิตของ Google จะแสดง Gemini 3.8 Live ที่แนะนำเซสชั่นการเริ่มต้นพนักงานของพนักงานโดยใช้บริบทของภาพ การเล่นหมากรุกในเวลาใกล้เคียงเรียลไทม์ และสร้างแผนธุรกิจที่สมบูรณ์และชุดเครื่องมือทางการตลาดที่กำหนดเองผ่านคำพูดที่เป็นธรรมชาติ โมเดลยังสามารถตรวจจับและเปลี่ยนระหว่างภาษาที่รองรับ 97 ภาษาโดยอัตโนมัติ กลางการสนทนา โดยไม่ต้องเปลี่ยนการตั้งค่าโดยผู้ใช้

บางทีสิ่งที่สำคัญที่สุดสำหรับการใช้งานจริง: โมเดลจะเรียกใช้เครื่องมือและการเรียก API ในเบื้องหลังในขณะที่การสนทนาดำเนินต่อไป รับทราบคำขอ และให้บทสนทนาดำเนินไปในขณะที่งานเสร็จสิ้น นั่นจะเปลี่ยนผู้ช่วยจากผู้ตอบแบบผลัดกันเดินอย่างเคร่งครัดให้กลายเป็นสิ่งที่ใกล้ชิดกับตัวแทนที่บังเอิญพูดคุยมากขึ้น

ตัวเลขที่ Google กำลังโน้มน้าว

Google รายงานว่า Gemini 3.8 Live Extended Thinking ครองตำแหน่งโดยรวมสูงสุดในดัชนีคุณภาพคำพูดเป็นคำพูดของการวิเคราะห์เชิงประดิษฐ์ ด้วยคะแนน 82.6 ในการทำงานตัวแทนเสร็จสิ้น บริษัทอ้างอิง 68.6% ในเกณฑ์มาตรฐาน τ-Voice และ 35.1% ในการประเมิน τ-Voice-Banking ของ Sierra ควบคู่ไปกับคะแนน 97.7% ใน Big Bench Audio

ข้อมูลเหล่านี้เป็นตัวเลขที่รายงานโดย Google และการตรวจสอบโดยอิสระจะใช้เวลา แต่การอ้างสิทธิ์ในแผนภูมิการวิเคราะห์ประดิษฐ์ (หากมี) จะทำให้ Google ก้าวนำหน้าข้อเสนอที่เพิ่มประสิทธิภาพเสียงพูดจาก OpenAI และบริษัท AI เสียงโดยเฉพาะในด้านคุณภาพการสนทนาโดยรวม Google ยังกล่าวอีกว่า Extended Thinking จะรักษาจุดราคาที่มีการแข่งขันสูง ซึ่งถือเป็นการพยักหน้าโดยนัยต่อแรงกดดันด้านราคาที่กำหนดรุ่น 3.8

เสียงทั้งหมดที่สร้างโดยโมเดลจะมีลายน้ำด้วย SynthID ซึ่งเป็นลายน้ำที่มองไม่เห็นของ Google ดังนั้นคำพูดที่สร้างโดย AI จึงยังคงตรวจจับได้ ซึ่งเป็นการป้องกันการปฏิบัติตามข้อกำหนดและข้อมูลที่ไม่ถูกต้อง ซึ่งกลายเป็นมาตรฐานในผลิตภัณฑ์กำเนิดของ Google

คุณสามารถใช้มันได้ที่ไหน

ความพร้อมใช้งานแตกต่างกันระหว่างสองรุ่น Gemini 3.8 Live พร้อมใช้งานสำหรับทุกคนใน Search Live ซึ่งเป็นโหมดค้นหาภาพแบบเรียลไทม์ของ Google Extended Thinking มีให้บริการใน Gemini Live, ใน Docs สำหรับสมาชิก Google AI Pro และ Ultra ผ่านทาง Workspace และใน Gmail และ Keep สำหรับผู้ใช้ Google ทุกคน

นักพัฒนาได้รับโมเดลผ่าน Gemini API และ Google AI Studio และ Google กล่าวว่า Live API ถูกใช้แล้วโดยแพลตฟอร์มต่างๆ เช่น Agora, Fishjam, LiveKit, Pipecat, Vercel และ Vision Agents เพื่อสร้างอินเทอร์เฟซที่ขับเคลื่อนด้วยเสียง นอกเหนือจากโครงสร้างพื้นฐานแบบเรียลไทม์ของ Google Salesforce, Genspark และ Lumeris ได้รับการเสนอชื่อให้เป็นพันธมิตรในการเปิดตัวโมเดลใหม่

ตลาด AI เสียงที่แออัด

เสียงกำลังกลายเป็นสมรภูมิอินเทอร์เฟซของปี 2026 เพราะนี่คือจุดที่ AI หลบหนีจากคีย์บอร์ดในที่สุด โมเดลที่สามารถดู ฟัง สลับภาษา และเรียกใช้เครื่องมือขณะพูดคุยไม่ได้แข่งขันกับแชทบอทอื่นๆ แต่แข่งขันกับการโทร สายสนับสนุนลูกค้า และผู้ช่วยส่วนตัว

ข้อได้เปรียบของ Google คือการเผยแพร่: การค้นหา, Android, Workspace และ Chrome ช่วยให้โมเดล Live มีฐานการติดตั้งที่ไม่มีใครเทียบได้ บริษัทวางเดิมพันว่าการปรากฏตัวในทุกมุมของวันของผู้ใช้ — ขณะนี้มีรูปแบบเสียงที่ดีที่สุด — จะมีความสำคัญมากกว่าการชนะเกณฑ์มาตรฐานใดๆ คู่แข่งจะได้รับโอกาสตอบโต้ แต่ Google ได้แสดงให้เห็นชัดเจนว่าเสียงดังกล่าวซึ่งครั้งหนึ่งเคยเป็นคุณลักษณะสาธิต ตอนนี้กลายเป็นสายผลิตภัณฑ์ชั้นหนึ่งแล้ว

สำหรับนักพัฒนา ข้อความก็ตรงไปตรงมาเช่นเดียวกัน ด้วยการเผยแพร่รูปแบบอินพุตที่แน่นอน บันทึกการทำงานของเครื่องมือพื้นหลัง และการสร้างระบบนิเวศด้วยแพลตฟอร์ม Live API Google กำลังพยายามสร้างสแต็กเป็นสารตั้งต้นเริ่มต้นสำหรับทุกคนที่สร้างอินเทอร์เฟซแบบพูด ตั้งแต่บอทสนับสนุนลูกค้าไปจนถึงผู้ช่วยที่สวมใส่ได้ ไม่ว่าการกล่าวอ้างคุณภาพของ Gemini 3.8 Live จะอยู่ภายใต้การทดสอบโดยหน่วยงานอิสระหรือไม่ ความพร้อมใช้งานก็กำลังดำเนินการอยู่

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →