OpenAI ได้เปิดตัว GPT-Live โมเดลเสียงซีรีส์ใหม่สำหรับ ChatGPT ที่สามารถฟังและพูดได้ในเวลาเดียวกัน ถือเป็นการยกเครื่องประสบการณ์เสียงสนทนาที่สำคัญที่สุดของบริษัทจนถึงปัจจุบัน การเปิดตัวใช้สิ่งที่ OpenAI อธิบายว่าเป็นสถาปัตยกรรมฟูลดูเพล็กซ์ ช่วยให้ผู้ใช้สามารถขัดจังหวะ พูดคุย และสนทนากับผู้ช่วยในลักษณะที่บริษัทบอกว่ารู้สึกเหมือนเป็นการโทรจริง

การเปิดตัวดังกล่าวเกิดขึ้นควบคู่ไปกับการเปิดตัวตระกูลรุ่น GPT-5.6 ในวงกว้างของ OpenAI ในสัปดาห์นี้ และแสดงให้เห็นถึงแรงผลักดันที่ทำให้ ข่าว AI ด่วน เกี่ยวกับอินเทอร์เฟซเสียงให้ความรู้สึกเหมือนสั่งเครื่องจักรน้อยลงและเหมือนกำลังสนทนากับบุคคลมากขึ้น

อะไรทำให้ GPT-Live แตกต่าง

ผู้ช่วยเสียงแบบดั้งเดิมทำงานในโหมดฮาล์ฟดูเพล็กซ์: คุณพูด จากนั้นคุณหยุด จากนั้นระบบจะประมวลผลคำขอของคุณและตอบสนอง การเลี้ยวจะเข้มงวด GPT-Live ทำลายรูปแบบนั้นด้วยการประมวลผลเสียง ฟูลดูเพล็กซ์ ซึ่งหมายความว่าโมเดลจะได้ยินคุณในขณะที่ยังคงพูดอยู่ ซึ่งทำให้เกิดการขัดจังหวะตามธรรมชาติ การแก้ไขประโยคกลาง และการสนทนาที่ทับซ้อนกัน ซึ่งเป็นสิ่งที่มนุษย์มองข้ามไป แต่ AI ด้วยเสียงเคยประสบปัญหาในอดีต

ตามรายงานของ Reuters โมเดล GPT-Live ฟังและพูดพร้อมกัน ซึ่งเป็นความสามารถที่เป็นเป้าหมายของสนาม AI เสียงมานานแล้ว วิธีการนี้ช่วยขจัดการหยุดชั่วคราวอย่างเชื่องช้าและการบังคับให้เลี้ยวซึ่งกำหนดโหมดเสียงของ ChatGPT เวอร์ชันก่อนหน้า

รายละเอียดทางเทคนิคที่โดดเด่น: เมื่อ GPT-Live พบกับคำถามที่ซับซ้อน คำถามเหล่านั้นจะส่งต่อไปยัง GPT-5.5 ในเบื้องหลัง โมเดลเสียงจะจัดการกระแสการสนทนาแบบเรียลไทม์ ในขณะที่โมเดลการให้เหตุผลขนาดใหญ่จะทำงานที่ยากขึ้นในเบื้องหลัง จากนั้นจึงป้อนคำตอบกลับ การแบ่งงานตาม OpenAI ช่วยเพิ่มคุณภาพการตอบสนองได้อย่างมากโดยไม่กระทบต่อการตอบสนองที่ทำให้การสนทนาแบบเรียลไทม์รู้สึกเป็นธรรมชาติ

ห้องว่างและราคา

OpenAI กำลังเปิดตัวโมเดลเสียงใหม่ในสองระดับ:

  • GPT-Live-1 — รุ่นเต็ม พร้อมให้ใช้งานแล้วสำหรับสมาชิก ChatGPT แบบชำระเงิน (แผน Plus, Pro และ Team)
  • GPT-Live-1 mini — เวอร์ชันที่เล็กกว่าและเบากว่าสำหรับบัญชี ChatGPT ฟรี
การเข้าถึง API กำลังจะมาในเร็วๆ นี้ OpenAI กล่าว ซึ่งจะช่วยให้นักพัฒนาสามารถสร้างเสียงฟูลดูเพล็กซ์ในแอปพลิเคชันของตนเองได้ บริษัทยังไม่ได้เผยแพร่ราคาโดยละเอียดสำหรับ API

การเปิดตัวนี้ยังนำ การค้นหาเว็บ มาสู่การสนทนาด้วยเสียงโดยตรงอีกด้วย ตามที่ Search Engine Journal รายงาน GPT-Live ได้รวมการค้นหาสดเข้ากับเสียงของ ChatGPT เพื่อให้ผู้ใช้สามารถถามเกี่ยวกับเหตุการณ์ปัจจุบันหรือข้อมูลที่เปลี่ยนแปลงอย่างรวดเร็ว และรับคำตอบที่มีพื้นฐานมาจากผลการค้นหาเว็บใหม่ๆ โดยไม่ต้องเปลี่ยนโหมด

ตลาด AI เสียงที่แข่งขันได้

GPT-Live เข้าสู่ภูมิทัศน์ AI เสียงที่มีผู้คนหนาแน่นมากขึ้น Google ได้เผยแพร่ฟีเจอร์เสียงที่ขับเคลื่อนโดย Gemini ทั่วทั้ง Android และผลิตภัณฑ์ Gemini Live ในขณะที่ Apple ยังคงปรับปรุง Siri ในรูปแบบภาษาขนาดใหญ่ต่อไป Anthropic ซึ่งเป็นคู่แข่งสำคัญของ OpenAI ได้มุ่งเน้นไปที่ความพยายามล่าสุดในด้านการเข้ารหัสแบบเอเจนต์และโมเดลการใช้เหตุผลมากกว่าการใช้เสียง

แนวทางฟูลดูเพล็กซ์คือจุดที่อุตสาหกรรมในวงกว้างกำลังมุ่งหน้าไป ด้วยการอนุญาตให้ฟังและพูดพร้อมกัน GPT-Live จึงลดเวลาแฝงและลบข้อร้องเรียนที่ใหญ่ที่สุดที่ผู้ใช้มีกับผู้ช่วยด้านเสียง: การรอ การส่งต่อไปยัง GPT-5.5 สำหรับการสืบค้นที่ซับซ้อนยังเป็นสัญญาณว่า OpenAI มองว่าเสียงไม่ใช่อินเทอร์เฟซแบบแยกส่วน แต่เป็นประตูหน้าของโมเดลที่มีความสามารถมากที่สุด

ทำไมมันถึงสำคัญ

Voice ได้รับการปฏิบัติเหมือนเป็นอินเทอร์เฟซรองที่ขับเคลื่อนด้วยคำสั่งมาหลายปีแล้ว — เหมาะสำหรับการตั้งเวลาและตรวจสอบสภาพอากาศ แต่มีประโยชน์น้อยกว่าสำหรับการสนทนาที่เหมาะสมยิ่ง เดิมพันของ GPT-Live ก็คือคอขวดไม่เคยเป็นความฉลาดของโมเดล แต่เป็น อินเทอร์เฟซ: บังคับให้มนุษย์พูดเป็นเสียงเดียว

หากการสนทนาฟูลดูเพล็กซ์ทำงานได้อย่างน่าเชื่อถือในวงกว้าง วิธีโต้ตอบของผู้คนกับ AI บนโทรศัพท์ ในรถยนต์ บนลำโพงอัจฉริยะ และบนอุปกรณ์สวมใส่ได้ก็จะเปลี่ยนไปในที่สุด นอกจากนี้ยังก่อให้เกิดข้อกังวลที่คุ้นเคย เช่น ความยินยอมในอุปกรณ์ที่ฟังตลอดเวลา ความสมจริงของเสียงสังเคราะห์ และการสนทนาที่เป็นธรรมชาติมากขึ้นทำให้ผู้ใช้เชื่อถือคำตอบของ AI มากเกินไปหรือไม่

OpenAI ไม่ได้ระบุรายละเอียดมาตรการความปลอดภัยเฉพาะสำหรับ GPT-Live นอกเหนือจากนโยบายเนื้อหาที่มีอยู่ แม้ว่าการรวมการค้นหาจะทำให้โมเดลสามารถดึงข้อมูลสดเป็นเสียงที่อาจยากสำหรับผู้ใช้ในการประเมินเชิงวิพากษ์มากกว่าข้อความที่พวกเขาสามารถเลื่อนกลับได้

อะไรจะเกิดขึ้นต่อไป

สำหรับตอนนี้ GPT-Live ถือเป็นฟีเจอร์ ChatGPT อันดับแรกและเป็นผลิตภัณฑ์สำหรับนักพัฒนาเป็นอันดับสอง การทดสอบจริงจะมาถึงด้วยการเข้าถึง API เมื่อแอปของบุคคลที่สาม แพลตฟอร์มการบริการลูกค้า และผู้ผลิตฮาร์ดแวร์สามารถเสียบการสนทนาฟูลดูเพล็กซ์เข้ากับผลิตภัณฑ์ของตนเองได้ นั่นคือเวลาที่ OpenAI จะเผชิญกับแรงกดดันด้านราคาจากโมเดลเสียงโอเพ่นซอร์สที่ถูกกว่าและจากคู่แข่งที่กระตือรือร้นที่จะจับคู่คุณสมบัตินี้

การเปิดตัวพร้อมกันกับการเปิดตัวสู่สาธารณะของ GPT-5.6 แสดงให้เห็นว่า OpenAI มองว่าเสียงและเหตุผลเป็นสองซีกของกลยุทธ์เดียวกัน: โมเดลที่ทรงพลังที่คิด จับคู่กับอินเทอร์เฟซที่ช่วยให้คุณพูดคุยกับมันได้เหมือนเพื่อนร่วมงาน

ก้าวนำหน้า AI

ติดตามการพัฒนา AI ล่าสุดได้ที่ AI Buzz Wire เพื่อการรายงานข่าวโมเดลอย่างต่อเนื่อง เสียง AI และทุกสิ่งที่เป็นตัวกำหนดอุตสาหกรรม

อ่านข่าว AI เพิ่มเติม →