OpenAI กำลังนำฟีเจอร์เอเจนต์แบบเสียงมาสู่แอปมือถือ ChatGPT เพื่อให้ผู้ใช้สามารถเรียกใช้งานจริงได้ เช่น ร่างเอกสาร สรุปอีเมล สร้างงานนำเสนอ เพียงแค่พูดคุย บริษัทประกาศเมื่อวันพุธ ตามรายงานของ TechCrunch
การเปิดตัวดังกล่าวขยายไปถึงความสามารถของสมาร์ทโฟนที่ OpenAI นำเสนอบนเดสก์ท็อปก่อนหน้านี้ และจะเริ่มขึ้นเมื่อเสียงกลายเป็นหนึ่งในวิธีที่ผู้ใช้โต้ตอบกับผู้ช่วย AI สำหรับงานที่ซับซ้อนที่เติบโตเร็วที่สุด
สิ่งที่สมาชิกสามารถทำได้ด้วยเสียง
สมาชิก Plus และ Pro จะสามารถใช้แท็บงานในแอปมือถือ ChatGPT เพื่อสร้างเอกสาร ร่างอีเมล หรือสรุปข้อความ Slack ด้วยเสียง เวิร์กโฟลว์เสียงแบบเดียวกันครอบคลุมงานที่หนักกว่าที่แท็บงานรองรับอยู่แล้ว เช่น การสร้างไซต์ การสร้างงานนำเสนอ การใช้เบราว์เซอร์คลาวด์ และการเจาะลึกข้อมูลด้านการเงินของ ChatGPT
ผู้ใช้ Free and Go จะได้รับการอัปเดตที่แคบลง ทำให้สามารถทำงานกับปลั๊กอินและแอปที่เชื่อมต่อได้
OpenAI กล่าวว่าการสนทนาด้วยเสียงจะสร้างข้อความที่สมบูรณ์ยิ่งขึ้น และผู้ใช้สามารถสลับไปมาระหว่างโหมดเสียงและข้อความได้อย่างราบรื่น บางทีอาจเป็นส่วนเสริมที่ใช้งานได้จริงที่สุดสำหรับผู้ที่ต้องเดินทางและเดสก์ท็อป: การสนทนาที่เริ่มต้นขณะเดินทางสามารถกลับมาดำเนินการต่อได้ในภายหลังในแอปเดสก์ท็อป
เส้นทางจาก GPT-Live สู่ตัวแทนมือถือ
การอัปเดตเป็นบทมือถือของเรื่องราวของ OpenAI ที่เริ่มขึ้นในเดือนกรกฎาคม เมื่อเปิดตัว GPT-Live ซึ่งเป็นรูปแบบการสนทนาใหม่ และต่อมาได้เชื่อมต่อเข้ากับแอปเดสก์ท็อป เพื่อให้ผู้ใช้สามารถทำงานแท็บงานให้เสร็จสิ้น และสร้างแอปในแท็บ Codex ด้วยเสียง การประกาศในวันพุธปิดการวนซ้ำด้วยการนำการดำเนินการที่ขับเคลื่อนด้วยเสียงแบบเดียวกันมาสู่โทรศัพท์
ทำไมตัวแทนเสียงบนมือถือจึงมีความสำคัญ
การเปลี่ยนแปลงนี้สะท้อนถึงการเปลี่ยนแปลงรูปแบบการใช้งาน ผู้ใช้จำนวนมากขึ้นหันมาใช้เสียงเพื่อออกคำสั่งให้กับผู้ช่วย AI สำหรับงานที่ซับซ้อน และโทรศัพท์คือจุดที่คำสั่งเหล่านั้นเกิดขึ้นตามธรรมชาติมากที่สุด ระหว่างการประชุม ในรถยนต์ หรือขณะอยู่นอกแป้นพิมพ์
จนถึงขณะนี้ ฟีเจอร์เอเจนต์ที่ทรงพลังที่สุดใน ChatGPT ใช้งานบนเดสก์ท็อป ผู้ใช้ที่ต้องการให้ ChatGPT สร้างงานนำเสนอหรือค้นคว้าข้อมูลหลายขั้นตอนจะต้องอยู่หน้าคอมพิวเตอร์โดยพิมพ์คำแนะนำลงในแท็บงาน สำหรับความนิยมทั้งหมด แอปบนอุปกรณ์เคลื่อนที่ถือเป็นส่วนการสนทนาเป็นส่วนใหญ่ การอัปเดตในวันพุธทำลายความแตกต่างนั้น: โทรศัพท์กลายเป็นสถานที่ที่ถูกต้องตามกฎหมายในการเริ่มต้นงานที่สำคัญโดยมีช่องเสียงเป็นอินเทอร์เฟซ
การแบ่งการสมัคร
การเปิดตัวนี้ยังทำให้เส้นแบ่งระหว่างระดับการสมัครรับข้อมูลของ ChatGPT ชัดเจนขึ้นอีกด้วย สมาชิก Plus และ Pro — แผนที่มีขีดจำกัดการใช้งานสูงสุดอยู่แล้วและเข้าถึงโมเดลที่มีความสามารถมากที่สุดของ OpenAI — รับประสบการณ์แท็บงานที่ขับเคลื่อนด้วยเสียงเต็มรูปแบบ รวมถึงการสร้างเอกสาร การร่างอีเมล และการสรุป Slack พวกเขายังสามารถสร้างไซต์ สร้างงานนำเสนอ ใช้เบราว์เซอร์ระบบคลาวด์ และเข้าถึงส่วนการเงินของ ChatGPT ได้ด้วยเสียง
ผู้ใช้ Free and Go จะได้รับชุดความสามารถที่จำกัดมากขึ้นซึ่งมีศูนย์กลางอยู่ที่ปลั๊กอินและแอปที่เชื่อมต่อ การจัดระดับดังกล่าวเป็นไปตามรูปแบบที่คุ้นเคยสำหรับ OpenAI: พิสูจน์ความสามารถบนเดสก์ท็อป จากนั้นนำเวอร์ชันมือถือที่มีคุณสมบัติที่มีค่าที่สุดผลักดันผู้ใช้ไปสู่แผนแบบชำระเงิน สำหรับ OpenAI การเคลื่อนไหวดังกล่าวจะทำให้คูน้ำรอบระดับที่ชำระเงินลึกขึ้นในขณะที่คู่แข่งกำลังดึงดูดผู้ใช้รายเดียวกันอย่างจริงจัง
เปรียบเทียบกับแนวทางของ Anthropic อย่างไร
ฉากหลังของการแข่งขันมีความสำคัญที่นี่ TechCrunch ตั้งข้อสังเกตว่าเมื่อเร็ว ๆ นี้ Anthropic ทำให้การส่งต่อระหว่างอุปกรณ์เคลื่อนที่และเดสก์ท็อปง่ายขึ้นสำหรับผู้ใช้ของตนเอง และรวมอินเทอร์เฟซ Cowork และ Chat ไว้ในประสบการณ์เดียว ในทางตรงกันข้าม OpenAI ยังคงแยกการแชทและพื้นที่ทำงานออกจากกัน ซึ่งเป็นการแยกผลิตภัณฑ์โดยเจตนาซึ่งทำให้การสนทนาทั่วไปแตกต่างจากพื้นที่ทำงานที่มีไฟล์ โปรเจ็กต์ และเครื่องมืออยู่
ทั้งสองบริษัทกำลังดำเนินการทดลองที่ตรงกันข้ามในการออกแบบเวิร์กโฟลว์ผู้ช่วย AI อย่างมีประสิทธิภาพ อินเทอร์เฟซที่ผสานรวมของ Anthropic เดิมพันว่าผู้ใช้ต้องการพื้นผิวที่เป็นหนึ่งเดียวที่ติดตามพวกเขาผ่านอุปกรณ์ต่างๆ เดิมพันของ OpenAI คือการแชทและพื้นที่ทำงานที่มีโครงสร้างจะตอบสนองความต้องการที่แตกต่างกัน และควรคงความแตกต่างไว้ โดยที่เสียงทำหน้าที่เป็นเนื้อเยื่อเกี่ยวพัน เริ่มงานด้วยการพูดคุยบนมือถือ ปรับแต่งด้วยคีย์บอร์ดบนเดสก์ท็อป
จะดูอะไรต่อไป
คำถามถัดไปที่ชัดเจนคือตัวแทนเสียงเดินทางจากแท็บงานไปไกลแค่ไหน การบูรณาการเดสก์ท็อปของ OpenAI เข้าถึง Codex แล้ว ซึ่งเป็นเครื่องมือสร้างแอป และความเท่าเทียมกันของอุปกรณ์เคลื่อนที่จะเปลี่ยนโทรศัพท์ให้กลายเป็นพื้นที่การพัฒนาเต็มรูปแบบ OpenAI ยังไม่ได้ประกาศกำหนดเวลาสำหรับสิ่งนั้น
ความน่าเชื่อถือยังไม่ได้รับการแก้ไขเช่นกัน งานเสียงแบบตัวแทน — การร่าง การสรุป และการเรียกดู — เกี่ยวข้องกับการดำเนินการหลายขั้นตอนที่ข้อผิดพลาดเกิดขึ้น และสภาพแวดล้อมแบบเคลื่อนที่ทำให้เกิดการหยุดชะงักและการสลับบริบท ประสบการณ์การใช้งานตั้งแต่เนิ่นๆ จะเป็นตัวกำหนดว่างานที่ขับเคลื่อนด้วยเสียงจะกลายเป็นกิจวัตรประจำวันหรือยังคงเป็นฟีเจอร์ที่เป็นมิตรกับผู้ใช้
ไม่ว่าจะด้วยวิธีใด ทิศทางการเดินทางก็ชัดเจน: ผู้ช่วยที่ตอบคำถามด้วยเสียงเมื่อสองปีที่แล้วคาดว่าจะทำงานให้เสร็จสิ้นก่อนที่คุณจะไปถึงโต๊ะของคุณ ด้วยการอัปเดตวันพุธ ผู้ใช้มือถือของ OpenAI สามารถเริ่มต้นงานนั้นด้วยประโยค และรับงานบนหน้าจอที่ใหญ่ขึ้นเมื่อมาถึง
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →