ทีมงาน Qwen ของอาลีบาบาได้เปิดตัว Qwen3.8-Omni-Flash โมเดลเนทีฟแบบ Omnimodal เจเนอเรชั่นถัดไปที่ยอมรับอินพุตข้อความ รูปภาพ เสียง และวิดีโอผ่านหน้าต่างบริบท 1 ล้านโทเค็นเพียงหน้าต่างเดียว การเปิดตัวซึ่งมีรายละเอียดอยู่ในบล็อกอย่างเป็นทางการของ Qwen ถือเป็นการผลักดันเชิงรุกของทีมในการเปลี่ยนเสียงและวิดีโอจากอินพุตแบบพาสซีฟให้เป็นสื่อหลักที่เจ้าหน้าที่ AI รับรู้และดำเนินการบนโลก
จากความเข้าใจสื่อไปจนถึงการลงมือปฏิบัติ
เป้าหมายที่ระบุไว้ของ Qwen3.8-Omni-Flash ไม่ใช่แค่ความเข้าใจสื่อที่ดีขึ้นเท่านั้น ทีมงาน Qwen ระบุว่า โมเดลดังกล่าวได้รับการออกแบบมาเพื่อพัฒนาระบบ Omnimodal จาก "การทำความเข้าใจเนื้อหา Omnimodal" ไปจนถึง "การวางแผนงาน การเรียกเครื่องมือ และการทำงานสร้างสรรค์ให้เสร็จสิ้น" ในทางปฏิบัติ นั่นหมายความว่าโมเดลนี้มุ่งเป้าไปที่ขั้นตอนการทำงาน เช่น การตัดต่อวิดีโอ การสร้างมิวสิกวิดีโอ การผลิตภาพยนตร์และการวิจารณ์ การสรุปภาพและเสียง และการสนทนาด้วยเสียงแบบเรียลไทม์
เฟรมเอเจนต์นี้จะแยกรีลีสออกจากโมเดลหลายรูปแบบก่อนหน้านี้ที่ถือว่าเสียงและวิดีโอเป็นอินพุตที่จะถอดเสียงหรืออธิบาย Qwen ให้เหตุผลว่าเสียงและวิดีโอกำลังพัฒนาเป็น "สื่อหลักที่ตัวแทนเข้าใจสภาพแวดล้อม เหตุผล และดำเนินงาน" ซึ่งเป็นคำกล่าวอ้างที่บริษัทสนับสนุนด้วยชุดผลลัพธ์การวัดประสิทธิภาพตัวแทน
ตัวเลขเบื้องหลังการเปิดตัว
จากการประเมิน 29 ครั้ง ซึ่งครอบคลุมการใช้เหตุผลด้านเสียง การใช้เหตุผลด้านภาพและเสียง และการวัดประสิทธิภาพด้านภาพและเสียง Qwen กล่าวว่าคะแนนเฉลี่ยของโมเดลนี้เพิ่มขึ้นมากกว่า 25% เมื่อเทียบกับ Qwen3.5-Omni-Plus รุ่นก่อน ผลลัพธ์พาดหัวที่รายงานในบล็อกของ Qwen ได้แก่:
- เพิ่มขึ้น 36.5 คะแนนสำหรับ WildClawBench-MM และ 22.3 คะแนนสำหรับ AgenticVBench ซึ่งเป็นเกณฑ์มาตรฐานสองรายการสำหรับเอเจนต์ภาพและเสียง และคะแนน 69.6 บน UniClawBench
- การปรับปรุง LongAudioSpan เพิ่มขึ้น 8.3 จุด และ OmniVideoBench เพิ่มขึ้น 9.6 จุด เพื่อความเข้าใจเกี่ยวกับเสียงและวิดีโอในรูปแบบยาว
- อัตราข้อผิดพลาดลดลงอย่างมากในการถอดเสียงการประชุมที่มีลำโพงหลายตัว: AliMeeting DER และ cpWER ของโมเดลลดลงจาก 88.11 และ 89.61 เป็น 3.35 และ 17.18 ตามลำดับ
ในด้านการแข่งขัน Qwen ทำการเปรียบเทียบโดยตรงกับข้อเสนอของ Google: บริษัทอ้างว่าประสิทธิภาพภาพและเสียงใกล้เคียงกับ Gemini 3.8 Flash และประสิทธิภาพเสียงโดยรวมนั้นเหนือกว่า การตรวจสอบการเปรียบเทียบเหล่านั้นโดยอิสระจะใช้เวลา แต่ความเฉพาะเจาะจงของการอ้างสิทธิ์ในเกณฑ์มาตรฐานส่งสัญญาณว่า Qwen พิจารณาว่าโมเดลดังกล่าวมีการแข่งขันในระดับแนวหน้าของงานทุกรูปแบบ
หน้าต่าง 1M-Token สำหรับชั่วโมงแห่งสื่อ
หน้าต่างบริบทแบบรวม 1 ล้านโทเค็นถือเป็นคุณสมบัติที่ใช้งานได้จริงที่สุดของการเปิดตัว เนื่องจากเสียงและวิดีโอใช้โทเค็นเร็วกว่าข้อความมาก โมเดลต่อเนื่องหลายรูปแบบในการผลิตจึงรองรับสื่อได้เพียงไม่กี่นาทีในแต่ละครั้ง หน้าต่างบริบทเจ็ดหลักช่วยให้โมเดลสามารถเก็บบันทึกการประชุมหลายชั่วโมง ฟุตเทจวิดีโอเพิ่มเติม หรือเอกสารสื่อผสมขนาดใหญ่ในเซสชันเดียวโดยไม่เกิดเป็นก้อน
Qwen ตั้งข้อสังเกตว่าโมเดลนี้รักษาประสิทธิภาพของข้อความไว้ได้เทียบเท่ากับโมเดลข้อความอย่างเดียวที่มีขนาดเท่ากัน โดยจัดการกับข้อเสียทั่วไปที่การฝึกอบรมแบบ Omnimodal ทำให้ความสามารถทางภาษาล้วนๆ ลดลง
ลดราคา 98% สำหรับอินพุตเสียง
การกำหนดราคาเป็นจุดที่ Alibaba ใช้แรงกดดันมากที่สุด ตามบล็อก ราคา API ต่อชั่วโมงของอินพุตเสียงลดลงมากกว่า 98% เมื่อเทียบกับ Qwen3.5-Omni-Plus ในขณะที่ราคาต่อชั่วโมงของอินพุตเสียงและภาพลดลงมากกว่า 93% หมายเหตุวิธีการของบริษัทระบุว่าราคารายชั่วโมงประมาณ 30 เท่าของต้นทุนอินพุตของแหล่งข้อมูลสองนาที โดยอินพุตภาพและเสียงคำนวณที่ 720p และ 1 เฟรมต่อวินาที
สำหรับนักพัฒนาที่สร้างตัวแทนเสียง ผู้สรุปการประชุม หรือไปป์ไลน์การวิเคราะห์สื่อ ต้นทุนอินพุตมักเป็นข้อจำกัดที่มีผลผูกพันในระดับหนึ่ง การลดราคาแบบสองลำดับความสำคัญทำให้เกิดการเปลี่ยนแปลงว่าผลิตภัณฑ์ใดสามารถนำไปใช้ได้ในเชิงเศรษฐกิจ ซึ่งเป็นการเปลี่ยนแปลงแบบเดียวกับที่ขับเคลื่อนคลื่นลูกแรกของ API การอนุมานข้อความราคาถูก
ความพร้อมใช้งานและระบบนิเวศ
Qwen3.8-Omni-Flash พร้อมใช้งานแล้วบนแพลตฟอร์ม Qianwen AI พร้อมการเข้าถึง API ผ่าน Alibaba Cloud Model Studio รวมถึงจุดสิ้นสุดเรียลไทม์เฉพาะสำหรับกรณีการใช้งานเชิงสนทนา ทีมงานยังได้เผยแพร่การสนับสนุนเครื่องมือโอเพ่นซอร์สบน GitHub รวมถึงชุดประเมินผล Qwen-Live-Harness และ Qwen-MM-Plugins ซึ่งช่วยให้นักพัฒนามีจุดเริ่มต้นในการสร้างเอเจนต์แบบมีเดียเนทีฟเหนือโมเดล
การเปิดตัวดังกล่าวเกิดขึ้นอย่างเงียบๆ ในช่วงต้นสัปดาห์ แต่ได้รับความสนใจอย่างมากในชุมชนนักพัฒนาในช่วงไม่กี่วันที่ผ่านมา ทำให้เกิดการอภิปรายขนาดใหญ่เกี่ยวกับข่าวแฮ็กเกอร์และการรายงานข่าวจากแหล่งเทคโนโลยีที่ติดตามระบบนิเวศแบบเปิด
ความหมายสำหรับการแข่งขัน Omnimodal
การเปิดตัวดังกล่าวยังคงเป็นการสานต่อกลยุทธ์ของอาลีบาบาในการจับคู่การกำหนดราคาเชิงรุกกับเกณฑ์มาตรฐานที่แข่งขันได้ทั่วทั้งตระกูล Qwen ซึ่งเป็นหนึ่งในกลุ่มผลิตภัณฑ์รุ่นเปิดที่มีการดาวน์โหลดมากที่สุดทั่วโลกหลายครั้ง ด้วย Qwen3.8-Omni-Flash บริษัทกำลังวางเดิมพันว่าสมรภูมิต่อไปไม่ใช่การแชทด้วยข้อความ แต่เป็นเจ้าหน้าที่ที่สามารถรับชม ฟัง และดำเนินการได้ เช่น ตัดต่อฟุตเทจ สรุปการประชุม และจัดการสนทนาด้วยเสียงแบบเรียลไทม์เป็นความสามารถแบบผสานรวมในที่เดียว
สำหรับ Google ซึ่งมี Gemini 3.8 Flash เป็นจุดเปรียบเทียบที่ชัดเจน ข้อความก็คือพรมแดนแบบ omni-modal ไม่ใช่การแข่งม้าสองตัวระหว่างห้องปฏิบัติการของสหรัฐอเมริกาอีกต่อไป สำหรับนักพัฒนา การผสมผสานระหว่างหน้าต่างมัลติโมดัลโทเค็น 1M และอินพุตเสียงที่แทบไม่มีเสียงจะช่วยลดอุปสรรคสำหรับผลิตภัณฑ์เอเจนต์ภาพและเสียงประเภทที่ไม่สามารถให้บริการได้ในวงกว้างเมื่อไม่กี่เดือนก่อน
การกล่าวอ้างเกณฑ์มาตรฐานของ Qwen อยู่ภายใต้การประเมินโดยอิสระหรือไม่ จะเป็นตัวกำหนดว่าอุตสาหกรรมจะปฏิบัติต่อการเดิมพันนั้นอย่างจริงจังเพียงใด แต่ทิศทางของการเดินทางนั้นชัดเจน: ทีมที่สร้างโมเดลชายแดนตอนนี้มองเห็นหูและตา — ไม่ใช่แค่กล่องข้อความ — เป็นอินเทอร์เฟซเริ่มต้นสำหรับตัวแทน AI
ก้าวนำหน้า AI
การแข่งขันแบบ Omnimodal กำลังเร่งขึ้นทุกสัปดาห์ หากต้องการทราบข่าวสาร AI ด่วนเพิ่มเติม การวิเคราะห์เชิงลึกเกี่ยวกับการเปิดตัวโมเดลใหม่ และการครอบคลุมเครื่องมือที่กำหนดรูปแบบอุตสาหกรรม อ่านข่าว AI เพิ่มเติม →
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →