ทีม Qwen ของอาลีบาบาได้เปิดตัว Qwen3.8-Flash-Next ในวันพุธ ซึ่งเป็นโมเดลที่ผสมผสานโดยผู้เชี่ยวชาญหลายรูปแบบซึ่งเพิ่มเป็นสองเท่าของการดูตัวอย่างสถาปัตยกรรมของ Qwen4 ที่กำลังจะมาถึง และให้ผลลัพธ์ที่บริษัทบอกว่าเอาชนะ Qwen3.7-Plus ที่ใหญ่กว่ามากด้วยต้นทุนการฝึกอบรมประมาณหนึ่งในเก้า สำนักข่าวรอยเตอร์, Bloomberg และ The Decoder ต่างกล่าวถึงการเปิดตัวครั้งนี้ ซึ่งทำให้ Hugging Face และ ModelScope มีน้ำหนักแบบเปิดในวันเดียวกับที่ Z.ai จัดส่งโมเดลแบบเปิดที่อยู่ติดชายแดนของตัวเอง ติดตาม ข่าว AI ด่วน ในขณะที่การแข่งขันแบบโอเพ่นเวทกำลังดำเนินไปอย่างรวดเร็ว

สถาปัตยกรรมใหม่ขนาดจิ๋ว

ข้อกำหนดพาดหัวคือประสิทธิภาพ Qwen3.8-Flash-Next มีพารามิเตอร์ทั้งหมด 125 พันล้านพารามิเตอร์ แต่เปิดใช้งานเพียง 6 พันล้านต่อโทเค็น สำหรับการเปรียบเทียบ Qwen3.7-Plus ซึ่งเป็นโมเดลที่มีประสิทธิภาพเหนือกว่าเกณฑ์มาตรฐานที่เผยแพร่ของ Alibaba มีพารามิเตอร์ทั้งหมด 397 พันล้านพารามิเตอร์ โดยมีการเปิดใช้งาน 17 พันล้านครั้งต่อโทเค็น ซึ่งเกือบสามเท่าของจำนวนการใช้งานของ Flash-Next

ชิ้นส่วนที่น่าสนใจทางเทคนิคที่สุดคือเลเยอร์การฝัง N-gram ใหม่ที่มีพารามิเตอร์ 51 พันล้านพารามิเตอร์ เลเยอร์จะจัดเก็บกลุ่มคำทั่วไปเป็นรายการแบบสแตนด์อโลนในสิ่งที่ Matthias Bastian จาก The Decoder อธิบายว่าเป็น "พจนานุกรมวลี" โดยให้ข้อมูลระดับวลีในจุดเริ่มต้นของเครือข่าย สิ่งสำคัญที่สุดคือมันอยู่ใน RAM ของระบบปกติมากกว่าในหน่วยความจำ GPU ที่มีราคาแพง ซึ่งเป็นสิ่งที่ทีมงาน Qwen เรียกว่ามีค่าใช้จ่ายเพิ่มเติมที่ค่อนข้างต่ำ ซึ่งเป็นนวัตกรรมทางสถาปัตยกรรมที่มีกำหนดจะนำไปใช้ใน Qwen4

โมเดลนี้รองรับหน้าต่างบริบท 262,144 โทเค็นโดยธรรมชาติ และปรับขนาดเป็น 1 ล้านโทเค็นโดยใช้ส่วนขยายบริบทแบบยาวของ YaRN รายงานทางเทคนิคเผยแพร่บน GitHub

เกณฑ์มาตรฐาน: การเขียนโค้ดและงานในสำนักงาน

เกณฑ์มาตรฐานของ Alibaba ได้แก่ Flash-Next เทียบกับ DeepSeek-V4-Flash (พารามิเตอร์ 284 พันล้านพารามิเตอร์ 13 พันล้านที่ใช้งานอยู่) และ Claude Opus 4.6 (สูงสุด) ของ Anthropic แม้ว่าคู่แข่งทั้งสองจะมีขนาดใหญ่กว่าหรือมีราคาแพงกว่ามาก แต่ Flash-Next เป็นผู้นำในงานที่ได้รับการทดสอบส่วนใหญ่ โดยได้รับผลประโยชน์สูงสุดในด้านการเขียนโค้ดและประสิทธิภาพการทำงานในสำนักงาน

สำหรับการเข้ารหัสแบบเอเจนต์ Flash-Next ได้คะแนน 58.7 บน DeepSWE 1.1 และ 62.5 บน SWE-bench Pro ซึ่งเหนือกว่าทั้ง DeepSeek-V4-Flash และ Claude Opus 4.6 ช่องว่างในงานในสำนักงานยังกว้างกว่า: 73.9 บน CoWorkBench เทียบกับ 45.1 สำหรับ DeepSeek-V4-Flash และ 55.7 บน JobBench — เกือบสองเท่าของ Qwen3.7-Plus ที่ 27.6 การใช้เหตุผลเชิงวิทยาศาสตร์มีการจับคู่กันอย่างใกล้ชิดในทุกสาขา โดย Flash-Next ที่ 91.7 บน GPQA Diamond และ 91.9 บน LiveCodeBench v6 Claude Opus 4.6 ออกมาเหนือกว่า Humanity's Last Exam 40.0 ถึง 35.9 เท่านั้น และเป็นรุ่น Anthropic รุ่นเก่าตั้งแต่เดือนกุมภาพันธ์ 2026 เช่นเคย คะแนนเกณฑ์มาตรฐานที่เผยแพร่และประสิทธิภาพในโลกแห่งความเป็นจริงอาจแตกต่างกันออกไป เช่นเคย

แรงกดดันด้านราคาต่อคู่แข่งทุกราย

เวอร์ชันที่ใช้งานจริงจัดส่งในรูปแบบ Qwen3.8-Flash ผ่าน QwenCloud โดยมีราคาอยู่ที่ 0.16 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้าน และ 0.47 ดอลลาร์ต่อโทเค็นเอาต์พุตหนึ่งล้าน ซึ่งบั่นทอนแม้แต่ GLM-5.3-Flash ของ Z.ai ซึ่งเปิดตัวในวันเดียวกันที่ 0.15 ดอลลาร์และ 0.50 ดอลลาร์ตามลำดับ ซึ่งมีความเท่าเทียมกันอย่างมีประสิทธิภาพที่ด้านล่างของตลาด

ช่องว่างระหว่างเรือธงของอาลีบาบานั้นชัดเจน Qwen3.8-Max เปิดตัวเมื่อต้นเดือนสิงหาคมเพื่อแข่งขันกับ Claude Opus 4.8, Gemini 3.1 Pro และ GPT-5.6 Sol มีราคา 2.00 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้าน และ 6.00 ดอลลาร์ต่อโทเค็นเอาต์พุตหนึ่งล้าน Flash-Next มีประสิทธิภาพต่ำกว่ารุ่นเรือธงเล็กน้อย ตามตัวเลขของ Alibaba ในราคาประมาณหนึ่งในสิบสองของราคาทั้งอินพุตและเอาท์พุต

บริบทที่ยาวเพิ่มคุณค่าในทางปฏิบัตินอกเหนือจากเอกสารข้อมูลจำเพาะ ด้วยโทเค็นดั้งเดิม 262,144 คำขอ คำขอเดียวสามารถเก็บที่เก็บโค้ดขนาดใหญ่หลายแห่ง ชุดสัญญาฉบับเต็ม หรือชั่วโมงการประชุมที่ถอดเสียงได้ ขยายเป็นหนึ่งล้านโทเค็นด้วย YaRN การวิเคราะห์คลังข้อมูลทั้งหมดจะเป็นไปได้โดยไม่ต้องดึงโครงนั่งร้าน สำหรับปริมาณงานการเขียนโค้ดแบบเอเจนต์ที่ Flash-Next มีคะแนนสูงสุด — การค้นหาและแก้ไขจุดบกพร่องในโครงการซอฟต์แวร์จริงอย่างอิสระ หน้าต่างขนาดใหญ่หมายถึงความล้มเหลวในการจัดการบริบทระหว่างงานน้อยลง ทีมงาน Qwen ยังได้เผยแพร่รายงานทางเทคนิคเกี่ยวกับ GitHub เพื่อเชิญชวนให้มีการตรวจสอบสถาปัตยกรรมอิสระประเภทต่างๆ ที่ห้องปฏิบัติการที่เป็นกรรมสิทธิ์หลีกเลี่ยงได้

เหตุใดการเปิดตัวครั้งนี้จึงมีความสำคัญ

Qwen3.8-Flash-Next เป็นที่เข้าใจกันดีที่สุดว่าเป็นการซ้อมแต่งกายในที่สาธารณะสำหรับ Qwen4 เลเยอร์การฝัง N-gram อัตราส่วนพารามิเตอร์ที่ใช้งานเชิงรุก และการถ่าย RAM ของพารามิเตอร์ขนาดใหญ่แต่ไม่ค่อยมีความจำเป็น เป็นการร่างปรัชญาการออกแบบ: ย้ายความฉลาดต่อดอลลาร์ ไม่ใช่ความฉลาดต่อ GPU การฝึกอบรมโมเดลที่เหนือกว่า Qwen3.7-Plus ในราคาหนึ่งในเก้านั้นถือเป็นความสามารถที่ทำให้รอบการทำซ้ำอย่างรวดเร็วมีราคาไม่แพง และความเร็วในการทำซ้ำซึ่งมากกว่าเกณฑ์มาตรฐานใดๆ คือสิ่งที่ตัดสินว่าใครจะยืนอยู่ที่ชายแดนในปีต่อจากนี้

การมาถึงในวันเดียวกันของโมเดล open-weight สองรุ่นที่ติดชายแดนติดกันจากห้องปฏิบัติการของจีน ได้แก่ GLM-5.3-Flash ของ Z.ai และ Flash-Next ของ Alibaba ก็ถือเป็นการเปลี่ยนแปลงจังหวะเช่นกัน ดังที่ FourWeekMBA สังเกตเห็น ห้องปฏิบัติการของตะวันตกยังคงมีจุดสูงสุดของเกณฑ์มาตรฐาน แต่ขณะนี้ระดับ open-weight จัดส่งคุณภาพที่ใกล้ชายแดนทุกสัปดาห์ ในราคาที่ต่ำกว่าตามลำดับ

สำหรับนักพัฒนา สิ่งที่นำไปใช้ได้จริงนั้นง่ายมาก: ต้นทุนของโมเดลหลายรูปแบบที่มีบริบทยาวและมีความสามารถลดลงอีกครั้ง โดยมีน้ำหนักที่ดาวน์โหลดได้เพื่อเป็นประกันสำหรับผู้ให้บริการรายเดียว สำหรับคู่แข่ง ข้อความนี้ไม่ค่อยสะดวกนัก — ขอบเขตด้านประสิทธิภาพกำลังเคลื่อนไปเร็วกว่าการกำหนดราคาเรือธงที่สามารถติดตามได้จริง และ Alibaba ก็ไม่แสดงสัญญาณของการชะลอตัว

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →