ห้องปฏิบัติการ AI ของจีน DeepSeek ได้เปิดตัว V4.1-Flash ซึ่งเป็นโมเดล Open Weight หลายรูปแบบที่จับคู่แบ็คโบนพารามิเตอร์ 552 พันล้านกับการบีบอัดหน่วยความจำที่เข้มข้นที่สุดบางส่วนที่ยังจัดส่งในระบบระดับแนวหน้า โมเดลดังกล่าวเผยแพร่เมื่อวันพุธด้วยใบอนุญาต MIT บน Hugging Face และรายงานทางเทคนิคที่เกี่ยวข้อง สำนักข่าวรอยเตอร์รายงาน โดยครอบคลุมหัวข้อข่าวสำหรับห้องปฏิบัติการในหางโจว
การเปิดตัวเป็นมากกว่าเวอร์ชันทั่วไป DeepSeek ได้เลิกใช้ระดับเรือธง V4 Pro ไปพร้อมๆ กัน และ TechNode รายงานว่าคำขอไปยัง V4 Pro กำลังถูกส่งไปยัง V4.1-Flash ซึ่งเป็นคำยืนยันความมั่นใจที่ชัดเจนในรุ่นที่มีชื่อ "Flash" แต่ยังโพสต์ตัวเลขมาตรฐานที่หรือสูงกว่ารุ่นที่จะมาแทนที่ For more context on this story, see our ongoing more AI stories.
"แฟลช" ที่ใหญ่กว่าพร้อมค่าหน่วยความจำที่น้อยกว่า
ตามการ์ดโมเดลอย่างเป็นทางการ DeepSeek-V4.1-Flash เป็นโมเดล Mixture-of-Experts (MoE) ที่มีพารามิเตอร์แกนหลัก 552 พันล้านพารามิเตอร์ พร้อมด้วยส่วนประกอบหน่วยความจำแบบมีเงื่อนไข "Engram" 196 พันล้านพารามิเตอร์ที่เข้าถึงได้กระจัดกระจายผ่านการค้นหาตามโทเค็น แม้จะมีขนาดที่แท้จริง โมเดลจะเปิดใช้งานเพียง 8 พันล้านพารามิเตอร์ต่อโทเค็นระหว่างการเติมล่วงหน้า และ 16 พันล้านระหว่างการถอดรหัส — พารามิเตอร์ที่ใช้งานน้อยกว่าพารามิเตอร์ 284B รุ่นก่อน ซึ่งดำเนินการคงที่ 13 พันล้าน
จุดศูนย์กลางทางสถาปัตยกรรมคือสิ่งที่ DeepSeek เรียกว่าการออกแบบ ตัวเข้ารหัสเชิงสาเหตุ (CED): หม้อแปลง 40 เลเยอร์แบ่งออกเป็นตัวเข้ารหัสเชิงสาเหตุ 20 เลเยอร์ ตามด้วยตัวถอดรหัส 20 เลเยอร์ เนื่องจากแคช KV ส่วนกลางของตัวถอดรหัสถูกคาดการณ์จากสถานะที่ซ่อนอยู่ของตัวเข้ารหัสขั้นสุดท้าย แทนที่จะสะสมทีละชั้น หน่วยความจำที่จำเป็นในการรักษาการสนทนาที่ยาวนานจึงหดตัวลงอย่างมาก
หมายเลขการบีบอัดเป็นพาดหัว ด้วยการแคช KV หลัก FP4 ในรูปแบบ E2M1 ปริมาณแคช KV ทั่วโลกจะลดลงเหลือ 890 ไบต์ต่อโทเค็น หรือประมาณหนึ่งในสี่ของ DeepSeek-V4-Flash เทคนิคที่เรียกว่า SWA Bounded Replay จะสร้างสถานะความสนใจที่ขาดหายไปขึ้นมาใหม่โดยการเล่นซ้ำเฉพาะหน้าต่างโทเค็นล่าสุด โดยตัดแคช KV ถาวรให้เหลือประมาณหนึ่งในแปดของ Flash รุ่นก่อนหน้า ตามการ์ดโมเดล การลดลงประมาณสี่เท่าเมื่อเทียบกับ V4-Flash และ 437 เท่าเมื่อเทียบกับ DeepSeek-V1 ส่วนประกอบเพิ่มเติม ได้แก่ Compressed Sparse Attention 2 (CSA2) ซึ่งกำหนดเลเยอร์ความสนใจแต่ละเลเยอร์หนึ่งในสามโหมดคงที่ และการถอดรหัสแบบคาดเดา DSpark เพื่อการสร้างที่เร็วขึ้น
ภายใต้ฝากระโปรง แต่ละเลเยอร์ MoE จะรวมผู้เชี่ยวชาญหนึ่งคนที่ใช้ร่วมกันเข้ากับผู้เชี่ยวชาญที่กำหนดเส้นทาง 384 คน โดยเปิดใช้งานผู้เชี่ยวชาญที่กำหนดเส้นทางหกคนต่อโทเค็น
เกณฑ์มาตรฐาน: นำหน้าเรือธงที่เกษียณแล้ว
จากการประเมินโมเดลพื้นฐานในรายงานทางเทคนิค V4.1-Flash ได้เหนือกว่า V4 Pro ที่ใหญ่กว่ามากในการทดสอบที่สำคัญหลายรายการ: 74.1 บน MMLU-Pro เทียบกับ 73.5, 79.4 บน HumanEval เทียบกับ 76.8, 60.6 บน BigCodeBench และ 93.0 บน GSM8K South China Morning Post รายงานว่า DeepSeek กล่าวว่าโมเดลใหม่ เหนือกว่า Kimi K3 ในเกณฑ์มาตรฐานทางไซเบอร์และการเข้ารหัส ซึ่งเป็นข้อกล่าวอ้างที่โดดเด่นในสาขาโมเดลโอเพ่นของจีน ซึ่งรวมถึง GLM-5.3 ของ Z.ai และกลุ่ม Qwen ของ Alibaba ด้วย
ด้วยความพยายามในการให้เหตุผลสูงสุด โมเดลการสอนได้คะแนน 90.9 ใน GPQA Diamond ซึ่งน่าประทับใจ แม้ว่าจะยังตามหลังระบบชั้นนำที่อ้างอิงในตารางเปรียบเทียบของ DeepSeek GPT-5.6 Sol ที่ 94.1 และ Claude Opus 5.0 ที่ 93.4 Kimi K3 อยู่ที่ 92.9 อ่านอย่างตรงไปตรงมา: นี่คือโมเดลที่อยู่ติดชายแดนในราคาแบบเปิด ไม่ใช่การกวาดล้างห้องปฏิบัติการแบบปิดอย่างหมดจด
V4.1-Flash ยังเป็น multimodal อย่างแท้จริงอีกด้วย เครื่องเข้ารหัสการมองเห็น DeepSeek-ViT ที่ได้รับการฝึกตั้งแต่เริ่มต้น ฟีดภาพผ่านโปรเจ็กเตอร์ 2 ชั้น และแบบจำลองนี้ได้รับการฝึกฝนเกี่ยวกับข้อความและรูปภาพร่วมกันตั้งแต่เริ่มต้นการฝึกอบรมล่วงหน้า ได้คะแนน 56.5 บน MMMU-Pro และ 95.6 บน DocVQA
สร้างขึ้นเพื่อตัวแทน ราคาตามปริมาณ
ตัวเลือกการออกแบบทำให้กลุ่มเป้าหมายชัดเจน: ปริมาณงานแบบเอเจนต์ โดยที่แบบจำลองอ่านบริบทจำนวนมหาศาลและดำเนินการในขอบเขตอันยาวไกล โมเดลนี้รองรับหน้าต่างบริบทสูงสุด หนึ่งล้านโทเค็น ได้รับการฝึกฝนบนคลังข้อมูลหลายรูปแบบ 45 ล้านล้านโทเค็น และเสนอการหมุนหมายเลขความพยายามในการให้เหตุผลที่ควบคุมได้อย่างต่อเนื่องตั้งแต่ 1 ถึง 100 ซึ่งแลกเปลี่ยนต้นทุนการอนุมานกับความแม่นยำ ความครอบคลุมของตัวถอดรหัสเน้นย้ำว่าการประหยัดหน่วยความจำจะช่วยลดต้นทุนในการเรียกใช้เอเจนต์ AI โดยเฉพาะ ซึ่งเป็นปริมาณงานที่ใช้เวลาในการอ่านอินพุตมากกว่าการสร้างเอาต์พุต
ปฏิกิริยาของชุมชนได้รับการเน้นย้ำ กระทู้เปิดตัวใน Hacker News ได้รับคะแนนมากกว่า 650 คะแนน และหัวข้อก่อนหน้านี้ชื่อ "DeepSeek เปิดตัว v4.1 flash ราคาถูกกว่าและมีความสามารถมากกว่า v4 pro" รวบรวมได้เกือบ 400 คะแนน ผู้แสดงความเห็นที่ใช้โมเดลในพื้นที่ตั้งข้อสังเกตว่าพารามิเตอร์ Engram สามารถถ่ายโอนไปยัง SSD ที่รวดเร็วได้ เปิดเส้นทางสู่การอนุมานใกล้ขอบเขตบนฮาร์ดแวร์สำหรับผู้บริโภค
Seeking Alpha วางกรอบการเดิมพันทางการค้าอย่างตรงไปตรงมา โดยเรียกมันว่า แบบจำลองต้นทุนต่ำพิเศษที่นำเสนอความท้าทายสำหรับห้องปฏิบัติการชายแดนของสหรัฐอเมริกา — สิ่งเตือนใจว่าสงครามราคาในการอนุมาน AI ไม่แสดงสัญญาณของการเย็นลง
ช่วงเวลาที่ตั้งใจสำหรับการประกาศ
จังหวะเวลากำลังบอก หนึ่งวันก่อนการเปิดตัว Reuters รายงานว่า DeepSeek ได้ติดต่อกับ CITIC Securities เพื่อจัดเตรียมการเสนอขายหุ้น IPO ในตลาด STAR ของเซี่ยงไฮ้ หลังจากรายงานก่อนหน้านี้ว่ารายได้ของห้องปฏิบัติการเพิ่มขึ้นสิบเท่าก่อนที่จะมีรายชื่อที่เป็นไปได้ การจัดส่งโมเดลแบบเปิดที่พาดหัวข่าวในไม่กี่วันต่อมาช่วยให้โมเมนตัมนั้นดำเนินต่อไป
การเปิดตัวดังกล่าวยังเกิดขึ้นท่ามกลางการตรวจสอบบริษัท AI ของจีนที่เข้มข้นขึ้น เมื่อต้นสัปดาห์นี้ หน่วยงานของสหรัฐฯ รวมถึง NSA, CISA และ FBI ตั้งชื่อบริษัท AI ของจีน 6 แห่งเพื่อเป็นที่ปรึกษาเกี่ยวกับการกลั่นแบบจำลองระดับอุตสาหกรรม ซึ่งเป็นเครื่องเตือนใจว่าชัยชนะทางเทคนิคของ DeepSeek มาถึงพร้อมกับปัญหาทางภูมิรัฐศาสตร์แล้ว
ไม่มีสิ่งใดที่ทำให้เรื่องราวทางวิศวกรรมหรี่ลง เมื่อ V4 Pro เลิกให้บริการแล้วและการรับส่งข้อมูลถูกกำหนดเส้นทางไปยังโมเดลที่ราคาถูกกว่าและแข็งแกร่งกว่า DeepSeek ได้ให้ข้อโต้แย้งที่ชัดเจนที่สุดเท่าที่จะเป็นไปได้ว่าในปี 2026 ขอบเขตที่น่าสนใจของ AI ไม่เพียงแต่จะเป็นผู้สร้างโมเดลที่ใหญ่ที่สุดเท่านั้น แต่ยังเป็นผู้ที่ทำหน้าที่ต่อความสามารถสูงสุดต่อกิกะไบต์ของหน่วยความจำด้วย
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →