ห้องปฏิบัติการ AI ของจีน DeepSeek ได้เปิดตัว deepseek-v4-flash-vision-exp อย่างเงียบๆ ซึ่งเป็นเวอร์ชันทดลองของรุ่น V4-Flash ที่สามารถรับรูปภาพควบคู่ไปกับข้อความได้ ซึ่งปิดช่องว่างที่เห็นได้ชัดที่สุดแห่งหนึ่งในตระกูลรุ่นเรือธง การเปิดตัวซึ่งบันทึกไว้ในหน้า API อย่างเป็นทางการของบริษัท มาถึงเพียงไม่กี่สัปดาห์หลังจาก V4-Flash-0731 และ V4-Pro-0813 รีเฟรช และช่วยให้นักพัฒนามีวิธีการที่ได้รับการร้องขอมายาวนานในการป้อนภาพหน้าจอ แผนภูมิ และภาพถ่ายโดยตรงไปยังหนึ่งในโมเดล frontier-tier ที่ถูกที่สุดในอุตสาหกรรม สำหรับทีมที่ติดตาม การพัฒนา AI ล่าสุด ถือเป็นสัญญาณอีกประการหนึ่งที่ DeepSeek ตั้งใจที่จะจับคู่ฟีเจอร์สำหรับฟีเจอร์คู่แข่งจากตะวันตก ขณะเดียวกันก็ตัดราคาอย่างดุเดือด
รุ่นใหม่ทำอะไรได้บ้าง
ตามเอกสาร API ของ DeepSeek `deepseek-v4-flash-vision-exp` ช่วยให้ผู้ใช้ "ขอให้โมเดลอธิบายรูปภาพ อ่านข้อความจากภาพหน้าจอ วิเคราะห์แผนภูมิ และอื่นๆ" โมเดลยอมรับไฟล์ JPEG, PNG, GIF และ WebP โดยมีรูปแบบที่ตรวจพบจากเนื้อหาไฟล์จริงแทนที่จะเป็นชื่อไฟล์หรือประเภท MIME ที่ประกาศ ซึ่งเป็นรายละเอียดเล็กๆ น้อยๆ แต่รอบคอบซึ่งป้องกันข้อบกพร่องของส่วนขยายที่ไม่ตรงกัน
นักพัฒนาสามารถส่งรูปภาพได้สามวิธี: URL ข้อมูลอินไลน์ที่เข้ารหัส base64 (ขึ้นอยู่กับขีดจำกัดเนื้อหาคำขอ 48 MiB), URL ภายนอกที่เข้าถึงได้แบบสาธารณะ (สูงสุด 8,192 อักขระ, 32 MiB ต่อรูปภาพ พร้อมหน้าต่างดาวน์โหลด 60 วินาที) หรือผ่าน Files API ทุกอย่างใช้รูปแบบการแชทที่เข้ากันได้กับ OpenAI มาตรฐาน และโมเดลยังสามารถเข้าถึงได้ผ่านจุดสิ้นสุดที่เข้ากันได้กับ DeepSeek ของ Anthropic ซึ่งหมายความว่าโค้ด Claude SDK ที่มีอยู่สามารถเปลี่ยนแบ็กเอนด์โดยมีการเปลี่ยนแปลงเพียงเล็กน้อย
ราคา: วิสัยทัศน์ชายแดนในอัตราสินค้าโภคภัณฑ์
แบบจำลองทดลองสืบทอดใบราคาเชิงรุกของ V4-Flash โทเค็นอินพุตมีราคา 0.22 ดอลลาร์ต่อล้านนอกช่วงพีค และ 0.44 ดอลลาร์ในช่วงพีคสำหรับแคชที่หายไป ซึ่งลดลงเหลือเพียง 0.007 ดอลลาร์ต่อล้านสำหรับการเข้าถึงแคชในช่วงเวลานอกช่วงพีค โทเค็นเอาท์พุตมีราคาอยู่ที่ 0.66 เหรียญสหรัฐต่อล้านช่วงที่มีการใช้งานน้อย และ 1.32 เหรียญในช่วงที่มีการใช้งานสูงสุด รูปภาพจะถูกแปลงเป็นโทเค็นตามขนาดและเรียกเก็บเงินพร้อมกับโทเค็นข้อความ
การกำหนดราคานั้นมีความสำคัญเนื่องจากเป็นการบั่นทอนข้อเสนอหลายรูปแบบที่เทียบเคียงได้จากผู้ให้บริการรายใหญ่ของสหรัฐฯ ทำให้เกิดสงครามราคาที่ DeepSeek ดำเนินไปตลอดทั้งปี นอกจากนี้ โมเดลดังกล่าวยังครอบคลุมข้อกำหนดพาดหัวของครอบครัวอีกด้วย: หน้าต่างบริบทของโทเค็น 1 ล้านโทเค็น โทเค็นสูงสุด 384K ของเอาต์พุตสูงสุด รองรับโหมดการคิดและโหมดไม่คิด เอาต์พุต JSON การเรียกใช้เครื่องมือ และขีดจำกัดการทำงานพร้อมกันที่ 2,500 ซึ่งเป็นข้อมูลจำเพาะที่วางตำแหน่งให้เป็นเสมือนตัวขับเคลื่อนที่แท้จริงสำหรับปริมาณงานการผลิตที่มีปริมาณมาก แทนที่จะเป็นของเล่นในการวิจัย
ทำไมนักพัฒนาถึงหมดหวังกับสิ่งนี้
การเปิดตัวดังกล่าวเกิดขึ้นที่ Hacker News ซึ่งรวบรวมคะแนนได้มากกว่า 450 คะแนนอย่างรวดเร็ว และความกระตือรือร้นมีเรื่องราวต้นกำเนิดที่เฉพาะเจาะจง V4-Flash-0731 แบบข้อความอย่างเดียวของ DeepSeek ได้พัฒนาชื่อเสียงในด้าน ความเชื่อ ที่สามารถมองเห็นได้ นักพัฒนาหลายรายรายงานว่าโมเดลจะถือว่ามีความสามารถในการมองเห็น จากนั้นจึงแก้ไขวิธีแก้ปัญหาที่ซับซ้อนแบบด้นสดเมื่อพบว่าไม่สามารถทำได้ รวมถึงการประดิษฐ์เครื่องมือวิเคราะห์รูปภาพแบบข้อความ และการดึงภาพหน้าจอออกจากอุปกรณ์ที่เชื่อมต่อก่อนที่จะรู้ว่าไม่มีวิธีดู
"ฉันได้ยินมาว่า DeepSeek v4 Flash 0731 มักสันนิษฐานว่ามีความสามารถในการมองเห็น จากนั้นจึงหันมาประดิษฐ์เครื่องมือวิเคราะห์รูปภาพแบบข้อความเมื่อพบว่าไม่สามารถมองเห็นได้จริง" ผู้วิจารณ์คนหนึ่งเขียน ซึ่งสะท้อนรายงานจากคนอื่นๆ อีกหลายราย สำหรับใครก็ตามที่ใช้โมเดลเป็นตัวแทนในการเขียนโค้ดหรือไปป์ไลน์การทำงานอัตโนมัติ วิชันเวอร์ชันใหม่ควรกำจัดความล้มเหลวที่เกิดจากความสับสนทุกประเภท
การจับขนาด 800x800
การเปิดตัวครั้งนี้ไม่ได้ไร้ข้อจำกัด และการวิพากษ์วิจารณ์อย่างเฉียบขาดเกี่ยวกับ Hacker News ก็มุ่งเป้าไปที่ตัวเลขตัวเดียว นั่นก็คือ ความละเอียดของภาพ เอกสารระบุว่าก่อนการอนุมาน ทุกภาพจะถูกปรับขนาดโดยอัตโนมัติเพื่อให้จำนวนพิกเซลทั้งหมดตรงกับภาพขนาด 800x800 โดยประมาณ โดยคงอัตราส่วนไว้
"มันมีประโยชน์ แต่สำหรับ OCR และแอปพลิเคชันอื่นๆ จำนวนมาก จำเป็นต้องสูงกว่านี้เล็กน้อย (เช่น การใส่หน้าขนาด A4 / Letter แบบเต็ม)" นักพัฒนารายหนึ่งแย้ง โดยอีกคนตอบตรงๆ ว่าขนาดสูงสุด 800x800 "ทำลายกรณีการใช้งานไปมาก" สำหรับเอกสารที่มีความหนาแน่นสูง การสแกนแบบเต็มหน้า หรือการดีบัก UI แบบละเอียด เพดานความละเอียดอาจผลักดันให้นักพัฒนาเลือกใช้ทางเลือกที่มีความละเอียดสูงกว่าและมีราคาแพงกว่า วิธีแก้ปัญหายอดนิยมอย่างหนึ่งที่แนะนำในเธรด: แบ่งหน้าขนาดใหญ่ออกเป็นไทล์และป้อนแยกกัน
คำถามเปิดอีกข้อหนึ่งคือการเปิดกว้าง DeepSeek สร้างชื่อเสียงจากการเปิดตัว Open Weight แต่บริษัทไม่ได้ระบุว่ารูปแบบการมองเห็นจะตามมาหรือไม่ ผู้แสดงความคิดเห็นคาดเดาว่าอาจมาจากการวิจัย "Thinking with Visual Primitives" ล่าสุดของบริษัท ซึ่งมีรายงานว่ามีการให้น้ำหนักไว้ แต่ไม่มีการยืนยันใดๆ โดยเฉพาะอย่างยิ่ง โมเดลดังกล่าวถูกระบุว่าเป็นรุ่นทดลอง โดยใช้คำต่อท้าย "-exp" ซึ่งส่งสัญญาณว่า DeepSeek คาดว่าจะทำซ้ำ
การเปิดตัวที่เงียบแต่มีกลยุทธ์
การมองเห็นที่ลดลงยังคงดำเนินต่อไปสำหรับห้องปฏิบัติการในหางโจว ซึ่งใช้เวลาในเดือนสิงหาคมในการจัดส่งการอัปเดตอย่างต่อเนื่อง: V4-Flash-0731, เฟรมเวิร์ก DeepSeek Harness ที่มุ่งเน้นเอเจนต์, การรีเฟรช V4-Pro-0813 และตอนนี้อินพุตแบบหลายรูปแบบ แทนที่จะเปิดตัวบล็อกบัสเตอร์เพียงครั้งเดียว DeepSeek กำลังดำเนินการตามจังหวะของการเผยแพร่ที่เพิ่มขึ้นอย่างรวดเร็ว โดยเก็บโมเดลไว้ในกลุ่มเครื่องมือของนักพัฒนา — ซึ่งเป็นกลยุทธ์การคว้าที่ดินแบบเดียวกับที่ห้องปฏิบัติการตะวันตกกำลังดำเนินการกับตัวแทนการเขียนโค้ด
สำหรับอุตสาหกรรม AI โดยรวม ข้อความนี้เป็นที่คุ้นเคยแต่ยังคงน่าอึดอัดสำหรับผู้ครอบครองตลาด: ความสามารถที่ครั้งหนึ่งเคยเป็นราคาที่สมเหตุสมผล — ความเข้าใจภาพในบริบทล้านโทเค็น — ขณะนี้มาถึงที่ไม่กี่เซ็นต์ต่อล้านโทเค็น ป้ายทดลองให้พื้นที่ DeepSeek ในการปรับแต่งโมเดล แต่นักพัฒนาได้เริ่มรวมเข้ากับเวิร์กโฟลว์ที่ขับเคลื่อนด้วยภาพหน้าจอแล้ว คำถามไม่ใช่อีกต่อไปว่า DeepSeek สามารถจับคู่ชุดฟีเจอร์หลายรูปแบบของคู่แข่งได้หรือไม่ แต่อยู่ที่ว่าตลาดส่วนที่เหลือจะปรับราคาได้เร็วแค่ไหน
ก้าวนำหน้า AI
สำหรับการเปิดตัวโมเดล AI ล่าสุด การต่อสู้ของเกณฑ์มาตรฐาน และการวิเคราะห์อุตสาหกรรม โปรดบุ๊กมาร์ก AI Buzz Wire
อ่านข่าว AI เพิ่มเติม →