เมื่อวันที่ 21 กรกฎาคม ทีมงาน Qwen ของอาลีบาบาได้เปิดตัว Qwen-Image-3.0 ซึ่งเป็นโมเดลการสร้างภาพเจเนอเรชั่นที่ 3 ซึ่งมีแนวโน้มว่าจะมีเนื้อหาที่สมบูรณ์ยิ่งขึ้น รายละเอียดภาพที่แท้จริง และความรู้ที่ลึกซึ้งมากกว่ารุ่นก่อน การเปิดตัวดังกล่าวรายงานโดย Tech in Asia และ Unite.AI ดึงดูดความสนใจอย่างมากในชุมชนนักพัฒนา โดยการประกาศดังกล่าวได้ขึ้นหน้าแรกของ Hacker News โดยมีผู้โหวตมากกว่า 300 คนภายในไม่กี่ชั่วโมง
โมเดลใหม่นี้อยู่ภายใต้สโลแกน "เนื้อหาสมบูรณ์ รายละเอียดที่แท้จริง ความรู้เชิงลึก" และมุ่งเป้าไปที่การผลิตภาพที่มีเลย์เอาต์ที่ซับซ้อน ซึ่งเป็นหมวดหมู่ที่ท้าทายระบบการแปลงข้อความเป็นรูปภาพมายาวนาน หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับแนวการแข่งขันของ generative AI โปรดติดตาม การพัฒนา AI ล่าสุด ของเรา
สิ่งที่ Qwen-Image-3.0 อ้างว่าต้องปรับปรุง
จากข้อมูลของ Tech in Asia นั้น Qwen-Image-3.0 ถูกสร้างขึ้นมาโดยเฉพาะเพื่อรองรับเลย์เอาต์ที่ซับซ้อน ซึ่งเป็นองค์ประกอบหลายองค์ประกอบที่รวมข้อความ กราฟิก และองค์ประกอบภาพที่มีโครงสร้างไว้ในภาพเดียว นั่นเป็นขั้นตอนที่มีความหมายนอกเหนือจากการสร้างภาพเสมือนจริงธรรมดาๆ ซึ่งรุ่นก่อนๆ ในซีรีส์นี้มีเป้าหมายเป็นส่วนใหญ่
กลุ่มผลิตภัณฑ์ Qwen-Image มีการพัฒนาอย่างรวดเร็ว Qwen-Image รุ่นแรกมุ่งเน้นไปที่การแสดงข้อความดั้งเดิม การแก้ปัญหาอันโด่งดังของคำที่อ่านไม่ออกหรือสะกดผิดภายในรูปภาพที่สร้างขึ้น Qwen-Image-2.0 ซึ่งเป็นเจเนอเรชันที่สองได้ก้าวเข้าสู่อินโฟกราฟิกระดับมืออาชีพและสิ่งที่ทีมงานเรียกว่าภาพเสมือนจริงอันประณีต Qwen-Image-3.0 ขยายวิถีไปสู่องค์ประกอบที่สมบูรณ์ยิ่งขึ้นและความรู้เชิงข้อเท็จจริงหรือบริบทที่ลึกซึ้งยิ่งขึ้นที่ฝังอยู่ในผลลัพธ์ที่สร้างขึ้น
การเน้นความรู้เป็นที่น่าสังเกต ในกรณีที่โปรแกรมสร้างภาพส่วนใหญ่สร้างฉากที่ดูเป็นไปได้ซึ่งอาจมีความไม่ถูกต้องตามข้อเท็จจริง อาลีบาบาดูเหมือนจะวางตำแหน่ง Qwen-Image-3.0 เป็นแบบจำลองที่เข้าใจเนื้อหาที่แสดงผล ไม่ใช่แค่พิกเซลเท่านั้น
ยังไม่มีเกณฑ์มาตรฐาน ยังไม่มีน้ำหนัก — เลย
รายละเอียดประการหนึ่งที่ได้รับการตรวจสอบอย่างรวดเร็วคือสิ่งที่อาลีบาบาไม่ได้เผยแพร่ควบคู่ไปกับการประกาศ ตามที่ Unite.AI รายงาน Qwen-Image-3.0 เปิดตัวโดยไม่มีคะแนนมาตรฐานหรือน้ำหนักแบบจำลองที่ดาวน์โหลดได้ ซึ่งตรงกันข้ามกับ Qwen-Image รุ่นก่อนๆ ซึ่งจัดส่ง Open Weight บน Hugging Face และมีการเปรียบเทียบทางเทคนิคโดยละเอียดกับคู่แข่ง
การละเว้นทำให้เกิดปฏิกิริยาผสมกัน ใน Hacker News ผู้แสดงความคิดเห็นตั้งข้อสังเกตว่าหากไม่มีข้อมูลเกณฑ์มาตรฐาน เป็นการยากที่จะตรวจสอบการปรับปรุงที่อ้างสิทธิ์ของโมเดลอย่างอิสระเหนือคู่แข่ง เช่น ระบบภาพของ OpenAI หรือข้อเสนอของ Google คนอื่นๆ ชี้ให้เห็นว่า Qwen มีประวัติในการปล่อยน้ำหนักหลังจากช่วงจัดแสดงครั้งแรก และการที่ขาดการดาวน์โหลดทันทีอาจสะท้อนถึงการเปิดตัวแบบเป็นขั้นๆ
การตัดสินใจระงับน้ำหนักยังมีมิติทางภูมิรัฐศาสตร์ด้วย ในช่วงไม่กี่เดือนที่ผ่านมา สหรัฐฯ ได้ชั่งน้ำหนักการควบคุมโมเดล AI ของจีนที่เข้มงวดมากขึ้น โดย Scott Bessent รัฐมนตรีกระทรวงการคลังเตือนว่าวอชิงตันอาจคว่ำบาตรปักกิ่งเนื่องจากการขโมยโมเดล AI ที่ถูกกล่าวหา เมื่อเทียบกับฉากหลังดังกล่าว บริษัท AI ของจีนบางแห่งเริ่มระมัดระวังมากขึ้นเกี่ยวกับการเปิดตัวแบบ open-weight แม้ว่าการเคลื่อนไหวแบบโอเพ่นซอร์สในวงกว้างจะยังคงได้รับแรงผลักดันก็ตาม
สนามที่แออัดและการแข่งขัน
Qwen-Image-3.0 เข้าสู่ตลาดการสร้างภาพที่มีการแข่งขันสูง ระบบนิเวศของ Alibaba มีโมเดลรูปภาพหลายแบบอยู่แล้ว และบริษัทก็เผชิญกับคู่แข่งในหลายด้าน ในพื้นที่ open-weights โมเดลอย่าง Krea 2 ได้แสดงให้เห็นถึงความสามารถในการสร้างสรรค์ผลงานอันแข็งแกร่ง ในพื้นที่ที่เป็นกรรมสิทธิ์ ผู้เล่นชาวตะวันตกที่ได้รับการยอมรับยังคงทำซ้ำอย่างรวดเร็วทั้งในด้านคุณภาพและความเร็ว
การที่ทีมงาน Qwen มุ่งเน้นไปที่รูปแบบที่ซับซ้อนและความรู้ที่ฝังตัว ชี้ให้เห็นว่ากำลังกำหนดเป้าหมายไปยังกลุ่มที่แตกต่างกันเล็กน้อยของตลาด นั่นคือ ผู้ใช้ที่ต้องการสร้างภาพที่ไม่เพียงแต่ดึงดูดสายตาเท่านั้น แต่ยังรวมถึงโครงสร้างและข้อเท็จจริงที่สอดคล้องกันด้วย กรณีการใช้งาน เช่น อินโฟกราฟิก แผนภาพคำแนะนำ การแสดงข้อมูลเป็นภาพ และสื่อการตลาดที่มีแบรนด์ ล้วนต้องการความถูกต้องแม่นยำของเลย์เอาต์และความแม่นยำตามบริบทที่ Qwen-Image-3.0 อ้างว่าส่งมอบ
การผลักดัน Generative AI อย่างต่อเนื่องของจีน
การเปิดตัวนี้ยังเหมาะกับรูปแบบที่กว้างขึ้นของบริษัท AI จีนที่จัดส่งโมเดลหลักๆ อย่างรวดเร็ว เมื่อต้นเดือนกรกฎาคม Moonshot AI ได้เปิดตัว Kimi K3 ซึ่งเป็นโมเดลที่มีพารามิเตอร์ 28 ล้านล้านพารามิเตอร์ที่เรียกว่าเป็นระบบ AI แบบเปิดที่ใหญ่ที่สุดในโลก ก่อนที่จะระงับการสมัครรับข้อมูลใหม่ชั่วคราวเมื่อมีความต้องการล้นหลามโครงสร้างพื้นฐานการประมวลผล อาลีบาบาเองก็มีผลงานมากมายทั้งในรูปแบบภาษาและรูปแบบหลายรูปแบบ โดยปัจจุบันตระกูล Qwen ครอบคลุมทั้งข้อความ โค้ด วิสัยทัศน์ และการสร้างภาพ
ก้าวดังกล่าวได้เปลี่ยนรูปแบบแผนที่การแข่งขันระดับโลก ดังที่การวิเคราะห์ที่ถกเถียงกันอย่างกว้างขวางใน Hacker News ในสัปดาห์นี้ ระบุว่า กลยุทธ์ open-weights ของจีนกำลังได้รับชัยชนะ โดยดึงดูดนักพัฒนาและนักวิจัยไปสู่โมเดลที่มีให้ใช้งานฟรี แม้ว่าบริษัทในสหรัฐฯ จะจำกัดการเข้าถึงระบบที่มีความสามารถมากที่สุดของตนมากขึ้นก็ตาม
สิ่งที่ต้องระวัง
คำถามสำคัญในตอนนี้คือเมื่อใดที่อาลีบาบาจะเผยแพร่ผลการวัดประสิทธิภาพ และจะตามมาด้วยการเปิดตัวแบบ open-weight หรือไม่ หาก Qwen-Image-3.0 จัดส่งน้ำหนักที่ตรงกับคำกล่าวอ้าง อาจกดดันคู่แข่งทั้งในด้านคุณภาพและการเข้าถึงได้ หากการถ่วงน้ำหนักยังคงถูกระงับไว้ นักพัฒนาจะต้องชั่งน้ำหนักสัญญาทางการตลาดของโมเดลเทียบกับการไม่มีหลักฐานที่ตรวจสอบได้
ไม่ว่าจะด้วยวิธีใด การเปิดตัวครั้งนี้เป็นการตอกย้ำว่าขอบเขตการสร้างภาพกำลังเคลื่อนไปเร็วแค่ไหน ความเที่ยงตรงของเลย์เอาต์ รายละเอียดที่แท้จริง และความรู้ที่ฝังแน่นอยู่ในขณะนี้คือสมรภูมิ และอาลีบาบาได้ส่งสัญญาณว่าตนตั้งใจที่จะเป็นแนวหน้าของการต่อสู้ครั้งนั้น
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →



