Google ในวันพฤหัสบดีที่ประกาศ Gemini Omni 1.1 Flash ซึ่งเป็นการอัปเดตที่พร้อมสำหรับการผลิตสำหรับโมเดลวิดีโอที่สร้างซึ่งเพิ่มส่วนขยายฉาก การควบคุมกล้องภาพยนตร์และเอาต์พุต 4K ตามโพสต์ในบล็อกอย่างเป็นทางการของ Google โดยผู้จัดการผลิตภัณฑ์ DeepMind Anish Nangia และ Alisa Fortin
การอัปเดตจะย้าย Omni จากโมเดลทดลองไปสู่สิ่งที่ Google เรียกว่าความพร้อมในการผลิตสำหรับการใช้งานระดับมืออาชีพผ่าน Gemini API ใน Google AI Studio พร้อมความพร้อมใช้งานที่แสดงผ่าน Gemini Enterprise Agent Platform Google อธิบายว่า Gemini Omni ได้นำการใช้เหตุผลในโลกแห่งความเป็นจริงมาสู่การสร้างสรรค์ และวางตำแหน่งรุ่น 1.1 เป็นจุดที่ทำให้โมเดลเชื่อถือได้เพียงพอสำหรับนักพัฒนาที่สร้างเวิร์กโฟลว์วิดีโอ เครื่องมือสร้างสรรค์ และซอฟต์แวร์แก้ไขสื่อ
เรื่องราวที่ยาวขึ้นผ่านการขยายฉาก
ความสามารถพาดหัวคือส่วนขยายฉาก ซึ่งช่วยให้นักพัฒนาสามารถนำวิดีโอที่สร้างขึ้นที่มีอยู่และสร้างฟุตเทจต่อไปได้อย่างราบรื่นจากที่ค้างไว้ ด้วย Omni 1.1 Google กล่าวว่าแบบจำลองนี้สามารถวิเคราะห์บริบทก่อนหน้าได้นานถึง 10 วินาที ซึ่งเป็นการก้าวกระโดดจากรุ่นก่อนหน้าที่อ้างอิงเฉพาะวินาทีสุดท้าย บริษัทระบุว่าผลลัพธ์ที่ได้คือปรับปรุงความสอดคล้องของภาพและการยึดตามการเล่าเรื่องเมื่อสร้างเรื่องราวที่ยาวขึ้นหรือแตกแขนงไปสู่ทิศทางที่สร้างสรรค์ใหม่
วิดีโอสามารถขยายเพิ่มได้ครั้งละ 10 วินาที ไปจนถึงความยาวสะสมรวม 40 วินาที แม้ว่าวิดีโอจะมีความยาวไม่มากนัก แต่สำหรับเนื้อหาที่มีรูปแบบสั้น การสร้างสรรค์โฆษณา และงานแสดงภาพล่วงหน้า Google เดิมพันว่าการควบคุมและความสม่ำเสมอมีความสำคัญมากกว่าระยะเวลา
เนื้อหาสาธิตที่เผยแพร่ควบคู่ไปกับการประกาศแสดงให้เห็นว่าเวิร์กโฟลว์มีจุดมุ่งหมายในการทำงานในทางปฏิบัติอย่างไร: ข้อความใหม่แต่ละรายการจะดำเนินต่อไปในฉากก่อนหน้า โดยโมเดลจะมีบริบทที่เป็นภาพไปข้างหน้า ในขณะที่ข้อความแจ้งจะกำหนดทิศทางการเปลี่ยนแปลงในการเคลื่อนไหวของกล้อง การตั้งค่า และแม้กระทั่งอารมณ์ — ลำดับหนึ่งจะย้ายจากการสนทนาอย่างใกล้ชิดไปสู่การดึงออกอย่างช้าๆ ผ่านสุสานใต้ดินที่เต็มไปด้วยฝุ่น จากนั้นจึงเข้าสู่ห้องสมุดลอยน้ำขนาดใหญ่ การสร้างฉากเป็นเลเยอร์ แทนที่จะสร้างมันขึ้นมาในช็อตเดียว มีความใกล้เคียงกับวิธีที่นักตัดต่อรวบรวมฟุตเทจมากกว่าวิธีการทำงานของเครื่องมือแปลงข้อความเป็นวิดีโอในยุคแรกๆ
การควบคุมกล้องและการแก้ไขเฟรม
การเปิดตัวนี้ยังเพิ่มสิ่งที่ Google อธิบายว่าเป็นเครื่องมือในการผลิตวิดีโอคุณภาพระดับสตูดิโอ ในบรรดาตัวอย่างที่แสดงในโพสต์ประกาศ: การซูมแบบดอลลี่แบบภาพยนตร์ที่จะเลื่อนกล้องไปข้างหน้าขณะซูมออก การซูมแบบกลไกเข้าไปในดวงตาของตัวละคร และการหมุนวงโคจร 360 องศารอบตัวละครที่หยุดนิ่งเพื่อแสดงความลึก 3 มิติและพารัลแลกซ์
นักพัฒนายังสามารถระบุเฟรมแรกและเฟรมสุดท้ายสำหรับช็อตหนึ่งได้ โดยโมเดลจะสอดแทรกการเปลี่ยนผ่านระหว่างเฟรมเหล่านั้นอย่างราบรื่น ซึ่งเป็นเทคนิคที่นักสร้างแอนิเมชันมืออาชีพคุ้นเคยดี ซึ่งให้การควบคุมอย่างละเอียดว่าจุดเริ่มต้นและจุดสิ้นสุดของช็อตใด ติดตาม การพัฒนา AI ล่าสุด ขณะที่ Google ยังคงเผยแพร่อย่างรวดเร็วต่อไป
ทำซ้ำในรูปแบบ 360p ส่งในรูปแบบ 4K
Omni 1.1 Flash แนะนำเวิร์กโฟลว์คุณภาพสองชั้นที่มุ่งเป้าไปที่การควบคุมต้นทุน นักพัฒนาสามารถสร้างการแสดงตัวอย่างแบบ 360p อย่างรวดเร็วเพื่อทำซ้ำแนวคิดได้รวดเร็วยิ่งขึ้นและประหยัดมากขึ้นในระหว่างกระบวนการสร้างสรรค์ จากนั้นจึงอัปเกรดโปรเจ็กต์สุดท้ายเป็นความละเอียด 4K เพื่อให้ได้ผลลัพธ์ที่สวยงาม Google กล่าวว่าการลดขนาดจะทำให้ได้ผลลัพธ์ที่คมชัดและมีความละเอียดสูงเหมาะสำหรับการใช้งานระดับมืออาชีพ
ไปป์ไลน์การแสดงตัวอย่างเป็น 4K จะช่วยแก้ปัญหาทางเศรษฐกิจที่เกิดขึ้นอย่างต่อเนื่องของวิดีโอที่สร้างใหม่ นั่นคือ ต้นทุนในการสร้างเอาต์พุตความละเอียดเต็มทุกครั้งที่มีการเปลี่ยนแปลงทันที ด้วยการแยกการสำรวจออกจากการส่งมอบ Google กำลังทำให้โมเดลนี้ใช้งานได้จริงมากขึ้นสำหรับไปป์ไลน์เชิงพาณิชย์ซึ่งมีการวนซ้ำหลายสิบครั้งก่อนการเรนเดอร์ขั้นสุดท้าย
ทำไมมันถึงสำคัญ
การอัปเดตนี้สะท้อนให้เห็นถึงการเปลี่ยนแปลงของอุตสาหกรรมจากคุณภาพการสร้างดิบไปสู่ความสามารถในการควบคุม - ความสามารถในการควบคุมการเคลื่อนไหวของกล้อง รักษาความสม่ำเสมอของตัวละคร และเฟรมที่ตรงกัน ในแบบที่ผู้กำกับหรือบรรณาธิการทำ สำหรับนักพัฒนาที่สร้างซอฟต์แวร์เชิงสร้างสรรค์ ความแตกต่างระหว่างการสาธิตและผลิตภัณฑ์ที่สามารถปรับใช้ได้มักจะอยู่ที่การควบคุมเหล่านี้มากกว่าความเที่ยงตรงแบบดิบ
กรอบการเผยแพร่ของ Google ทำให้ผู้ชมเป้าหมายมีความชัดเจน บริษัทตั้งชื่อเป้าหมายสามประเภท ได้แก่ เวิร์กโฟลว์วิดีโอเชิงสร้างสรรค์ เครื่องมือสร้างสรรค์ และซอฟต์แวร์ตัดต่อสื่อ และอธิบายถึงการอัปเดตที่ทำให้วิดีโอเชิงสร้างสรรค์สามารถควบคุมได้มากขึ้น ทำซ้ำได้เร็วขึ้น และปรับปรุงสำหรับการใช้งานในโลกแห่งความเป็นจริง การสร้างต้นแบบที่เร็วขึ้นจะปรากฏขึ้นพร้อมกับการลดขนาด 4K ในสรุปการเปิดตัว โดยเน้นย้ำว่าความเร็วในการทำซ้ำถูกขายเป็นคุณสมบัติในตัวมันเอง
ด้วย Omni 1.1 Flash ที่พร้อมใช้งานใน AI Studio และผ่าน Gemini API Google กำลังผลักดันโมเดลนี้ไปยังผู้ใช้ระดับองค์กรผ่านทาง Gemini Enterprise Agent Platform ซึ่งเป็นการส่งสัญญาณว่าวิดีโอที่สร้างมานั้นถูกวางตำแหน่งเป็นโครงสร้างพื้นฐานทางธุรกิจมากกว่าสิ่งแปลกใหม่ของผู้บริโภค
จะดูอะไรดี
รายละเอียดราคาสำหรับเอาท์พุต 4K ไม่ได้เน้นในประกาศ และนักพัฒนาจะได้ดูว่าขีดจำกัดสะสม 40 วินาทีส่งผลต่อแผนการผลิตในโลกแห่งความเป็นจริงอย่างไร การแข่งขันในวิดีโอ AI ยังคงรุนแรง โดยคู่แข่งได้จัดส่งฟีเจอร์การควบคุมของตนเองอย่างรวดเร็ว ซึ่งเป็นการเปลี่ยนแปลงที่ทำให้อายุการเก็บรักษาของการกล่าวอ้างที่ล้ำสมัยในปีนี้สั้นลงซ้ำแล้วซ้ำอีก
สำหรับตอนนี้ ข้อความจาก Google ถึงนักพัฒนามีความชัดเจน: วิดีโอที่สร้างขึ้นซึ่งครั้งหนึ่งเคยต้องอาศัยการเล่นแร่แปรธาตุและโชคโดยทันที สามารถกำกับ ขยาย และจบใน 4K ผ่าน API เดียวได้
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →