Google hôm thứ Năm đã công bố Gemini Omni 1.1 Flash, một bản cập nhật sẵn sàng sản xuất cho mô hình video tổng hợp của nó có thêm phần mở rộng cảnh, điều khiển máy ảnh điện ảnh và đầu ra 4K, theo một bài đăng trên blog chính thức của Google bởi các nhà quản lý sản phẩm DeepMind Anish Nangia và Alisa Fortin.
Bản cập nhật chuyển Omni từ một mô hình thử nghiệm sang cái mà Google gọi là tính sẵn sàng sản xuất để sử dụng chuyên nghiệp thông qua API Gemini trong Google AI Studio, với tính khả dụng cũng được liệt kê thông qua Nền tảng đại lý doanh nghiệp Gemini. Google mô tả Gemini Omni là người đã đưa lý luận trong thế giới thực vào quá trình sáng tạo tổng quát và định vị bản phát hành 1.1 là điểm mà mô hình trở nên đủ tin cậy để các nhà phát triển xây dựng quy trình làm việc video, công cụ sáng tạo và phần mềm chỉnh sửa phương tiện.
Câu chuyện dài hơn thông qua phần mở rộng cảnh
Khả năng nổi bật là mở rộng cảnh, cho phép các nhà phát triển lấy video đã tạo hiện có và tiếp tục tạo cảnh quay một cách liền mạch từ nơi video đó dừng lại. Với Omni 1.1, Google cho biết mô hình này có thể phân tích tối đa 10 giây bối cảnh trước đó - một bước nhảy vọt so với các mô hình trước đó chỉ tham chiếu đến giây cuối cùng. Theo công ty, kết quả là cải thiện tính nhất quán về mặt hình ảnh và sự tuân thủ câu chuyện khi xây dựng những câu chuyện dài hơn hoặc phân nhánh theo những hướng sáng tạo mới.
Video có thể được kéo dài theo từng khoảng 10 giây lên đến tổng thời lượng tích lũy là 40 giây. Thời lượng đó vẫn thấp so với độ dài video truyền thống, nhưng đối với nội dung dạng ngắn, quảng cáo sáng tạo và công việc tiền trực quan hóa, Google đang đặt cược rằng việc kiểm soát và tính nhất quán quan trọng hơn thời lượng.
Tài liệu minh họa được xuất bản cùng với thông báo cho thấy cách thức hoạt động của quy trình làm việc trong thực tế: mỗi lời nhắc mới tiếp tục cảnh trước đó, với mô hình đưa bối cảnh trực quan về phía trước trong khi lời nhắc chỉ đạo những thay đổi trong chuyển động của máy ảnh, cài đặt và thậm chí cả tâm trạng — một chuỗi chuyển từ cuộc trò chuyện gần gũi sang kéo ra chậm qua hầm mộ bụi bặm rồi đi vào một thư viện nổi rộng lớn. Xây dựng cảnh theo từng lớp, thay vì tạo cảnh trong một cảnh quay, gần giống với cách người biên tập tập hợp các cảnh quay hơn là cách hoạt động của các công cụ chuyển văn bản thành video ban đầu.
Điều khiển camera và nội suy khung hình
Bản phát hành cũng bổ sung những gì Google mô tả là công cụ sản xuất video chất lượng studio. Trong số các ví dụ hiển thị trên bài đăng thông báo: zoom dolly-zoom điện ảnh giúp di chuyển máy ảnh về phía trước trong khi thu nhỏ, zoom cơ học vào mắt nhân vật và xoay quỹ đạo 360 độ xung quanh nhân vật bị đóng băng để thể hiện độ sâu và thị sai 3D.
Các nhà phát triển cũng có thể chỉ định khung hình đầu tiên và cuối cùng cho một cảnh quay, với mô hình nội suy các chuyển tiếp mượt mà giữa chúng — một kỹ thuật quen thuộc với các nhà làm phim hoạt hình chuyên nghiệp giúp kiểm soát chi tiết nơi bắt đầu và kết thúc cảnh quay. Hãy theo dõi sự phát triển AI mới nhất khi Google tiếp tục nhịp độ phát hành nhanh chóng.
Lặp lại ở 360p, phân phối ở 4K
Omni 1.1 Flash giới thiệu quy trình làm việc chất lượng hai cấp nhằm kiểm soát chi phí. Các nhà phát triển có thể tạo bản xem trước 360p nhanh chóng để lặp lại các ý tưởng nhanh hơn và rẻ hơn trong quá trình sáng tạo, sau đó nâng cấp dự án cuối cùng lên độ phân giải 4K để có kết quả bóng bẩy. Google cho biết việc nâng cấp sẽ tạo ra đầu ra sắc nét, độ phân giải cao phù hợp cho mục đích sử dụng chuyên nghiệp.
Quy trình xem trước tới 4K giải quyết một trong những vấn đề kinh tế dai dẳng của video tổng hợp: chi phí tái tạo đầu ra có độ phân giải đầy đủ mỗi khi có thay đổi nhanh chóng. Bằng cách tách rời hoạt động thăm dò khỏi quá trình phân phối, Google đang làm cho mô hình này trở nên thiết thực hơn đối với các quy trình thương mại nơi có hàng chục lần lặp lại trước kết xuất cuối cùng.
Tại sao nó lại quan trọng
Bản cập nhật phản ánh sự thay đổi của ngành từ chất lượng tạo thô sang khả năng kiểm soát — khả năng điều khiển chuyển động của camera, duy trì tính nhất quán của nhân vật và đạt được các khung hình chính xác, theo cách mà đạo diễn hoặc biên tập viên sẽ làm. Đối với các nhà phát triển xây dựng phần mềm sáng tạo, sự khác biệt giữa bản demo và sản phẩm có thể triển khai thường nằm ở những điều khiển này hơn là độ trung thực thô.
Việc sắp xếp bản phát hành của Google làm cho đối tượng mục tiêu trở nên rõ ràng. Công ty đặt tên cho ba danh mục mục tiêu — quy trình làm việc video tổng quát, công cụ sáng tạo và phần mềm chỉnh sửa phương tiện — và mô tả các bản cập nhật giúp cho video tổng quát dễ kiểm soát hơn, lặp lại và trau chuốt nhanh hơn để triển khai trong thế giới thực. Nguyên mẫu nhanh hơn xuất hiện cùng với tính năng nâng cấp 4K trong bản tóm tắt phát hành, nhấn mạnh rằng tốc độ lặp lại đang được bán như một tính năng theo đúng nghĩa của nó.
Với Omni 1.1 Flash có sẵn trong AI Studio và thông qua API Gemini, Google cũng đang đẩy mô hình này tới người dùng doanh nghiệp thông qua Nền tảng đại lý doanh nghiệp Gemini, báo hiệu rằng video tổng hợp đang được định vị là cơ sở hạ tầng kinh doanh thay vì tính mới của người tiêu dùng.
Xem gì
Chi tiết về giá cho đầu ra 4K không được nêu rõ trong thông báo và các nhà phát triển sẽ xem giới hạn tích lũy 40 giây ảnh hưởng như thế nào đến kế hoạch sản xuất trong thế giới thực. Sự cạnh tranh trong lĩnh vực video AI vẫn rất gay gắt, với việc các đối thủ tung ra các tính năng có thể kiểm soát của riêng họ với tốc độ nhanh chóng - một động lực đã nhiều lần rút ngắn thời hạn sử dụng của các tuyên bố tiên tiến nhất trong năm nay.
Hiện tại, thông điệp của Google gửi tới các nhà phát triển là trực tiếp: video tổng hợp từng yêu cầu thuật giả kim nhanh chóng và may mắn giờ đây có thể được định hướng, mở rộng và hoàn thiện ở 4K thông qua một API duy nhất.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →