DeepMind プロダクトマネージャーの Anish Nangia 氏と Alisa Fortin 氏の公式 Google ブログへの投稿によると、Google は木曜日、Gemini Omni 1.1 Flash を発表しました。これは、シーン拡張、映画のようなカメラ コントロール、4K 出力を追加する生成ビデオ モデルのプロダクション対応アップデートです。

このアップデートにより、Omni は実験モデルから、Google AI Studio の Gemini API を介して、Google が言うところのプロユース向けの実稼働準備状態に移行し、Gemini Enterprise Agent Platform を通じて可用性もリスト化されます。 Google は、Gemini Omni が現実世界の推論をジェネレーティブ クリエーションにもたらしたと説明し、1.1 リリースは、ビデオ ワークフロー、クリエイティブ ツール、メディア編集ソフトウェアを構築する開発者にとってモデルが十分信頼できるようになるポイントであると位置づけています。

シーン拡張による長いストーリー

見出しの機能はシーン拡張で、開発者は既存の生成されたビデオを取得し、中断したところからシームレスにフッテージの生成を続けることができます。 Omni 1.1 では、このモデルが過去のコンテキストを最大 10 秒間分析できると Google は述べています。これは、最後の 1 秒だけを参照していた以前のモデルからの飛躍です。同社によれば、その結果、長いストーリーを構築したり、新しい創造的な方向に分岐したりする際の、視覚的な一貫性と物語の遵守が向上します。

ビデオは 10 秒単位で合計 40 秒まで延長できます。これは依然として従来の動画の長さには及ばないが、短編コンテンツ、広告クリエイティブ、プレビジュアライゼーションの作業では、長さよりも制御と一貫性が重要であると Google は賭けている。

発表と同時に公開されたデモ資料は、ワークフローが実際にどのように機能するかを示しています。新しいプロンプトがそれぞれ前のシーンを継続し、モデルが視覚的なコンテキストを前に進めながら、プロンプトがカメラの動き、設定、さらには雰囲気の変化を指示します。1 つのシーケンスは、親密な会話から、埃っぽい地下墓地を通ってゆっくりと引き出し、そして広大な浮遊図書館に移ります。ワンショットでシーンを生成するのではなく、レイヤーでシーンを構築することは、初期のテキストからビデオへのツールの仕組みよりも、編集者がフッテージを組み立てる方法に近いです。

カメラ制御とフレーム補間

このリリースには、Google がスタジオ品質のビデオ制作ツールと表現しているものも追加されています。発表投稿に示された例の中には、ズームアウトしながらカメラを前方に動かす映画のようなドリーズーム、キャラクターの目に機械的にスナップズームする機能、3D の奥行きと視差を示すためのフリーズしたキャラクターの周りの 360 度の軌道回転などがあります。

開発者は、ショットの最初と最後のフレームを指定し、モデルがそれらの間のスムーズなトランジションを補間することもできます。これは、ショットの開始位置と終了位置をきめ細かく制御できる、プロのアニメーターにはおなじみのテクニックです。 Google が急速なリリースペースを続けているため、最新の AI 開発 をフォローしてください。

360p で反復し、4K で配信

Omni 1.1 Flash では、コスト管理を目的とした 2 層の品質ワークフローが導入されています。開発者は、クイック 360p プレビューを生成して、クリエイティブ プロセス中にアイデアをより迅速かつ低コストで反復し、最終プロジェクトを 4K 解像度にアップスケールして洗練された結果を得ることができます。 Googleによれば、アップスケーリングにより、プロの使用に適した鮮明な高解像度の出力が生成されるという。

プレビューから 4K へのパイプラインは、生成ビデオの永続的な経済的問題の 1 つである、プロンプトが変更されるたびにフル解像度の出力を再生成するコストに対処します。 Google は、探索を配信から切り離すことで、最終的なレンダリングの前に数十回の反復が行われる商用パイプラインにとってモデルをより実用的なものにしています。

なぜそれが重要なのか

このアップデートは、生の生成品質から制御性への業界の移行を反映しています。つまり、ディレクターや編集者が行うように、カメラの動きを指示し、キャラクターの一貫性を維持し、正確なフレームをヒットする機能です。創造的なソフトウェアを構築する開発者にとって、デモと展開可能な製品の違いは、多くの場合、生の忠実度ではなく、これらのコントロールに帰着します。

Google のリリースの枠組みでは、対象読者を明確にしています。同社は、生成ビデオ ワークフロー、クリエイティブ ツール、メディア編集ソフトウェアという 3 つのターゲット カテゴリを挙げ、アップデートにより生成ビデオがより制御可能になり、反復処理が速くなり、現実世界の展開に向けて洗練されたものになると説明しています。リリース概要ではプロトタイピングの高速化が 4K アップスケーリングと並んで表示されており、イテレーション速度がそれ自体の機能として売り出されていることが強調されています。

Omni 1.1 Flash は AI Studio および Gemini API を通じて利用できるため、Google は Gemini Enterprise Agent Platform を通じてこのモデルを企業ユーザーにも推進しており、生成ビデオが消費者の目新しいものではなく、ビジネス インフラストラクチャとして位置付けられていることを示しています。

何を見るか

4K出力の価格詳細は発表では強調されておらず、開発者らは40秒の累積制限が実際の制作計画にどのような影響を与えるか注目している。 AI ビデオにおける競争は依然として熾烈であり、ライバル各社は独自の制御機能を急速に出荷しています。この力関係により、今年最先端の製品の有効期限が繰り返し短縮されています。

今のところ、開発者に対する Google のメッセージは直接的です。かつては迅速な錬金術と運が必要だった生成ビデオを、単一の API を通じて演出、拡張し、4K で仕上げることができるようになりました。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→