根据 DeepMind 产品经理 Anish Nangia 和 Alisa Fortin 在 Google 官方博客上发表的一篇文章,谷歌周四发布了 Gemini Omni 1.1 Flash,这是对其生成视频模型的生产就绪更新,增加了场景扩展、电影摄像机控制和 4K 输出。
此次更新将 Omni 从实验模型转变为 Google 所说的通过 Google AI Studio 中的 Gemini API 为专业用途做好生产准备的模型,其可用性也通过 Gemini Enterprise Agent Platform 列出。谷歌将 Gemini Omni 描述为将现实世界的推理引入生成创作,并将 1.1 版本定位为该模型对于构建视频工作流程、创意工具和媒体编辑软件的开发人员来说变得足够可靠的点。
通过场景扩展更长的故事
最重要的功能是场景扩展,它允许开发人员获取现有生成的视频,并从其停止的地方继续无缝生成素材。谷歌表示,在 Omni 1.1 中,该模型可以分析长达 10 秒的先前上下文,这与之前仅参考最后一秒的模型相比是一个飞跃。据该公司称,其结果是在构建更长的故事或分支到新的创意方向时提高了视觉一致性和叙事一致性。
视频可以以 10 秒为增量延长,总累积长度最多可达 40 秒。这仍然低于传统视频的长度,但对于短格式内容、广告创意和预可视化工作,谷歌认为控制和一致性比持续时间更重要。
与公告一起发布的演示材料展示了工作流程在实践中的运作方式:每个新的提示都会延续前一个场景,模型向前传送视觉上下文,而提示则引导相机移动、设置甚至情绪的变化——一个序列从亲密的对话到缓慢地穿过尘土飞扬的地下墓穴,然后进入一个巨大的浮动图书馆。分层构建场景,而不是一次性生成场景,更接近于剪辑师组装素材的方式,而不是早期文本到视频工具的工作方式。
相机控制和帧插值
该版本还添加了谷歌所说的工作室品质的视频制作工具。公告帖子中展示的示例包括:在缩小的同时向前移动摄像机的电影移动变焦、角色眼睛的机械快速变焦以及围绕冻结角色的 360 度轨道旋转以展示 3D 深度和视差。
开发人员还可以指定镜头的第一帧和最后一帧,模型在它们之间插入平滑过渡——这是专业动画师熟悉的技术,可以对镜头的开始和结束位置进行细粒度控制。随着 Google 继续其快速发布节奏,关注最新的人工智能发展。
以 360p 迭代,以 4K 交付
Omni 1.1 Flash 引入了旨在控制成本的两层质量工作流程。开发人员可以快速生成 360p 预览,以便在创作过程中更快、更经济地迭代想法,然后将最终项目升级到 4K 分辨率以获得精美的结果。谷歌表示,升级可以产生适合专业用途的清晰、高分辨率的输出。
预览到 4K 的管道解决了生成视频长期存在的经济问题之一:每次提示发生变化时重新生成全分辨率输出的成本。通过将探索与交付分离,谷歌正在使该模型对于商业管道更加实用,其中在最终渲染之前需要进行数十次迭代。
为什么这很重要
此次更新反映了行业从原始生成质量向可控性的转变——能够像导演或剪辑师那样指导摄像机移动、保持角色一致性并准确命中帧。对于构建创意软件的开发人员来说,演示和可部署产品之间的区别通常取决于这些控件,而不是原始保真度。
谷歌的发布框架明确了目标受众。该公司指定了三个目标类别——生成视频工作流程、创意工具和媒体编辑软件——并将更新描述为使生成视频更加可控、更快地迭代和完善以适应现实世界的部署。更快的原型设计与 4K 升级一起出现在发布摘要中,强调迭代速度本身就是作为一项功能出售的。
随着 AI Studio 中并通过 Gemini API 提供 Omni 1.1 Flash,Google 还通过 Gemini 企业代理平台将该模型推向企业用户,这表明生成视频正在被定位为业务基础设施,而不是消费者的新奇事物。
看什么
公告中没有强调 4K 输出的定价细节,开发人员将关注 40 秒的累积限制如何影响现实世界的制作计划。人工智能视频领域的竞争依然激烈,竞争对手都在快速推出自己的可控功能——这种动态一再缩短了今年最先进技术的保质期。
目前,谷歌向开发者传达的信息很直接:曾经需要快速炼金术和运气的生成视频现在可以通过单个 API 以 4K 格式进行引导、扩展和完成。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →