谷歌推出了两种新的生成媒体模型,专门针对需要速度和规模的开发人员:Nano Banana 2 Lite,迄今为止最快、最具成本效益的图像生成模型,以及Gemini Omni Flash,用于视频生成和对话编辑的高质量模型。两者均由 Google DeepMind 于 2026 年 6 月 30 日发布,并立即可供开发人员使用。

此次发布延续了最近人工智能行业的一波报道,重点是使生成媒体适用于生产管道,而不仅仅是演示。谷歌将这对产品定位为工具,让构建者可以在单个端到端工作流程中将快速图像生成与视频创建联系起来。

Nano Banana 2 Lite:专为速度而生

Nano Banana 2 Lite 的型号名称为“gemini-3.1-flash-lite-image”,专为快速构思和高速开发流程而设计,其中速度和成本是主要限制因素。据 Google 称,它可以在 4 秒内提供文本到图像的输出,使其成为交互式原型设计和快速视觉绘图的理想选择。

在成本方面,该模型的定价为每 1,000 张图像 0.034 美元,谷歌强调这一数字对于专注于起草、管理运营预算或处理低带宽使用的开发人员来说是一种经济高效的选择。该公司表示,尽管优先考虑速度,但 Nano Banana 2 Lite 保留了可靠的提示依从性、强大的字符一致性和清晰的图像内文本渲染——这是早期图像模型反复出现的痛点。

Google 推荐 Nano Banana 2 Lite 作为仍在使用 Nano Banana 第一个版本(“gemini-2.5-flash-image”)的开发人员的替代品,并承诺在延迟、成本和质量方面立即带来好处。

不断成长的香蕉家族

为了阐明每种型号的适用范围,Google 列出了完整的 Nano Banana 系列:

  • Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image): 专为速度而打造,针对超低延迟至关重要的近实时、大容量工作流程进行了优化。
  • Nano Banana 2(Gemini 3.1 Flash 映像): 多面手,以更低的延迟提供高质量,实现性能和成本的最佳平衡。
  • Nano Banana Pro(Gemini 3 Pro 图像): 针对复杂、专业的用例进行了优化,在准确性最重要的情况下提供最强大的控制和高级推理。

分层方法反映了谷歌构建其文本模型的方式,为开发人员提供了从廉价快速到优质精确的清晰升级路径。

Gemini Omni Flash 为开发者带来视频

除了图像模型之外,Google 还首次向开发者带来了 Gemini Omni Flash。 Omni Flash 被描述为一种用于视频生成和对话编辑的高质量、经济高效的模型,它允许用户通过多轮对话指令而不是单一的严格提示来创建和优化视频。

谷歌将这一组合视为构建全面多媒体体验的关键:使用 Nano Banana 2 Lite 快速生成数千张图像,然后使用 Omni Flash 转入多轮视频序列。这两个模型旨在协同工作,因此创意迭代可以从静态图像转移到动态图像,而无需切换平台。

在哪里访问它们

从发布之日起,这两种模型就可以在 Google 的开发者和企业平台上使用。 Nano Banana 2 Lite 和 Gemini Omni Flash 可以通过 Google AI StudioGemini APIGemini Enterprise Agent Platform 进行访问。他们还在 Google 消费产品中推出,包括搜索中的 AI 模式、Gemini 应用程序和 Google Flow。

广泛的可用性具有战略意义。通过在开发者工具和消费者应用程序中放置相同的模型,谷歌确保了双向改进——开发者反馈增强了消费者体验,而消费者规模则强化了生产使用的模型。

生成媒体价格战

这些产品的推出正值生成媒体激烈的价格战之际。随着图像和视频模型的成熟,竞争前沿已从原始质量转向每代成本和延迟。 Nano Banana 2 Lite 的价格为每 1,000 张图像 0.034 美元,生成时间为 4 秒,明显优于竞争对手的图像模型,推动整个市场朝着更快、更便宜的输出方向发展。

宣布发布该版本的 Google DeepMind 的产品经理 Alisa Fortin 和 Anish Nangia 强调,使用生成媒体进行构建从根本上讲是创意迭代,而只有当每个步骤都足够快且经济实惠且可以自由重复时,迭代才有效。

保持人工智能领先地位

生成媒体的发展速度比以往任何时候都快,每周都有新模型出现。在 AI Buzz Wire 上跟踪每个版本、基准测试和定价变化,这是您了解最新 AI 发展的大本营。

阅读更多人工智能新闻 →