跳转到内容
主站 新闻 控制台

开始使用 Nano Banana 2 Lite 和 Gemini Omni Flash 构建

· DeepMind
DeepMind

2026年6月30日

我们正在通过 Nano Banana 2 Lite(我们速度最快、成本效益最高的 Gemini 图像模型)以及用于高质量视频生成和对话式编辑的 Gemini Omni Flash,让你更轻松地试验并扩展你的创意。

Alisa Fortin

产品经理,Google DeepMind

Anish Nangia

产品经理,Google DeepMind

今天,我们通过两项重大发布,让实验、打磨和规模化你的创意变得更快、更简单:

生成式媒体的构建,往往关乎创意迭代。借助这两款模型,开发者可以构建端到端的完整多媒体体验,将快速图像生成与视频创作和编辑连接起来。无论你的工作流需要生成成千上万张图片,还是编辑多轮视频序列,你现在都有两款新模型可用于更快构建、无缝迭代,并将你的创意愿景变为现实。

Nano Banana 2 Lite:我们速度最快、成本效益最高的 Gemini 图像模型

观看一个使用简单提示词生成图像时,Nano Banana 2 Lite 与 Nano Banana 2 在速度和质量上的并排对比。

Nano Banana 2 Lite(gemini-3.1-flash-lite-image)专为快速创意构思和高速开发流程而设计,在这些场景中,速度和成本是首要约束。对于当前使用我们第一代 Nano Banana(gemini-2.5-flash-image)的开发者,我们推荐将其替换为 Nano Banana 2 Lite;现在即可切换,并在关键性能维度上立即获得收益。

Nano Banana 2 与 2 Lite 相较于竞品 AI 图像模型的性能基准测试,评估生成/编辑质量(Elo 分数)、处理延迟以及每 1000 分辨率图像的成本之间的权衡。

Nano Banana 2 Lite 的突出优势:

  • 延迟:可在 4 秒内输出文生图结果。这使其非常适合交互式原型设计和快速视觉草图制作。
  • 成本效益(每 1000 张图像 0.034 美元):对于专注于草拟、创意构思、运营预算管理或低带宽使用的开发者来说,这是一个高性价比选择。

尽管优先考虑速度,Nano Banana 2 Lite 仍保留了可靠的提示词遵循能力、强一致性的人物角色表现,以及清晰可读的图中文字渲染。

了解 Nano Banana 系列

  • Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image):为速度而生。针对近实时、高容量工作流进行了优化,在超低延迟至关重要的场景下表现出色。
  • Nano Banana 2(Gemini 3.1 Flash Image):通用型主力模型。以更低延迟提供高质量输出,在性能与成本之间实现最佳平衡。
  • Nano Banana Pro(Gemini 3 Pro Image):针对复杂的专业级用例进行了优化。它在准确性比速度更重要的任务中,提供最强的控制能力和高级推理能力。
  • Nano Banana(Gemini 2.5 Flash Image):我们的旧版模型。我们建议升级到 Nano Banana 2 Lite,以获得更好的质量、更快的速度和更低的成本。

如需查看完整的模型能力列表以及集成方式,请查阅开发者 文档

随着在开发者平台上发布,Nano Banana 2 Lite 也将登陆 Google 面向消费者的产品,包括 Search 中的 AI Mode、Gemini 应用、NotebookLM、Google Photos、Stitch、Google Flow 和 Google Ads。

使用 Gemini Omni Flash 体验高质量、成本效益型视频编辑和生成

观看一个人使用 Gemini Omni 施展四个数字魔法,例如从手机中拉出一个 3D 气球字样,以及把屏幕里的水倒进玻璃杯里。角落里有一个小小的“原始”视频,展示她在添加 Omni 生成的特效之前实际上是如何拍摄这些魔法效果的。

在 Google I/O 上,我们介绍了 Gemini Omni Flash,这是一款将 Gemini 的多模态推理与视频生成和编辑相结合的模型。今天,Gemini Omni Flash(gemini-omni-flash-preview)正在通过 Gemini API 和 Google AI Studio 向开发者推出,原生支持由文本、图像和视频输入组合而成的高质量视频生成和对话式编辑。该模型的定价极具竞争力,每秒视频输出收费 0.10 美元,与 Veo 3.1 Fast 相同。

Omni Flash 的突出优势:

  • 对话式视频编辑:使用自然语言精修和编辑视频。
  • 多模态引用:结合图像、文本和视频等输入,以保持对画面场景的控制与一致性。
  • 现实世界知识:Omni 调用 Gemini 的知识,例如历史、生物学和叙事逻辑,来构建引人入胜的视频。
  • 文本与动作同步:通过简单提示,将文本和图形直接与视频动作关联起来。

如需查看全面的基准测试信息,请访问 Google DeepMind 的 Gemini Omni 网页。

局限性:

  • 目前 Omni 仅支持 10 秒视频生成,更长时长即将推出。
  • 该模型在 Gemini API 中尚不支持上传音频参考和场景扩展。
  • API 架构最多接受 3 秒时长的视频参考