专栏 AI 管理编年史 第 125/217 讲 查看课程目录

谷歌发布「Nano Banana」图像模型:Gemini 2.5 Flash Image正式上线

26/08/2025 259
4:13
谷歌发布「Nano Banana」图像模型:Gemini 2.5 Flash Image正式上线

Google DeepMind于2025年8月26日在Gemini App推出新款图像模型Gemini 2.5 Flash Image(昵称Nano Banana),主打多图融合、角色一致性延续、自然语言精准修图,多数任务10秒内完成,是目前评测最高的图像编辑模型。

谷歌于2025年8月26日在Gemini App中正式推出新一代图像模型,官方名称为Gemini 2.5 Flash Image,市场昵称「Nano Banana」,由Google DeepMind开发。根据谷歌官方博客公告,这款模型目前在公开图像编辑评测中排名全球最高,主打三项核心能力:一是可将多张图片融合成单一图像;二是能在保持角色一致性的前提下,延续同一角色的故事情节(例如同一人物换场景、换动作但长相不变);三是可用自然语言下达精准的修改指令,例如「把背景换成夜景」「给他戴上眼镜」,模型会理解语义并准确执行局部修改,而不是重新生成整张图。

速度是这次发布的另一大亮点。官方表示,多数图像任务可在10秒内完成,标准请求(如单一修图指令)仅需1至2秒即可产出结果,这个响应速度已接近「实时编辑」的体验,与过去图像生成动辄需要数十秒到数分钟的等待时间明显不同。

技术意义:从「生成」走向「理解后编辑」

过去一年图像生成模型的竞赛,多数厂商比拼的是「从文字生成一张全新的图」,画质、风格、构图是主战场。Nano Banana的差异化在于它强调「编辑」而非「重绘」——保留原图的角色、构图、光影逻辑,只针对指令描述的部分做修改,这需要模型对图片内容有更深的语义理解,而不只是根据提示词重新生成像素。官方特别提到模型会运用Gemini自身的「世界知识」来生成与编辑图片,意味着它不只是识别图片元素,还会结合常识推理去判断修改是否合理(例如换季节时应连带调整光影与穿着)。这种「理解后编辑」的能力,是图像模型从娱乐性生成工具,走向实用生产力工具的关键一步。

与前代及同期模型的比较

对照谷歌自家先前的图像生成能力,Nano Banana在角色一致性与多图融合上是明显跃进——过去同一角色在不同画面中容易「走样」,是图像生成模型长期的痛点之一。而放在同期业界脉络看,2025年上半年OpenAI、Midjourney等厂商也持续强化图像生成品质,但多数仍以「单张生成」为主要使用场景;Nano Banana把重点放在「多图合成+连续编辑+秒级速度」,更贴近实际工作流程中反复修改、迭代调整的需求,而非一次性产出成稿。

业界反应

消息传出后,Nano Banana迅速在社群与设计、营销从业者之间引发讨论,不少人将其与既有修图工具(如Photoshop的AI功能)并列比较,认为其低延迟与自然语言操作门槛大幅降低了「非设计背景者」做图像编修的难度。这也被视为谷歌在图像生成赛道上,从「跟随者」转为「评测最高」的一次关键表态。

对管理者的意义

对于需要大量产出营销素材、商品图、社群贴文配图的管理者而言,Nano Banana代表的是「修图门槛」被进一步降低——不需要专业设计技能,用一句话就能微调图片,且速度快到可以在会议讨论当下即时修改给大家看。可以尝试让营销或门店同事用一张现有商品照,直接用自然语言指令做背景、季节、陈列方式的变化测试,观察成果是否已达到可直接使用的水准,借此评估是否能缩短素材制作与外部设计协作的时间成本。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 xAI 发布 grok-code-fast-1:专攻「代理式写代码」的高速低成本模型

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策