專欄 AI 管理編年史 第 125/217 講 查看課程目錄

Google發表「Nano Banana」影像模型:Gemini 2.5 Flash Image正式上線

26/08/2025 258
4:13
Google發表「Nano Banana」影像模型:Gemini 2.5 Flash Image正式上線

Google DeepMind於2025年8月26日在Gemini App推出新款影像模型Gemini 2.5 Flash Image(暱稱Nano Banana),主打多圖融合、角色一致性延續、自然語言精準修圖,多數任務10秒內完成,是目前評比最高的影像編輯模型。

Google於2025年8月26日在Gemini App中正式推出新一代影像模型,官方名稱為Gemini 2.5 Flash Image,市場暱稱「Nano Banana」,由Google DeepMind開發。根據Google官方部落格公告,這款模型目前在公開影像編輯評比中排名全球最高,主打三項核心能力:一是可將多張圖片融合成單一影像;二是能在維持角色一致性的前提下,延續同一角色的故事情節(例如同一人物換場景、換動作但長相不變);三是可用自然語言下達精準的修改指令,例如「把背景換成夜景」「幫他戴上眼鏡」,模型會理解語意並準確執行局部修改,而非重新生成整張圖。

速度是這次發表的另一項重點。官方表示,多數影像任務可在10秒內完成,標準請求(如單一修圖指令)僅需1至2秒即可產出結果,這個反應速度已經接近「即時編輯」的體驗,與過去影像生成動輒需要數十秒到分鐘的等待時間明顯不同。

技術意義:從「生成」走向「理解後編輯」

過去一年的影像生成模型競賽,多數廠商比拚的是「從文字生成一張全新的圖」,畫質、風格、構圖是主戰場。Nano Banana的差異化在於它強調「編輯」而非「重繪」——保留原圖的角色、構圖、光影邏輯,只針對指令描述的部分做修改,這需要模型對圖片內容有更深的語意理解,而不只是根據提示詞重新生成像素。官方特別提到模型會運用Gemini本身的「世界知識」來生成與編輯圖片,意味著它不只是辨識圖片元素,還會結合常識推理去判斷修改是否合理(例如換季節時該連帶調整光影與穿著)。這種「理解後編輯」的能力,是影像模型從娛樂性生成工具,走向實用生產力工具的關鍵一步。

與前代及同期模型的比較

對照Google自家先前的影像生成能力,Nano Banana在角色一致性與多圖融合上是明顯躍進——過去同一角色在不同畫面中容易「走樣」,是影像生成模型長期的痛點之一。而放在同期業界脈絡看,2025年上半年OpenAI、Midjourney等廠商也持續強化影像生成品質,但多數仍以「單張生成」為主要使用情境;Nano Banana把重點放在「多圖合成+連續編輯+秒級速度」,更貼近實際工作流程中反覆修改、疊代調整的需求,而非一次性產出完稿。

業界反應

消息傳出後,Nano Banana迅速在社群與設計、行銷從業者之間引發討論,不少人將其與既有修圖工具(如Photoshop的AI功能)並列比較,認為其低延遲與自然語言操作門檻大幅降低了「非設計背景者」做圖像編修的難度。這也被視為Google在影像生成賽道上,從「跟隨者」轉為「排名最高」的一次關鍵表態。

對管理者的意義

對於需要大量產出行銷素材、商品圖、社群貼文配圖的管理者而言,Nano Banana代表的是「修圖門檻」被進一步壓低——不需要專業設計技能,用一句話就能微調圖片,且速度快到可以在會議討論當下即時修改給大家看。可以試著讓行銷或門市同仁用一張現有商品照,直接用自然語言指令做背景、季節、陳列方式的變化測試,觀察成果是否已經達到可直接使用的水準,藉此評估是否能縮短素材製作與外部設計協作的時間成本。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 xAI 發表 grok-code-fast-1:專攻「代理式寫程式」的高速低成本模型

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策