Google發表Nano Banana Pro:新一代影像模型讓圖中文字終於寫對
Google DeepMind於2025年11月20日發表Nano Banana Pro(正式名稱Gemini 3 Pro Image),是8月版Nano Banana的進階版,主打圖片文字渲染精準度與世界知識運用能力大幅提升。
Google DeepMind於2025年11月20日發表新一代影像生成模型Nano Banana Pro,正式名稱為Gemini 3 Pro Image。這是繼今年8月推出的Nano Banana(技術代號Gemini 2.5 Flash Image)之後的進階版本,同樣由Google DeepMind團隊開發,並整合進Gemini系列模型家族。
根據官方部落格說明,Nano Banana Pro的兩大核心升級,一是「圖片中的文字渲染精準度」,二是「運用世界知識生成與編輯圖片的能力」。過去生成式影像模型普遍存在一個明顯弱點:只要畫面中需要出現文字(例如招牌、標語、圖表標籤、產品包裝上的字),模型往往會生成扭曲、拼錯或無意義的亂碼字元。Nano Banana Pro針對這個痛點做了大幅改善,讓生成圖像中的文字更清晰、可讀性更高。
技術意義:文字渲染一直是生成影像的最後一哩路
影像生成模型能畫出精緻的人臉、光影與構圖,但要在畫面裡準確寫出一段文字,牽涉的是完全不同的能力——模型必須理解字元的形狀結構與語意排列邏輯,而非單純模仿視覺紋理。這也是為什麼過去兩年主流影像模型在「海報」「招牌」「圖表」這類需要精準文字的應用場景上,始終被使用者詬病。Nano Banana Pro把這道關卡當作重點突破對象,顯示Google認為文字渲染精準度是影像模型從「玩具」邁向「生產力工具」的關鍵門檻。
與前代比較:從「能生圖」到「懂脈絡」
另一項升級——運用世界知識生成與編輯圖片——意味著模型不只是根據提示詞畫圖,還能結合對真實世界事物、品牌、場景邏輯的理解,讓生成或編輯後的內容更符合現實情境,而不是天馬行空、似是而非。相較8月版Nano Banana,Pro版本的定位更像是「專業級」加強版,鎖定需要高精準度輸出的商業應用場景,而非單純的娛樂性創作。
對管理者而言,這則新聞的意義在於:當AI影像工具能穩定產出「文字正確」的圖片,行銷素材、簡報配圖、社群貼文、產品文案示意圖等日常視覺內容的製作門檻將進一步降低,值得留意這類工具何時能整合進團隊現有的內容產製流程。