Stability AI 發表 Stable Diffusion 3 早期預覽:多主體構圖與文字拼寫大躍進
Stability AI 於2024年2月22日發表 Stable Diffusion 3 早期預覽,採全新 diffusion transformer 架構與 flow matching 技術,大幅改善多主體圖像生成與文字拼寫能力,提供8億至80億參數多種規模,目前僅開放候補名單申請。
2024年2月22日,圖像生成模型公司 Stability AI 發表 Stable Diffusion 3 早期預覽,這是該公司旗艦圖像生成模型系列的最新世代。與前代 Stable Diffusion XL 不同,SD3 捨棄原本的 U-Net 擴散架構,改採「diffusion transformer」新架構,並搭配「flow matching」訓練技術。此次發表提供從8億到80億參數不等的多種模型規模,讓使用者能依運算資源與需求彈性選擇。目前 SD3 尚未正式公開釋出,僅開放使用者於官網申請候補名單,等待逐步開放早期存取。
技術意義:從 U-Net 到 Transformer 的架構轉向
過去主流擴散模型多以 U-Net 卷積架構為基礎,SD3 改用 transformer 架構處理擴散過程,這與近年語言模型(如 GPT 系列)的技術路線更為接近,理論上有利於模型規模化與多模態理解能力提升。搭配 flow matching 這種新的機率路徑訓練方法,官方展示範例顯示,SD3 生成多主體圖片(例如多個人物或物件同時出現)時,構圖穩定度與細節保留明顯優於前代;模型準確拼寫圖片中文字(如招牌、標語)的能力也有顯著提升,這正是過去圖像生成模型公認的一大弱項。
與前代及競品的比較:預覽而非正式發布
Stable Diffusion XL 在文字拼寫與多主體構圖上經常出現扭曲、重複肢體或亂碼文字,這也是 Midjourney、DALL·E 3 等競品持續被拿來比較的痛點。Stability AI 選在 DALL·E 3(已整合進 ChatGPT)聲勢正盛之際發表 SD3 預覽,被外界視為開源路線陣營對商業封閉模型的正面回應;多種參數規模設計,也讓 SD3 有機會同時滿足雲端與本地端部署。值得留意的是,此次僅為「早期預覽」並附候補名單機制,尚未提供可下載模型權重或公開 API,官方也尚未公布正式發布時程與授權條款,業界普遍解讀 Stability AI 是先以展示範例爭取話語權,同時觀察回饋以調整最終版本。
對管理者的意義
對行銷、電商或內容團隊的管理者而言,「文字拼寫準確」與「多主體構圖穩定」兩項進展,意味著未來可望更放心地將 AI 生成圖像直接用於含文字的行銷素材(如促銷看板、社群貼文圖),而非僅止於發想草稿。目前仍處候補階段,管理者可先關注官方釋出時程,提前思考素材審核與 AI 工具導入的流程規劃。