Stable Diffusion 3 Medium 開源釋出:20億參數模型正式對外開放
Stability AI正式發布SD3 Medium模型權重,於Hugging Face開源釋出、並提供第三方商用API,文字排版準確度較前代明顯提升。
Stability AI 於 2024 年 6 月 12 日正式發布 Stable Diffusion 3 Medium(SD3 Medium)模型權重,以「Stability AI 社群授權」形式在 Hugging Face 開源釋出,非商業用途可免費下載;同時透過官方 Developer Platform 及 Fireworks AI、Replicate 等第三方平台提供商用 API。這是 SD3 系列自今年 2 月釋出候補預覽以來,首次真正對外開放使用。
SD3 Medium 參數量約 20 億(2B),採用全新的「多模態擴散 Transformer」(MMDiT)架構,取代前代 SDXL 的 U-Net 骨幹,讓文字與影像資訊在同一組 Transformer 層中共同運算、表徵各自獨立。官方表示這是排版準確度與提示詞理解力提升的關鍵設計。
技術意義:文字排版終於能用了
影像生成模型長期被詬病「畫不出正確文字」——招牌、標語、書封常見扭曲亂碼。SD3 Medium 官方展示與早期使用者測試都顯示,英文拼寫準確度明顯進步,對需要在圖中嵌入品牌名稱、標語的商業用途是實質突破;同時在多主體構圖與長提示詞遵循度上也優於 SDXL。
與前代及競品的落差
相較於 SDXL(30 億參數,2023 年釋出),SD3 Medium 參數規模較小,但架構世代不同,官方定位其為「效能與硬體需求的平衡點」——20 億參數規模可在消費級顯卡(如 RTX 4090)上執行。與同期 Midjourney、DALL-E 3 相比,SD3 Medium 的差異化賣點在於開源可下載、可本地部署,延續 Stability AI「開放模型陣營」的一貫市場定位。
業界反應:授權條款引發討論
開源社群普遍肯定文字生成與構圖穩定度的進步,但也有開發者對「Stability AI 社群授權」提出疑慮——非商業用途雖免費,商業使用門檻(年營收超過一定金額須另購商用授權)較過去 SD1.5/SDXL 明顯收緊,部分社群因此重提 Stability AI 商業模式轉型的討論。
對管理者的意義
對需要大量視覺內容(社群貼文、商品圖、廣告素材)的企業而言,SD3 Medium 補上了「圖片中文字要正確」這塊長期缺口,可望降低行銷團隊反覆修正排版的成本;但授權條款的變化也提醒管理者,採用開源 AI 工具前務必先確認授權範圍與規模門檻,避免上線後才發現需額外付費。
大家怎麼說 · 5 則留言