Stability AI 发布 Stable Diffusion 3 早期预览:多主体构图与文字拼写大幅升级
Stability AI 于2024年2月22日发布 Stable Diffusion 3 早期预览,采用全新 diffusion transformer 架构与 flow matching 技术,大幅改善多主体图像生成与文字拼写能力,提供8亿至80亿参数多种规模,目前仅开放候补名单申请。
2024年2月22日,图像生成模型公司 Stability AI 发布 Stable Diffusion 3 早期预览,这是该公司旗舰图像生成模型系列的最新一代。与前代 Stable Diffusion XL 不同,SD3 舍弃原本的 U-Net 扩散架构,改用「diffusion transformer」新架构,并搭配「flow matching」训练技术。此次发布提供从8亿到80亿参数不等的多种模型规模,让用户可以根据算力资源与需求灵活选择。目前 SD3 尚未正式公开发布,仅开放用户在官网申请候补名单,等待逐步开放早期使用权限。
技术意义:从 U-Net 到 Transformer 的架构转向
过去主流扩散模型多以 U-Net 卷积架构为基础,SD3 改用 transformer 架构处理扩散过程,这与近年语言模型(如 GPT 系列)的技术路线更为接近,理论上有利于模型规模化与多模态理解能力提升。搭配 flow matching 这种新的概率路径训练方法,官方展示示例显示,SD3 在同一张图片中生成多个主体(例如多个人物或物体同时出现)时,构图稳定性与细节保留明显优于前代;模型准确拼写图片中文字(例如招牌、标语)的能力也有显著提升,这正是以往图像生成模型公认的一大短板。
与前代及竞品的对比:预览而非正式发布
Stable Diffusion XL 在文字拼写与多主体构图上经常出现扭曲、重复肢体或乱码文字,这也是 Midjourney、DALL·E 3 等竞品持续被拿来对比的痛点。Stability AI 选在 DALL·E 3(已整合进 ChatGPT)声势正盛之时发布 SD3 预览,被外界视为开源阵营对商业闭源模型的正面回应;多种参数规模设计,也让 SD3 有机会同时满足云端与本地端部署。值得留意的是,此次仅为「早期预览」并附带候补名单机制,尚未提供可下载的模型权重或公开 API,官方也尚未公布正式发布时间表与授权条款,业界普遍解读 Stability AI 是先以展示案例争取话语权,同时观察反馈以调整最终版本。
对管理者的意义
对于市场营销、电商或内容团队的管理者而言,「文字拼写准确」与「多主体构图稳定」两项进展,意味着未来有望更放心地将 AI 生成图像直接用于含文字的营销素材(如促销看板、社群推文配图),而不仅止于灵感草稿。目前仍处候补阶段,管理者可先关注官方发布时间表,提前思考素材审核与 AI 工具引入的流程规划。
大家怎么说 · 3 条留言