专栏 AI 管理编年史 第 32/217 讲 查看课程目录

Stability AI 发布 Stable Diffusion 3 早期预览:多主体构图与文字拼写大幅升级

22/02/2024 80
1:15
Stability AI 发布 Stable Diffusion 3 早期预览:多主体构图与文字拼写大幅升级

Stability AI 于2024年2月22日发布 Stable Diffusion 3 早期预览,采用全新 diffusion transformer 架构与 flow matching 技术,大幅改善多主体图像生成与文字拼写能力,提供8亿至80亿参数多种规模,目前仅开放候补名单申请。

2024年2月22日,图像生成模型公司 Stability AI 发布 Stable Diffusion 3 早期预览,这是该公司旗舰图像生成模型系列的最新一代。与前代 Stable Diffusion XL 不同,SD3 舍弃原本的 U-Net 扩散架构,改用「diffusion transformer」新架构,并搭配「flow matching」训练技术。此次发布提供从8亿到80亿参数不等的多种模型规模,让用户可以根据算力资源与需求灵活选择。目前 SD3 尚未正式公开发布,仅开放用户在官网申请候补名单,等待逐步开放早期使用权限。

技术意义:从 U-Net 到 Transformer 的架构转向

过去主流扩散模型多以 U-Net 卷积架构为基础,SD3 改用 transformer 架构处理扩散过程,这与近年语言模型(如 GPT 系列)的技术路线更为接近,理论上有利于模型规模化与多模态理解能力提升。搭配 flow matching 这种新的概率路径训练方法,官方展示示例显示,SD3 在同一张图片中生成多个主体(例如多个人物或物体同时出现)时,构图稳定性与细节保留明显优于前代;模型准确拼写图片中文字(例如招牌、标语)的能力也有显著提升,这正是以往图像生成模型公认的一大短板。

与前代及竞品的对比:预览而非正式发布

Stable Diffusion XL 在文字拼写与多主体构图上经常出现扭曲、重复肢体或乱码文字,这也是 Midjourney、DALL·E 3 等竞品持续被拿来对比的痛点。Stability AI 选在 DALL·E 3(已整合进 ChatGPT)声势正盛之时发布 SD3 预览,被外界视为开源阵营对商业闭源模型的正面回应;多种参数规模设计,也让 SD3 有机会同时满足云端与本地端部署。值得留意的是,此次仅为「早期预览」并附带候补名单机制,尚未提供可下载的模型权重或公开 API,官方也尚未公布正式发布时间表与授权条款,业界普遍解读 Stability AI 是先以展示案例争取话语权,同时观察反馈以调整最终版本。

对管理者的意义

对于市场营销、电商或内容团队的管理者而言,「文字拼写准确」与「多主体构图稳定」两项进展,意味着未来有望更放心地将 AI 生成图像直接用于含文字的营销素材(如促销看板、社群推文配图),而不仅止于灵感草稿。目前仍处候补阶段,管理者可先关注官方发布时间表,提前思考素材审核与 AI 工具引入的流程规划。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。

大家怎么说 · 3 条留言

阿丽物流主管
我们社群素材的文字拼写卷死了,设计师一直在改。这个能解决吗?现在就需要。
02/08/2026 11:48
9
996幸存者直播主管
确实,质量提升的话工作流程能简化不少
05/08/2026 04:35
报表苦手数字营销经理
等死了,AI 生成的社群文字素材太多问题了。这个升级了能用吗?想先研究研究。
05/07/2026 14:08
下一讲・AI 管理编年史 Mistral AI 发布旗舰模型 Mistral Large,携手 Microsoft Azure

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策