Stable Diffusion 3 Medium开源发布:20亿参数模型正式对外开放
Stability AI正式发布SD3 Medium模型权重,在Hugging Face开源释出并提供第三方商用API,文字排版准确度较上一代明显提升。
2024年6月12日,Stability AI正式发布了Stable Diffusion 3 Medium(SD3 Medium)模型权重,以“Stability AI社区许可”形式在Hugging Face上开源释出,非商业用途可免费下载;同时通过官方Developer Platform,以及Fireworks AI、Replicate等第三方平台提供商用API。这是SD3系列自今年2月开放候补预览以来,首次真正向公众开放使用。
SD3 Medium参数量约20亿(2B),采用全新的“多模态扩散Transformer”(MMDiT)架构,取代上一代SDXL沿用的U-Net骨干网络,让文字与图像信息在同一组Transformer层中共同运算、表征各自独立。官方表示这是排版准确度与提示词理解力提升的关键设计。
技术意义:图片里的文字终于能用了
图像生成模型长期被诟病“画不出正确文字”——招牌、标语、书封常见扭曲乱码。SD3 Medium官方展示与早期用户测试都显示,英文拼写准确度明显进步,对需要在生成图中嵌入品牌名称、标语的商业用途是实质性突破;同时在多主体构图与长提示词遵循度上也优于SDXL。
与前代及竞品的差距
相较于SDXL(30亿参数,2023年发布),SD3 Medium参数规模较小,但架构代际不同,官方将其定位为“性能与硬件需求的平衡点”——20亿参数规模可在消费级显卡(如RTX 4090)上运行。与同期的Midjourney、DALL-E 3相比,SD3 Medium的差异化卖点在于开源可下载、可本地部署,延续了Stability AI一贯“开放模型阵营”的市场定位。
业界反应:许可条款引发讨论
开源社区普遍肯定SD3 Medium在文字生成与构图稳定度上的进步,但也有开发者对“Stability AI社区许可”条款提出疑虑——非商业用途虽可免费使用,商业使用门槛(年营收超过一定金额须另购商用许可)较过去SD1.5/SDXL明显收紧,部分开发者社区因此重提Stability AI商业模式转型的讨论。
对管理者的意义
对需要大量视觉内容(社交媒体贴文、商品图、广告素材)的企业而言,SD3 Medium补上了“图片中文字要正确”这块长期缺口,有望降低营销团队反复修正排版的成本;但许可条款的变化也提醒管理者,采用开源AI工具前务必先确认许可范围与规模门槛,避免上线后才发现需额外付费。