Stability AI 发布 Stable Diffusion 3.5:开放授权的最强图像模型系列
Stability AI于2024年10月22日发布Stable Diffusion 3.5系列,包含81亿参数的Large版与4步生成的Large Turbo版即日上线Hugging Face,25亿参数的Medium版预告10月29日跟进,全系列采用开放社区授权,年营收百万美元以下商用免费。
2024年10月22日,图像生成模型厂商Stability AI正式发布Stable Diffusion 3.5系列模型,官方宣称这是目前最强大的开放(open)图像生成模型家族。此次一次推出三个版本:Stable Diffusion 3.5 Large、Stable Diffusion 3.5 Large Turbo,两者即日起可在Hugging Face平台下载;较轻量的Stable Diffusion 3.5 Medium则预告于一周后、10月29日跟进发布。
规格与功能:从专业级到消费级都有对应版本
Stable Diffusion 3.5 Large拥有81亿参数,官方定位为适合专业级用途,可输出高达1百万像素等级的高分辨率图像,适合广告视觉、产品摄影修图等对画质要求较高的场景。Large Turbo则是Large的蒸馏(distilled)版本,通过模型压缩技术大幅减少生成步数,仅需4个推理步骤即可产出高品质图像,大幅缩短了等待时间,适合需要快速产出草图、大量迭代的工作流程。稍后上线的Medium版本仅25亿参数,设计目标是能在普通消费级显卡或笔记本上直接运行,降低了硬件门槛。
授权模式:年营收低于百万美元即可商用免费
此次发布的另一个重点是授权策略。全系列采用开放的Stability AI社区授权(Community License),个人与研究等非商业用途完全免费;即使是商业用途,只要企业年营收在100万美元以下,同样可以免费使用模型权重。这个门槛设计明显是瞄准中小企业与个人创作者、独立开发者,让他们无需授权费即可将模型整合进产品或服务中,等企业成长到一定规模后才需要另行洽谈商业授权,是相对友好的渐进式收费思路。
与前代及市场竞品的比较
相较于Stable Diffusion此前版本,3.5系列在架构与训练数据上进行了更新,官方强调生成质量、提示词理解准确度与图像多样性都有提升,尤其在人物姿态、手部细节等过去生成式AI长期的弱点上有针对性优化。以“开放模型”的定位来看,Stable Diffusion 3.5延续了Stability AI一贯与OpenAI DALL-E、Midjourney等封闭式付费服务区隔的策略——后者不开放模型权重、只能通过API或界面使用,而Stability AI选择让开发者能下载、微调、甚至私有部署模型,这对希望掌控数据隐私或需要定制微调的企业与开发者社区而言,是明显的差异化卖点。三个版本并行发布、覆盖从专业到消费级的策略,也反映厂商希望同时满足速度、质量、硬件成本三种不同的取舍需求。
对管理者的意义
对于营销、电商、社群运营或需要大量视觉素材的管理者而言,这类开放且免费商用的高品质图像模型,代表产出宣传图、产品示意图、社群贴文配图的成本门槛正持续下降;即便公司内部没有专职设计人力,只要具备基本技术整合能力,也能评估导入这类工具来加速视觉内容的生产周期,值得留意后续开源社区发布的界面工具是否更易于非技术人员使用。