Stable Diffusion // Stability AI 访问官网 ↗
  • 文生图
  • 开源模型
  • 潜在扩散
  • 图像生成
  • 本地部署
  • AI 绘画

当「一句话出图」从科幻变日常,Stable Diffusion 想做那个把模型权重交到每个人手里的开源底座

绘画与设计的门槛,过去卡在「要会画」。Stable Diffusion 是 Stability AI 于 2022 年 8 月开源的文生图扩散模型,基于慕尼黑大学 CompVis 团队的潜在扩散模型(Latent Diffusion Model, LDM)研究,用一句文字描述即可生成高质量图像,并把模型权重以开放许可证释出。它把原本被大厂把持的图像生成能力,变成开发者能在本地显卡上跑的开源引擎,催生了从 Stable Diffusion WebUI、ComfyUI 到无数二次开发插件的庞大生态。对创作者它意味着「从句子到画面的发电机」,让普通人也能拥有可重复的绘图流水线,对行业它验证的是生成式视觉能力不必锁在云端订阅里,也能靠社区壮大。

一句话认识它:Stable Diffusion 是 Stability AI 开源的文本到图像扩散模型[1],基于潜在扩散(Latent Diffusion)架构,用 CLIP 文本编码器把提示词映射成图像,并以 CreativeML OpenRAIL-M 许可证开放权重[2]。对创作者它是「从句子到画面的发电机」,对开发者它是「可本地部署、可微调、可受限商用」的开源底座——它验证的是生成式视觉能力不必锁在云端订阅里,也能靠社区壮大。

先看四个硬指标:它到底凭什么撑起整个开源绘图潮

图像模型最怕「吹得响、跑不动」。下面这组把 Stable Diffusion 对外可见的关键事实摊开成可对照的点(具体以官方与版本为准)。

2022.8
首个公开版本 v1.4 发布时间,由 Stability AI 在 CompVis 研究基础上开源,开启文生图平民化
~8.9亿
SD 1.x 主 U-Net 参数量级(约 8.9 亿),配合 CLIP 文本编码器,可在消费级显卡运行,降低本地部署门槛
1024²
SDXL 1.0 支持的原生分辨率(1024×1024),相较 1.x 的 512² 显著提升细节与构图质量
开源
以 CreativeML OpenRAIL-M 许可释出权重,允许研究、非商业与受限商用,催生海量二次开发与插件生态

六块能力拆解:一个开源绘图模型能替你干哪些活

把「AI 绘画」拆开看,真正留住人的是它背后那一串能单独用、也能串成创作流的能力。Stable Diffusion 主要把这几块摊在同一体系里。

① 文生图 txt2img

输入提示词(prompt)即生成图像,描述越具体、风格词越明确,出图越贴近预期,是大多数人的第一入口。

② 图生图 img2img

以一张现有图为底,按提示词重绘或风格迁移,适合把草图、照片转成特定画风,保留大致构图,重绘强度可调以控制原图保留比例。

③ 局部重绘 inpainting

只框选画面某块区域重画,不改其余部分,用于改脸、换衣、补背景,比整图重来更可控,选区可多次叠加,适合精细修图而非大改。

④ 生态:WebUI / ComfyUI

AUTOMATIC1111 的 WebUI 与节点式 ComfyUI 把 SD 封装成可视化工作流,插件市场极大降低了使用门槛,拖拽式操作让非技术用户也能上手。

⑤ 模型微调

通过 DreamBooth、LoRA、Embedding 等方法注入专属角色或画风,让个人也能训练「自己的模型」,社区模型站因此爆发,风格与角色模型琳琅满目,按需取用即可。

⑥ 企业 API

Stability AI 提供云端 API 与托管推理,企业无需自建显卡也能调用最新版本,兼顾可控与合规需求。

Stable Diffusion vs 闭源云端绘图(Midjourney / DALL·E)

要理解 SD 的位置,得看它和「订阅即用的闭源服务」分别长什么样。下面两栏不是「谁画得美」,而是「控制权」与「便利性」的差异。

闭源云端服务的一面

  • 要订阅:按月付费才能用,停费即停权,成本随用量累积。
  • 数据上云:提示词与图像经对方服务器,私密创作有外泄顾虑,企业合规受限。
  • 难微调:不能直接拿到权重做本地训练,专属风格只能靠提示词硬凑,定制天花板低。

Stable Diffusion 给出的一面

  • 本地可控:权重开源可自部署,显卡在手就能跑,数据不出本机,适合私密与合规场景。
  • 可微调:LoRA/DreamBooth 让个人训练专属模型,社区模型站海量可选用,定制自由度高。
  • 生态开源:WebUI、ComfyUI、插件全免费,能力边界由社区推动,不被单一厂商节奏绑死。

四步走:从空白提示词到可出图

绘图模型最怕「给句废话就结束」。下面这条路径把 SD 从「试一试」推进到「能产出」,你可以只取前两步,也可以走完全程做微调。

  1. 准备运行环境装 WebUI 或 ComfyUI,确认显卡驱动与模型权重就位;本地部署先看显存,云端则直接调 API 省去环境。
  2. 写提示词用主体 + 风格 + 光线 + 画质词组织 prompt,负面提示词(negative prompt)排除不想出现的元素,决定成图方向。
  3. 出图与迭代设分辨率、步数、采样器后生成,据结果调词、换模型或重绘局部,逐步逼近满意稿,而非一次成型。
  4. 导出与微调满意图导出,如需专属角色再跑 LoRA/DreamBooth 训练,把个人风格固化成可复用模型,反哺后续创作。

三个最容易踩进去的坑

01

忽视版权与训练数据SD 训练数据含受版权图像,商用前确认授权与当地法规;OpenRAIL 明确限制某些敏感用途,别踩使用红线。

02

误读开源许可开源不等于无限制。CreativeML OpenRAIL-M 对生成内容与再分发有约束,企业商用务必读许可原文与合规要求。

03

显存与内容安全本地跑吃显存,低配机器出图慢;模型自带安全过滤,但绕过滤波生成违规内容违反平台与法律,务必自律。

常见问答

Stable Diffusion 是什么?和 Stability AI 什么关系?

Stable Diffusion 是 Stability AI 于 2022 年 8 月开源的文本到图像扩散模型,技术源自慕尼黑大学 CompVis 团队的潜在扩散研究;Stability AI 负责开源发布与后续版本推进。

它真的开源免费吗?

权重以 CreativeML OpenRAIL-M 许可证开放,研究、非商业与受限商用可用;但许可对生成内容与再分发有约束,企业商用需读原文并合规。

本地能跑吗?需要什么配置?

能。SD 1.x 约 8.9 亿参数,消费级显卡(如 4–8GB 显存)即可跑 512²;SDXL 建议更高显存与 1024² 分辨率。

和 Midjourney、DALL·E 比强在哪?

强在「开源 + 本地可控 + 可微调」:闭源服务要订阅、数据上云、定制受限,SD 把权重交给你,生态插件与社区模型极大。

提示词怎么写才出好图?

按「主体 + 风格 + 光线 + 画质」组织,配合负面提示词排除瑕疵;多迭代调词、换模型与重绘局部,比一次成型更稳。

有哪些主流前端与微调方法?

前端以 AUTOMATIC1111 WebUI 与节点式 ComfyUI 最常见;微调常用 LoRA、DreamBooth、Textual Inversion,社区模型站可下载他人训练成果。

参考资料

  1. 来源:Stability AI 官网(Stable Diffusion 发布与平台):https://stability.ai
  2. 来源:CompVis — Stable Diffusion 开源仓库(权重与代码):https://github.com/CompVis/stable-diffusion
  3. 来源:Hugging Face — Stable Diffusion 模型卡(v1.5 等):https://huggingface.co/runwayml/stable-diffusion-v1-5
  4. 来源:arXiv — High-Resolution Image Synthesis with Latent Diffusion Models(LDM 论文):https://arxiv.org/abs/2112.10752
  5. 来源:维基百科 — Stable Diffusion(背景与影响):https://en.wikipedia.org/wiki/Stable_Diffusion
  6. 来源:Stability AI — SDXL 1.0 公告(1024² 与生态):https://stability.ai/news/stable-diffusion-xl-1-announcement

青衣网络 AI 观察团队 · 最后更新 2026-08-25 | 本文基于 Stable Diffusion 的公开信息整理,用于帮助读者理解其定位、能力与边界;版本、参数量、许可条款与功能随时可能调整,商用与合规请以官方许可原文与最新说明为准。