当「一句话出图」从科幻变日常,Stable Diffusion 想做那个把模型权重交到每个人手里的开源底座
绘画与设计的门槛,过去卡在「要会画」。Stable Diffusion 是 Stability AI 于 2022 年 8 月开源的文生图扩散模型,基于慕尼黑大学 CompVis 团队的潜在扩散模型(Latent Diffusion Model, LDM)研究,用一句文字描述即可生成高质量图像,并把模型权重以开放许可证释出。它把原本被大厂把持的图像生成能力,变成开发者能在本地显卡上跑的开源引擎,催生了从 Stable Diffusion WebUI、ComfyUI 到无数二次开发插件的庞大生态。对创作者它意味着「从句子到画面的发电机」,让普通人也能拥有可重复的绘图流水线,对行业它验证的是生成式视觉能力不必锁在云端订阅里,也能靠社区壮大。
一句话认识它:Stable Diffusion 是 Stability AI 开源的文本到图像扩散模型[1],基于潜在扩散(Latent Diffusion)架构,用 CLIP 文本编码器把提示词映射成图像,并以 CreativeML OpenRAIL-M 许可证开放权重[2]。对创作者它是「从句子到画面的发电机」,对开发者它是「可本地部署、可微调、可受限商用」的开源底座——它验证的是生成式视觉能力不必锁在云端订阅里,也能靠社区壮大。
先看四个硬指标:它到底凭什么撑起整个开源绘图潮
图像模型最怕「吹得响、跑不动」。下面这组把 Stable Diffusion 对外可见的关键事实摊开成可对照的点(具体以官方与版本为准)。
六块能力拆解:一个开源绘图模型能替你干哪些活
把「AI 绘画」拆开看,真正留住人的是它背后那一串能单独用、也能串成创作流的能力。Stable Diffusion 主要把这几块摊在同一体系里。
① 文生图 txt2img
输入提示词(prompt)即生成图像,描述越具体、风格词越明确,出图越贴近预期,是大多数人的第一入口。
② 图生图 img2img
以一张现有图为底,按提示词重绘或风格迁移,适合把草图、照片转成特定画风,保留大致构图,重绘强度可调以控制原图保留比例。
③ 局部重绘 inpainting
只框选画面某块区域重画,不改其余部分,用于改脸、换衣、补背景,比整图重来更可控,选区可多次叠加,适合精细修图而非大改。
④ 生态:WebUI / ComfyUI
AUTOMATIC1111 的 WebUI 与节点式 ComfyUI 把 SD 封装成可视化工作流,插件市场极大降低了使用门槛,拖拽式操作让非技术用户也能上手。
⑤ 模型微调
通过 DreamBooth、LoRA、Embedding 等方法注入专属角色或画风,让个人也能训练「自己的模型」,社区模型站因此爆发,风格与角色模型琳琅满目,按需取用即可。
⑥ 企业 API
Stability AI 提供云端 API 与托管推理,企业无需自建显卡也能调用最新版本,兼顾可控与合规需求。
Stable Diffusion vs 闭源云端绘图(Midjourney / DALL·E)
要理解 SD 的位置,得看它和「订阅即用的闭源服务」分别长什么样。下面两栏不是「谁画得美」,而是「控制权」与「便利性」的差异。
闭源云端服务的一面
- 要订阅:按月付费才能用,停费即停权,成本随用量累积。
- 数据上云:提示词与图像经对方服务器,私密创作有外泄顾虑,企业合规受限。
- 难微调:不能直接拿到权重做本地训练,专属风格只能靠提示词硬凑,定制天花板低。
Stable Diffusion 给出的一面
- 本地可控:权重开源可自部署,显卡在手就能跑,数据不出本机,适合私密与合规场景。
- 可微调:LoRA/DreamBooth 让个人训练专属模型,社区模型站海量可选用,定制自由度高。
- 生态开源:WebUI、ComfyUI、插件全免费,能力边界由社区推动,不被单一厂商节奏绑死。
四步走:从空白提示词到可出图
绘图模型最怕「给句废话就结束」。下面这条路径把 SD 从「试一试」推进到「能产出」,你可以只取前两步,也可以走完全程做微调。
- 准备运行环境装 WebUI 或 ComfyUI,确认显卡驱动与模型权重就位;本地部署先看显存,云端则直接调 API 省去环境。
- 写提示词用主体 + 风格 + 光线 + 画质词组织 prompt,负面提示词(negative prompt)排除不想出现的元素,决定成图方向。
- 出图与迭代设分辨率、步数、采样器后生成,据结果调词、换模型或重绘局部,逐步逼近满意稿,而非一次成型。
- 导出与微调满意图导出,如需专属角色再跑 LoRA/DreamBooth 训练,把个人风格固化成可复用模型,反哺后续创作。
三个最容易踩进去的坑
忽视版权与训练数据SD 训练数据含受版权图像,商用前确认授权与当地法规;OpenRAIL 明确限制某些敏感用途,别踩使用红线。
误读开源许可开源不等于无限制。CreativeML OpenRAIL-M 对生成内容与再分发有约束,企业商用务必读许可原文与合规要求。
显存与内容安全本地跑吃显存,低配机器出图慢;模型自带安全过滤,但绕过滤波生成违规内容违反平台与法律,务必自律。
常见问答
Stable Diffusion 是什么?和 Stability AI 什么关系?
Stable Diffusion 是 Stability AI 于 2022 年 8 月开源的文本到图像扩散模型,技术源自慕尼黑大学 CompVis 团队的潜在扩散研究;Stability AI 负责开源发布与后续版本推进。
它真的开源免费吗?
权重以 CreativeML OpenRAIL-M 许可证开放,研究、非商业与受限商用可用;但许可对生成内容与再分发有约束,企业商用需读原文并合规。
本地能跑吗?需要什么配置?
能。SD 1.x 约 8.9 亿参数,消费级显卡(如 4–8GB 显存)即可跑 512²;SDXL 建议更高显存与 1024² 分辨率。
和 Midjourney、DALL·E 比强在哪?
强在「开源 + 本地可控 + 可微调」:闭源服务要订阅、数据上云、定制受限,SD 把权重交给你,生态插件与社区模型极大。
提示词怎么写才出好图?
按「主体 + 风格 + 光线 + 画质」组织,配合负面提示词排除瑕疵;多迭代调词、换模型与重绘局部,比一次成型更稳。
有哪些主流前端与微调方法?
前端以 AUTOMATIC1111 WebUI 与节点式 ComfyUI 最常见;微调常用 LoRA、DreamBooth、Textual Inversion,社区模型站可下载他人训练成果。
参考资料
- 来源:Stability AI 官网(Stable Diffusion 发布与平台):https://stability.ai
- 来源:CompVis — Stable Diffusion 开源仓库(权重与代码):https://github.com/CompVis/stable-diffusion
- 来源:Hugging Face — Stable Diffusion 模型卡(v1.5 等):https://huggingface.co/runwayml/stable-diffusion-v1-5
- 来源:arXiv — High-Resolution Image Synthesis with Latent Diffusion Models(LDM 论文):https://arxiv.org/abs/2112.10752
- 来源:维基百科 — Stable Diffusion(背景与影响):https://en.wikipedia.org/wiki/Stable_Diffusion
- 来源:Stability AI — SDXL 1.0 公告(1024² 与生态):https://stability.ai/news/stable-diffusion-xl-1-announcement
青衣网络 AI 观察团队 · 最后更新 2026-08-25 | 本文基于 Stable Diffusion 的公开信息整理,用于帮助读者理解其定位、能力与边界;版本、参数量、许可条款与功能随时可能调整,商用与合规请以官方许可原文与最新说明为准。