Stable Diffusion 全面指南
從本地安裝、Prompt 與參數,到 LoRA、ControlNet 和影像放大,一套完整的 AI 影像創作流程。
執行方式本地部署不按張數付費
建議 GPURTX 3060+VRAM 越大越好
預留空間20–30 GB建議使用 SSD
常用介面A1111或 ComfyUI
本簡報內容
環境→安裝→Prompt→版本→參數→模型與放大→進階控制
硬體與介面
本地執行讓模型、流程與資料都由你掌控。
| Windows | macOS | |
|---|---|---|
| 處理器 | Intel i5/i7/i9 或 AMD Ryzen | Apple Silicon(M1–M3) |
| 記憶體 | 16 GB 以上 | 16 GB 以上 |
| GPU | NVIDIA RTX 3060 以上 | M 系列整合式 GPU |
| 儲存空間 | SSD,預留 20–30 GB | SSD,預留 20–30 GB |
| 系統 | Windows 10 / 11 | macOS 12.5 以上 |
Automatic1111 初學者
介面直觀、功能完整,擴充套件多。
ComfyUI 進階
節點式流程,彈性高、VRAM 管理佳,學習曲線較陡。
安裝 Automatic1111
- 1安裝 Python:選用 WebUI 與 PyTorch 支援的版本,勾選 Add Python to PATH。
- 2安裝 Git:Git for Windows 使用預設設定即可。
- 3下載程式:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git - 4設定參數:編輯
webui-user.bat,NVIDIA 環境可加入--xformers。 - 5啟動:Windows 雙擊
webui-user.bat,macOS 執行./webui.sh,再開啟127.0.0.1:7860。
首次啟動會自動安裝依賴;使用期間 Terminal 要保持執行,更新請執行 git pull。
Prompt 怎麼寫
由主體、動作、場景、時間、光線、鏡頭、構圖、材質與風格組成。
Positive Prompt 想要
描述想要的內容。具體的視覺描述,比堆疊 masterpiece、best quality 更有效。
Negative Prompt 排除
降低不想要的元素,如 blurry、bad anatomy。它不是萬能修復器,各模型反應不同。
權重語法
| 寫法 | 效果 |
|---|---|
(keyword:1.2) | 提高該詞的影響力 |
(keyword:0.7) | 降低該詞的影響力 |
不同介面對括號語法的支援可能不同,以實際使用的 WebUI 為準。
模型版本與 VAE
| SD 1.5 | SDXL | |
|---|---|---|
| 常見解析度 | 約 512×512 | 約 1024×1024 |
| Prompt 寫法 | 關鍵字式 | 更適合自然語言 |
| 特色 | 模型生態龐大 | 原始細節較好,可選用 Refiner |
VAE 的位置
影像→VAE 編碼→Latent 去噪→VAE 解碼→影像
不同 VAE 會影響色彩、對比、細節與飽和度。
核心參數怎麼調
| 參數 | 作用 | 起點建議 |
|---|---|---|
| Seed | -1 為隨機;固定後便於比較與重現 | 固定後只改一項 |
| Steps | 去噪步數,過高提升有限 | 20–30 |
| CFG Scale | Prompt 影響力,過高會過飽和、失真 | 5–7 |
| Sampler | 影響風格、速度與穩定性 | Euler a 探索 DPM++ 2M Karras 高品質 |
| Batch Size | 一次生成張數,吃 VRAM | VRAM 少設為 1 |
最佳值取決於模型,先固定 Seed 再逐項測試。
模型生態與影像放大
Base Model→Checkpoint→LoRA→Embedding
Checkpoint
決定整體風格,如寫實、動漫、插畫。
LoRA
控制人物、服裝、畫風。語法 <lora:name:0.8>
Embedding
把一組概念壓成一個 Token,如 EasyNegative。
| 方法 | 做法 | 建議值 |
|---|---|---|
| Extras | 用 R-ESRGAN 等 Upscaler 直接放大 | 寫實與動漫選不同 Upscaler |
| Img2Img | 以較高解析度重新生成 | Denoising 0.2–0.3 |
| Hires. Fix | 低解析度生成後放大再去噪 | 1.5–2x,0.2–0.4 |
控制構圖與學習路線
ControlNet
Scribble 把草稿變成影像,OpenPose 保留姿勢。模型架構須與基礎模型相容。
Inpainting
用 Mask 選取區域,只重繪該處,例如把衣服換成科幻盔甲。
Outpainting
擴大畫布,由 AI 補出新增的場景。
學習路線
安裝→Checkpoint→Prompt→Seed / CFG / Steps→Img2Img→LoRA→ControlNet→Inpaint / Outpaint→Upscale
重點不是記住一組最佳參數,而是理解模型、Prompt、取樣、控制條件與後期處理的關係。使用真人臉部素材前,請取得對方同意。