Stable Diffusion 3.5 Mediumの必要VRAM
FP16・FP8・GGUF・解像度別の早見表
Stable Diffusion 3.5 Medium(Stability AI / 本体 2.5B / 汎用)をローカルで動かすのに必要なVRAMを、本体+テキストエンコーダ+作業領域から計算しました。 諸元は配布元の公開データから取得しています。
あなたのPCで動くか
あなたのPC検出中…GPUを自動検出中…VRAM 8GBメモリ 16GBWindows
他のPCで試す
解像度1024×1024px
あなたの環境(VRAM 8GB)での判定
- DFP16/BF1611.0GBかなり遅い
- AFP85.8GB快適に動く
- AQ8_05.8GB快適に動く
- AQ5_K_S5.8GB快適に動く
- AQ4_K_S5.8GB快適に動く
テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。S〜F のランクの意味はトップページに一覧があります。
他のモデルも一括で判定するならローカル画像生成チェッカーへ。
必要VRAMの早見表
| 重みの持ち方 | 512px | 1024px(標準) | 1536px | 2048px |
|---|---|---|---|---|
| FP16/BF1616bit/重み | 11.0GB | 11.0GB | 11.0GB | 11.0GB |
| FP88bit/重み | 5.8GB | 5.8GB | 5.9GB | 8.1GB |
| Q8_08.53bit/重み | 5.8GB | 5.8GB | 6.0GB | 8.2GB |
| Q5_K_S5.55bit/重み | 5.8GB | 5.8GB | 5.8GB | 7.4GB |
| Q4_K_S4.66bit/重み | 5.8GB | 5.8GB | 5.8GB | 7.1GB |
テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。全部を同時に載せる場合は、この表に テキストエンコーダ分(5.2GB、8bit時)がおおむね上乗せされます。
モデルの構成
- 本体: DiT(Transformer) / 2,469,716,836 パラメータ(2.5B)
- テキストエンコーダ: CLIP ViT-L(124M) + OpenCLIP ViT-bigG(695M) + T5-XXL エンコーダ(4.8B) = 合計 5.6B
- VAE: 84M
- 標準の生成解像度: 1024×1024px
- ライセンス: Stability AI Community License
- GGUF 版の配布: city96/stable-diffusion-3.5-medium-gguf
出典: stabilityai/stable-diffusion-3.5-medium(配布が承諾制のため、ファイル一覧のバイト数 ÷ 1要素のバイト数で数えた値)。ライセンスや利用条件は配布元をご確認ください。
同じ用途の他のモデル
- PixArt-Σ本体 611M
- Stable Diffusion 1.5本体 860M
- SDXL 1.0本体 2.6B
- Lumina-Image 2.0本体 2.6B