Stable Diffusion 3.5 Largeの必要VRAM
FP16・FP8・GGUF・解像度別の早見表
Stable Diffusion 3.5 Large(Stability AI / 本体 8.1B / 汎用)をローカルで動かすのに必要なVRAMを、本体+テキストエンコーダ+作業領域から計算しました。 諸元は配布元の公開データから取得しています。
あなたのPCで動くか
あなたのPC検出中…GPUを自動検出中…VRAM 8GBメモリ 16GBWindows
他のPCで試す
解像度1024×1024px
あなたの環境(VRAM 8GB)での判定
- FFP16/BF1617.2GB載らない
- CFP89.6GB動くが遅い
- CQ8_010.1GB動くが遅い
- BQ5_K_S7.3GBぎりぎり載る
- BQ4_K_S6.4GBぎりぎり載る
テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。S〜F のランクの意味はトップページに一覧があります。
他のモデルも一括で判定するならローカル画像生成チェッカーへ。
必要VRAMの早見表
| 重みの持ち方 | 512px | 1024px(標準) | 1536px | 2048px |
|---|---|---|---|---|
| FP16/BF1616bit/重み | 16.2GB | 17.2GB | 18.8GB | 21.0GB |
| FP88bit/重み | 8.7GB | 9.6GB | 11.2GB | 13.4GB |
| Q8_08.53bit/重み | 9.2GB | 10.1GB | 11.7GB | 13.9GB |
| Q5_K_S5.55bit/重み | 6.3GB | 7.3GB | 8.9GB | 11.1GB |
| Q4_K_S4.66bit/重み | 5.8GB | 6.4GB | 8.0GB | 10.2GB |
テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。全部を同時に載せる場合は、この表に テキストエンコーダ分(5.2GB、8bit時)がおおむね上乗せされます。
モデルの構成
- 本体: DiT(Transformer) / 8,146,352,648 パラメータ(8.1B)
- テキストエンコーダ: CLIP ViT-L(124M) + OpenCLIP ViT-bigG(695M) + T5-XXL エンコーダ(4.8B) = 合計 5.6B
- VAE: 84M
- 標準の生成解像度: 1024×1024px
- ライセンス: Stability AI Community License
- GGUF 版の配布: city96/stable-diffusion-3.5-large-gguf
出典: stabilityai/stable-diffusion-3.5-large(配布が承諾制のため、ファイル一覧のバイト数 ÷ 1要素のバイト数で数えた値)。ライセンスや利用条件は配布元をご確認ください。
同じ用途の他のモデル
- PixArt-Σ本体 611M
- Stable Diffusion 1.5本体 860M
- Stable Diffusion 3.5 Medium本体 2.5B
- SDXL 1.0本体 2.6B