weva
🔎Webアプリを探す
🎨 ローカルAIStability AIのロゴ

Stable Diffusion 3.5 Mediumの必要VRAM

FP16・FP8・GGUF・解像度別の早見表

Stable Diffusion 3.5 Medium(Stability AI / 本体 2.5B / 汎用)をローカルで動かすのに必要なVRAMを、本体+テキストエンコーダ+作業領域から計算しました。 諸元は配布元の公開データから取得しています。

あなたのPCで動くか

あなたのPC検出中…GPUを自動検出中…VRAM 8GBメモリ 16GBWindows
他のPCで試す
解像度1024×1024px
あなたの環境(VRAM 8GB)での判定
  • DFP16/BF1611.0GBかなり遅い
  • AFP85.8GB快適に動く
  • AQ8_05.8GB快適に動く
  • AQ5_K_S5.8GB快適に動く
  • AQ4_K_S5.8GB快適に動く

テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。S〜F のランクの意味はトップページに一覧があります。

他のモデルも一括で判定するならローカル画像生成チェッカーへ。

必要VRAMの早見表

重みの持ち方512px1024px(標準)1536px2048px
FP16/BF1616bit/重み11.0GB11.0GB11.0GB11.0GB
FP88bit/重み5.8GB5.8GB5.9GB8.1GB
Q8_08.53bit/重み5.8GB5.8GB6.0GB8.2GB
Q5_K_S5.55bit/重み5.8GB5.8GB5.8GB7.4GB
Q4_K_S4.66bit/重み5.8GB5.8GB5.8GB7.1GB

テキストエンコーダは本体と入れ替えで載せる前提(ComfyUI 等の既定の動作)で計算しています。全部を同時に載せる場合は、この表に テキストエンコーダ分(5.2GB、8bit時)がおおむね上乗せされます。

モデルの構成

  • 本体: DiT(Transformer) / 2,469,716,836 パラメータ(2.5B)
  • テキストエンコーダ: CLIP ViT-L(124M) + OpenCLIP ViT-bigG(695M) + T5-XXL エンコーダ(4.8B) = 合計 5.6B
  • VAE: 84M
  • 標準の生成解像度: 1024×1024px
  • ライセンス: Stability AI Community License
  • GGUF 版の配布: city96/stable-diffusion-3.5-medium-gguf

出典: stabilityai/stable-diffusion-3.5-medium(配布が承諾制のため、ファイル一覧のバイト数 ÷ 1要素のバイト数で数えた値)。ライセンスや利用条件は配布元をご確認ください。

同じ用途の他のモデル

  • PixArt-Σ本体 611M
  • Stable Diffusion 1.5本体 860M
  • SDXL 1.0本体 2.6B
  • Lumina-Image 2.0本体 2.6B
← 他のモデルもまとめて判定する文章生成AI(ローカルLLM)が動くかを調べる(同じPC構成が引き継がれます)
weva
Webアプリを探す話題のニュース仕事探し個人開発ニュース
運営者情報お問い合わせ利用規約プライバシーポリシー
© 2026 Weva.dark_typeA_115x57.png