weva
🔎Webアプリを探す
🧠 ローカルAI

ローカルLLM動作チェッカー

このPCで動くモデルが分かる

GPUを自動検出して、手元のPCで動かせるローカルLLMを39本分まとめて判定します。 必要メモリ(重み+KVキャッシュ+作業領域)は Hugging Face の公開データから計算した実測ベースです(2026-09-21 時点)。

Googleのロゴ4.3BGemma 3 4BQ4_K_M・8kで 4.2GBMeta Llamaのロゴ8.0BLlama 3.1 8B InstructQ4_K_M・8kで 6.4GBQwenのロゴ14.8BQwen3 14BQ4_K_M・8kで 10.7GBOpenAIのロゴ20.9BMoEgpt-oss 20BQ4_K_M・8kで 13.5GBQwenのロゴ32.8BQwen3 32BQ4_K_M・8kで 22.2GBMeta Llamaのロゴ70.6BLlama 3.3 70B InstructQ4_K_M・8kで 45.4GB
あなたのGPUで動くモデル(収録39本)
18本がGPUだけで動く8.0GBVRAM
8B級6.4GB14B級10.7GB32B級22.2GB70B級45.4GB

緑の範囲があなたのGPUに載る容量(8.0GB)。目盛りは代表モデルの必要メモリで、量子化とコンテキスト長を変えると動きます。

いまの条件でGPUに載る最大のモデルは Qwen3 8B(8.2B)です。

あなたのPC検出中…GPUを自動検出中…VRAM 8GBメモリ 16GBWindows
他のPCで試す
39本
重みKVキャッシュ作業領域あなたのGPUメモリの上限

GPUだけで動く

18本
  • Googleのロゴ4.3B
    Gemma 3 4BGoogle / 軽量・小型S余裕で動く
    4.2GB3.8GB 余裕

    重み 2.5GB + KVキャッシュ 1.1GB + 作業領域 0.7GB

    この環境なら Q8_0 まで上げられます(ほぼ無損失)

    スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。

  • Qwenのロゴ4.0B
    Qwen3 4BAlibaba (Qwen) / 軽量・小型S余裕で動く
    4.1GB3.9GB 余裕

    重み 2.3GB + KVキャッシュ 1.1GB + 作業領域 0.7GB

    この環境なら Q8_0 まで上げられます(ほぼ無損失)

  • Microsoftのロゴ3.8B
    Phi-4-mini 3.8BMicrosoft / 軽量・小型S余裕で動く
    3.9GB4.1GB 余裕

    重み 2.2GB + KVキャッシュ 1.0GB + 作業領域 0.7GB

    この環境なら Q8_0 まで上げられます(ほぼ無損失)

  • SB Intuitionsのロゴ3.4B
    Sarashina2.2 3BSB Intuitions / 日本語特化S余裕で動く
    3.9GB4.1GB 余裕

    重み 1.9GB + KVキャッシュ 1.3GB + 作業領域 0.7GB

    この環境なら Q8_0 まで上げられます(ほぼ無損失)

    小型の日本語モデル。

  • Meta Llamaのロゴ3.2B
    Llama 3.2 3B InstructMeta / 軽量・小型S余裕で動く
    3.4GB4.6GB 余裕

    重み 1.8GB + KVキャッシュ 0.9GB + 作業領域 0.7GB

    この環境なら FP16 まで上げられます(量子化なし・元のまま)

  • Qwenのロゴ2.0B
    Qwen3 1.7BAlibaba (Qwen) / 軽量・小型S余裕で動く
    2.7GB5.3GB 余裕

    重み 1.2GB + KVキャッシュ 0.9GB + 作業領域 0.7GB

    この環境なら FP16 まで上げられます(量子化なし・元のまま)

  • Hugging Face Smol Models Researchのロゴ1.7B
    SmolLM2 1.7BHugging Face / 軽量・小型S余裕で動く
    3.1GB4.9GB 余裕

    重み 1.0GB + KVキャッシュ 1.5GB + 作業領域 0.6GB

    この環境なら FP16 まで上げられます(量子化なし・元のまま)

  • Googleのロゴ1.0B
    Gemma 3 1BGoogle / 軽量・小型S余裕で動く
    1.4GB6.6GB 余裕

    重み 0.6GB + KVキャッシュ 0.2GB + 作業領域 0.6GB

    この環境なら FP16 まで上げられます(量子化なし・元のまま)

    スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。

  • Qwenのロゴ0.8B
    Qwen3 0.6BAlibaba (Qwen) / 軽量・小型S余裕で動く
    1.9GB6.1GB 余裕

    重み 0.4GB + KVキャッシュ 0.9GB + 作業領域 0.6GB

    この環境なら FP16 まで上げられます(量子化なし・元のまま)

  • Qwenのロゴ7.6B
    Qwen2.5-Coder 7BAlibaba (Qwen) / コーディングA快適に動く
    5.6GB2.4GB 余裕

    重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB

    この環境なら Q6_K まで上げられます(高品質)

  • Qwenのロゴ7.6B
    Qwen2.5 7B InstructAlibaba (Qwen) / 汎用・チャットA快適に動く
    5.6GB2.4GB 余裕

    重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB

    この環境なら Q6_K まで上げられます(高品質)

  • DeepSeekのロゴ7.6B
    DeepSeek-R1-Distill-Qwen 7BDeepSeek / 推論(思考型)A快適に動く
    5.6GB2.4GB 余裕

    重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB

    この環境なら Q6_K まで上げられます(高品質)

    思考過程を長く出すぶん、生成トークン数が多く KV キャッシュも伸びやすい。

  • Mistral AI_のロゴ7.2B
    Mistral 7B Instruct v0.3Mistral AI / 汎用・チャットA快適に動く
    5.9GB2.1GB 余裕

    重み 4.1GB + KVキャッシュ 1.0GB + 作業領域 0.8GB

    この環境なら Q6_K まで上げられます(高品質)

  • Qwenのロゴ8.2B
    Qwen3 8BAlibaba (Qwen) / 汎用・チャットBぎりぎり載る
    6.6GB1.4GB 余裕

    重み 4.7GB + KVキャッシュ 1.1GB + 作業領域 0.8GB

    この環境なら Q5_K_M まで上げられます(バランス)

  • Meta Llamaのロゴ8.0B
    Llama 3.1 8B InstructMeta / 汎用・チャットBぎりぎり載る
    6.4GB1.6GB 余裕

    重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB

    この環境なら Q5_K_M まで上げられます(バランス)

  • ELYZA.incのロゴ8.0B
    Llama-3-ELYZA-JP 8BELYZA / 日本語特化Bぎりぎり載る
    6.4GB1.6GB 余裕

    重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB

    この環境なら Q5_K_M まで上げられます(バランス)

    日本語追加学習モデル。

  • tokyotech-llmのロゴ8.0B
    Llama 3.1 Swallow 8B東京科学大学 ほか / 日本語特化Bぎりぎり載る
    6.4GB1.6GB 余裕

    重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB

    この環境なら Q5_K_M まで上げられます(バランス)

    日本語継続事前学習モデル。

  • rinna Co., Ltd.のロゴ8.0B
    Llama 3 Youko 8Brinna / 日本語特化Bぎりぎり載る
    6.4GB1.6GB 余裕

    重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB

    この環境なら Q5_K_M まで上げられます(バランス)

    日本語継続事前学習モデル。

CPUへはみ出す(遅くなる)

14本
  • Qwenのロゴ32.8B
    Qwen2.5-Coder 32BAlibaba (Qwen) / コーディングDかなり遅い
    22.2GB14.2GB 不足

    重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • DeepSeekのロゴ32.8B
    DeepSeek-R1-Distill-Qwen 32BDeepSeek / 推論(思考型)Dかなり遅い
    22.2GB14.2GB 不足

    重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • Qwenのロゴ32.8B
    Qwen3 32BAlibaba (Qwen) / 汎用・チャットDかなり遅い
    22.2GB14.2GB 不足

    重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • Qwenのロゴ30.5BMoE
    Qwen3 30B-A3BAlibaba (Qwen) / 汎用・チャットDかなり遅い
    19.6GB11.6GB 不足

    重み 17.4GB + KVキャッシュ 0.8GB + 作業領域 1.5GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    MoE。重みは全エキスパート分をメモリに載せる必要があるが、1トークンあたりの計算は活性パラメータ(名称の A3B = 約3B)だけなので、同じ容量の密モデルより大幅に速い。

  • Googleのロゴ27.4B
    Gemma 3 27BGoogle / 汎用・チャットDかなり遅い
    20.9GB12.9GB 不足

    重み 15.6GB + KVキャッシュ 3.9GB + 作業領域 1.4GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。

  • Mistral AI_のロゴ23.6B
    Mistral Small 24BMistral AI / 汎用・チャットDかなり遅い
    16.0GB8.0GB 不足

    重み 13.4GB + KVキャッシュ 1.3GB + 作業領域 1.3GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • CyberAgentのロゴ22.5B
    CyberAgentLM3 22Bサイバーエージェント / 日本語特化Dかなり遅い
    23.1GB15.1GB 不足

    重み 12.9GB + KVキャッシュ 9.0GB + 作業領域 1.2GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    GQA を使わない構成(K/V ヘッド数が注意ヘッド数と同じ)のため、コンテキストを伸ばすと KV キャッシュが急に重くなる。

  • OpenAIのロゴ20.9BMoE
    gpt-oss 20BOpenAI / 汎用・チャットDかなり遅い
    13.5GB5.5GB 不足

    重み 11.9GB + KVキャッシュ 0.4GB + 作業領域 1.2GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    公式配布の重みが MXFP4(約4.25bit/重み)で量子化済み。表の Q4 相当が実際の配布サイズに近い。

  • Qwenのロゴ14.8B
    Qwen2.5-Coder 14BAlibaba (Qwen) / コーディングDかなり遅い
    10.9GB2.9GB 不足

    重み 8.4GB + KVキャッシュ 1.5GB + 作業領域 1.0GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • DeepSeekのロゴ14.8B
    DeepSeek-R1-Distill-Qwen 14BDeepSeek / 推論(思考型)Dかなり遅い
    10.9GB2.9GB 不足

    重み 8.4GB + KVキャッシュ 1.5GB + 作業領域 1.0GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • Qwenのロゴ14.8B
    Qwen3 14BAlibaba (Qwen) / 汎用・チャットDかなり遅い
    10.7GB2.7GB 不足

    重み 8.4GB + KVキャッシュ 1.3GB + 作業領域 1.0GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • Microsoftのロゴ14.7B
    Phi-4 14BMicrosoft / 汎用・チャットDかなり遅い
    10.9GB2.9GB 不足

    重み 8.4GB + KVキャッシュ 1.6GB + 作業領域 1.0GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • LLM-jpのロゴ13.7B
    LLM-jp-3 13B国立情報学研究所 LLM-jp / 日本語特化Dかなり遅い
    11.9GB3.9GB 不足

    重み 7.8GB + KVキャッシュ 3.1GB + 作業領域 1.0GB(このモデルの上限 4,096 トークンで計算)

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    GQA を使わない構成のため KV キャッシュが大きい。

  • Googleのロゴ12.2B
    Gemma 3 12BGoogle / 汎用・チャットDかなり遅い
    10.9GB2.9GB 不足

    重み 7.0GB + KVキャッシュ 3.0GB + 作業領域 0.9GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。

このままでは載らない

7本
  • Qwenのロゴ235.1BMoE
    Qwen3 235B-A22BAlibaba (Qwen) / 汎用・チャットF載らない
    142.9GB134.9GB 不足

    重み 134.1GB + KVキャッシュ 1.5GB + 作業領域 7.3GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    MoE。個人PCの上限を試す用。活性パラメータは名称の A22B = 約22B。

  • OpenAIのロゴ116.8BMoE
    gpt-oss 120BOpenAI / 汎用・チャットF載らない
    71.1GB63.1GB 不足

    重み 66.6GB + KVキャッシュ 0.6GB + 作業領域 3.9GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    公式配布の重みが MXFP4(約4.25bit/重み)。MoE で計算量は小さいが、重みは全部メモリに載せる必要がある。

  • Qwenのロゴ72.7B
    Qwen2.5 72B InstructAlibaba (Qwen) / 汎用・チャットF載らない
    46.6GB38.6GB 不足

    重み 41.5GB + KVキャッシュ 2.5GB + 作業領域 2.7GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • DeepSeekのロゴ70.6B
    DeepSeek-R1-Distill-Llama 70BDeepSeek / 推論(思考型)F載らない
    45.4GB37.4GB 不足

    重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • Meta Llamaのロゴ70.6B
    Llama 3.3 70B InstructMeta / 汎用・チャットF載らない
    45.4GB37.4GB 不足

    重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

  • tokyotech-llmのロゴ70.6B
    Llama 3.1 Swallow 70B東京科学大学 ほか / 日本語特化F載らない
    45.4GB37.4GB 不足

    重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    日本語継続事前学習モデル。

  • Mistral AI_のロゴ46.7BMoE
    Mixtral 8x7BMistral AI / 汎用・チャットF載らない
    29.6GB21.6GB 不足

    重み 26.6GB + KVキャッシュ 1.0GB + 作業領域 1.9GB

    どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)

    MoE(8エキスパート中2個を使用)。

ゲームが快適に動くかを調べたい場合はゲーム別推奨スペック逆引きDBへ。ここで入力した構成はそのまま引き継がれます。

必要メモリの計算方法

必要メモリは次の3つの合計として計算しています。どこに何GB必要なのかが分かるよう、判定カードにも内訳を出しています。

  • 重み: パラメータ数 × 1重みあたりのビット数 ÷ 8。パラメータ数は Hugging Face の API が返す safetensors の総数、ビット数は実際に配布されている GGUF のファイルサイズから実測した値です。
  • KVキャッシュ: 2(K と V)× 層数 × KVヘッド数 × ヘッド次元 × コンテキスト長 × 1要素のバイト数。層数などは各モデルの config.json の値です。スライディングウィンドウ注意を使うモデルでは、実際はこの見積もりより小さくなります。
  • 作業領域: 実行時の計算バッファ等として重みの5%+0.6GBを見込んでいます。これは実測値ではなく、 安全側に置いた仮定です(実行ソフトや設定で変わります)。

量子化の実効ビット数の出典: bartowski/Qwen2.5-7B-Instruct-GGUF / bartowski/Meta-Llama-3.1-8B-Instruct-GGUF(取得日: 2026-09-21)。1重みあたり Q4_K_M 4.9bit / Q5_K_M 5.72bit / Q6_K 6.57bit / Q8_0 8.5bit / FP16 16bit として計算しています。

判定ランクの意味

S余裕で動くGPUメモリに大きな余裕があり、コンテキストを伸ばしても収まります。
A快適に動くGPUメモリに収まります。常用に向いた余裕があります。
Bぎりぎり載るGPUメモリにほぼ埋まる状態で載ります。他のアプリがVRAMを使うとあふれることがあります。
C動くが遅い一部がCPU側のメモリへはみ出します。動きますが生成速度は落ちます。
Dかなり遅い大半をCPU側のメモリで処理することになり、生成速度は大きく落ちます。
F載らないGPUメモリにもシステムメモリにも収まりません。量子化を下げるかコンテキストを短くしてください。

判定しているのは「メモリに載るか」だけです。生成速度(トークン/秒)はメモリ帯域やGPU世代に依存するため、本ツールでは断定しません。

モデル別の必要VRAM早見表

各モデルのページでは、量子化 × コンテキスト長の組み合わせごとの必要メモリを一覧にしています。

  • Qwen3 0.6B0.8B / 軽量・小型
  • Gemma 3 1B1.0B / 軽量・小型
  • SmolLM2 1.7B1.7B / 軽量・小型
  • Qwen3 1.7B2.0B / 軽量・小型
  • Llama 3.2 3B Instruct3.2B / 軽量・小型
  • Sarashina2.2 3B3.4B / 日本語特化
  • Phi-4-mini 3.8B3.8B / 軽量・小型
  • Qwen3 4B4.0B / 軽量・小型
  • Gemma 3 4B4.3B / 軽量・小型
  • Mistral 7B Instruct v0.37.2B / 汎用・チャット
  • Qwen2.5-Coder 7B7.6B / コーディング
  • Qwen2.5 7B Instruct7.6B / 汎用・チャット
  • DeepSeek-R1-Distill-Qwen 7B7.6B / 推論(思考型)
  • Llama 3.1 8B Instruct8.0B / 汎用・チャット
  • Llama-3-ELYZA-JP 8B8.0B / 日本語特化
  • Llama 3.1 Swallow 8B8.0B / 日本語特化
  • Llama 3 Youko 8B8.0B / 日本語特化
  • Qwen3 8B8.2B / 汎用・チャット
  • Gemma 3 12B12.2B / 汎用・チャット
  • LLM-jp-3 13B13.7B / 日本語特化
  • Phi-4 14B14.7B / 汎用・チャット
  • Qwen3 14B14.8B / 汎用・チャット
  • Qwen2.5-Coder 14B14.8B / コーディング
  • DeepSeek-R1-Distill-Qwen 14B14.8B / 推論(思考型)
  • gpt-oss 20B20.9B / 汎用・チャット
  • CyberAgentLM3 22B22.5B / 日本語特化
  • Mistral Small 24B23.6B / 汎用・チャット
  • Gemma 3 27B27.4B / 汎用・チャット
  • Qwen3 30B-A3B30.5B / 汎用・チャット
  • Qwen3 32B32.8B / 汎用・チャット
  • Qwen2.5-Coder 32B32.8B / コーディング
  • DeepSeek-R1-Distill-Qwen 32B32.8B / 推論(思考型)
  • Mixtral 8x7B46.7B / 汎用・チャット
  • DeepSeek-R1-Distill-Llama 70B70.6B / 推論(思考型)
  • Llama 3.3 70B Instruct70.6B / 汎用・チャット
  • Llama 3.1 Swallow 70B70.6B / 日本語特化
  • Qwen2.5 72B Instruct72.7B / 汎用・チャット
  • gpt-oss 120B116.8B / 汎用・チャット
  • Qwen3 235B-A22B235.1B / 汎用・チャット

よくある質問

ブラウザでVRAMの容量まで分かるのですか?

いいえ。ブラウザから取得できるのはGPUの型番までで、VRAMの容量は取得できません。本ツールは型番から容量を推定して初期値に置き、利用者が画面で訂正できるようにしています。

Mac(Apple Silicon)でも使えますか?

使えます。Apple SiliconはCPUとGPUがメモリを共有するため、搭載メモリを選ぶと、GPU側が既定で使える量(おおむね7割)を基準に判定します。上限はsysctlの設定で引き上げられます。

量子化とは何ですか?

モデルの重みを低いビット数で持ち、容量と必要メモリを減らす手法です。Q4_K_Mなら1重みあたり約4.9ビットで、FP16の約3分の1の容量になります。ビット数を下げるほど必要メモリは減り、品質は少しずつ落ちます。

判定が「動く」でも遅いことがありますか?

あります。本ツールはメモリに載るかどうかを判定するもので、生成速度は判定していません。速度はメモリ帯域やGPUの世代に強く依存し、CPU側へはみ出すと大きく落ちます。

このツールについて

ゲームが快適に動くかを調べたい場合はゲーム別推奨スペック逆引きDBを使えます。入力したPC構成はブラウザに保存され、両方のツールで引き継がれます。 買い替えの検討にはPC構成シミュレータも併せてどうぞ。

本ツールの判定は公開データに基づく概算です。実際に動くかは実行ソフト(llama.cpp / Ollama / LM Studio 等)の設定、 同時に動いている他のアプリのメモリ使用量、ドライバの挙動によって変わります。購入の判断材料にする場合は、必ず実機や公式情報でご確認ください。

次にやること

  • 同じPCでゲームが快適に動くかを調べるゲーム別推奨スペック逆引きDB
  • VRAMを増やした構成の価格を試算するPC構成シミュレータ
  • 買い替えるべきタイミングかを判定するPC買い替え時期診断
weva
Webアプリを探す話題のニュース仕事探し個人開発ニュース
運営者情報お問い合わせ利用規約プライバシーポリシー
© 2026 Weva.dark_typeA_115x57.png