ローカルLLM動作チェッカー
このPCで動くモデルが分かる
GPUを自動検出して、手元のPCで動かせるローカルLLMを39本分まとめて判定します。 必要メモリ(重み+KVキャッシュ+作業領域)は Hugging Face の公開データから計算した実測ベースです(2026-09-21 時点)。
緑の範囲があなたのGPUに載る容量(8.0GB)。目盛りは代表モデルの必要メモリで、量子化とコンテキスト長を変えると動きます。
いまの条件でGPUに載る最大のモデルは Qwen3 8B(8.2B)です。
GPUだけで動く
18本重み 2.5GB + KVキャッシュ 1.1GB + 作業領域 0.7GB
この環境なら Q8_0 まで上げられます(ほぼ無損失)
スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。
重み 2.3GB + KVキャッシュ 1.1GB + 作業領域 0.7GB
この環境なら Q8_0 まで上げられます(ほぼ無損失)
重み 2.2GB + KVキャッシュ 1.0GB + 作業領域 0.7GB
この環境なら Q8_0 まで上げられます(ほぼ無損失)
重み 1.9GB + KVキャッシュ 1.3GB + 作業領域 0.7GB
この環境なら Q8_0 まで上げられます(ほぼ無損失)
小型の日本語モデル。
重み 1.8GB + KVキャッシュ 0.9GB + 作業領域 0.7GB
この環境なら FP16 まで上げられます(量子化なし・元のまま)
重み 1.2GB + KVキャッシュ 0.9GB + 作業領域 0.7GB
この環境なら FP16 まで上げられます(量子化なし・元のまま)
重み 1.0GB + KVキャッシュ 1.5GB + 作業領域 0.6GB
この環境なら FP16 まで上げられます(量子化なし・元のまま)
重み 0.6GB + KVキャッシュ 0.2GB + 作業領域 0.6GB
この環境なら FP16 まで上げられます(量子化なし・元のまま)
スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。
重み 0.4GB + KVキャッシュ 0.9GB + 作業領域 0.6GB
この環境なら FP16 まで上げられます(量子化なし・元のまま)
重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB
この環境なら Q6_K まで上げられます(高品質)
重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB
この環境なら Q6_K まで上げられます(高品質)
重み 4.3GB + KVキャッシュ 0.4GB + 作業領域 0.8GB
この環境なら Q6_K まで上げられます(高品質)
思考過程を長く出すぶん、生成トークン数が多く KV キャッシュも伸びやすい。
重み 4.1GB + KVキャッシュ 1.0GB + 作業領域 0.8GB
この環境なら Q6_K まで上げられます(高品質)
重み 4.7GB + KVキャッシュ 1.1GB + 作業領域 0.8GB
この環境なら Q5_K_M まで上げられます(バランス)
重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB
この環境なら Q5_K_M まで上げられます(バランス)
重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB
この環境なら Q5_K_M まで上げられます(バランス)
日本語追加学習モデル。
重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB
この環境なら Q5_K_M まで上げられます(バランス)
日本語継続事前学習モデル。
重み 4.6GB + KVキャッシュ 1.0GB + 作業領域 0.8GB
この環境なら Q5_K_M まで上げられます(バランス)
日本語継続事前学習モデル。
CPUへはみ出す(遅くなる)
14本重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 18.7GB + KVキャッシュ 2.0GB + 作業領域 1.5GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 17.4GB + KVキャッシュ 0.8GB + 作業領域 1.5GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
MoE。重みは全エキスパート分をメモリに載せる必要があるが、1トークンあたりの計算は活性パラメータ(名称の A3B = 約3B)だけなので、同じ容量の密モデルより大幅に速い。
重み 15.6GB + KVキャッシュ 3.9GB + 作業領域 1.4GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。
重み 13.4GB + KVキャッシュ 1.3GB + 作業領域 1.3GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 12.9GB + KVキャッシュ 9.0GB + 作業領域 1.2GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
GQA を使わない構成(K/V ヘッド数が注意ヘッド数と同じ)のため、コンテキストを伸ばすと KV キャッシュが急に重くなる。
重み 11.9GB + KVキャッシュ 0.4GB + 作業領域 1.2GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
公式配布の重みが MXFP4(約4.25bit/重み)で量子化済み。表の Q4 相当が実際の配布サイズに近い。
重み 8.4GB + KVキャッシュ 1.5GB + 作業領域 1.0GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 8.4GB + KVキャッシュ 1.5GB + 作業領域 1.0GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 8.4GB + KVキャッシュ 1.3GB + 作業領域 1.0GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 8.4GB + KVキャッシュ 1.6GB + 作業領域 1.0GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 7.8GB + KVキャッシュ 3.1GB + 作業領域 1.0GB(このモデルの上限 4,096 トークンで計算)
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
GQA を使わない構成のため KV キャッシュが大きい。
重み 7.0GB + KVキャッシュ 3.0GB + 作業領域 0.9GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
スライディングウィンドウ注意を使うため、実際の KV キャッシュはこの概算より小さくなる。画像入力にも対応。
このままでは載らない
7本重み 134.1GB + KVキャッシュ 1.5GB + 作業領域 7.3GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
MoE。個人PCの上限を試す用。活性パラメータは名称の A22B = 約22B。
重み 66.6GB + KVキャッシュ 0.6GB + 作業領域 3.9GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
公式配布の重みが MXFP4(約4.25bit/重み)。MoE で計算量は小さいが、重みは全部メモリに載せる必要がある。
重み 41.5GB + KVキャッシュ 2.5GB + 作業領域 2.7GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
重み 40.2GB + KVキャッシュ 2.5GB + 作業領域 2.6GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
日本語継続事前学習モデル。
重み 26.6GB + KVキャッシュ 1.0GB + 作業領域 1.9GB
どの量子化でもGPUメモリに収まりません(コンテキストを短くすると変わることがあります)
MoE(8エキスパート中2個を使用)。
ゲームが快適に動くかを調べたい場合はゲーム別推奨スペック逆引きDBへ。ここで入力した構成はそのまま引き継がれます。
必要メモリの計算方法
必要メモリは次の3つの合計として計算しています。どこに何GB必要なのかが分かるよう、判定カードにも内訳を出しています。
- 重み: パラメータ数 × 1重みあたりのビット数 ÷ 8。パラメータ数は Hugging Face の API が返す safetensors の総数、ビット数は実際に配布されている GGUF のファイルサイズから実測した値です。
- KVキャッシュ: 2(K と V)× 層数 × KVヘッド数 × ヘッド次元 × コンテキスト長 × 1要素のバイト数。層数などは各モデルの config.json の値です。スライディングウィンドウ注意を使うモデルでは、実際はこの見積もりより小さくなります。
- 作業領域: 実行時の計算バッファ等として重みの5%+0.6GBを見込んでいます。これは実測値ではなく、 安全側に置いた仮定です(実行ソフトや設定で変わります)。
量子化の実効ビット数の出典: bartowski/Qwen2.5-7B-Instruct-GGUF / bartowski/Meta-Llama-3.1-8B-Instruct-GGUF(取得日: 2026-09-21)。1重みあたり Q4_K_M 4.9bit / Q5_K_M 5.72bit / Q6_K 6.57bit / Q8_0 8.5bit / FP16 16bit として計算しています。
判定ランクの意味
判定しているのは「メモリに載るか」だけです。生成速度(トークン/秒)はメモリ帯域やGPU世代に依存するため、本ツールでは断定しません。
モデル別の必要VRAM早見表
各モデルのページでは、量子化 × コンテキスト長の組み合わせごとの必要メモリを一覧にしています。
- Qwen3 0.6B0.8B / 軽量・小型
- Gemma 3 1B1.0B / 軽量・小型
- SmolLM2 1.7B1.7B / 軽量・小型
- Qwen3 1.7B2.0B / 軽量・小型
- Llama 3.2 3B Instruct3.2B / 軽量・小型
- Sarashina2.2 3B3.4B / 日本語特化
- Phi-4-mini 3.8B3.8B / 軽量・小型
- Qwen3 4B4.0B / 軽量・小型
- Gemma 3 4B4.3B / 軽量・小型
- Mistral 7B Instruct v0.37.2B / 汎用・チャット
- Qwen2.5-Coder 7B7.6B / コーディング
- Qwen2.5 7B Instruct7.6B / 汎用・チャット
- DeepSeek-R1-Distill-Qwen 7B7.6B / 推論(思考型)
- Llama 3.1 8B Instruct8.0B / 汎用・チャット
- Llama-3-ELYZA-JP 8B8.0B / 日本語特化
- Llama 3.1 Swallow 8B8.0B / 日本語特化
- Llama 3 Youko 8B8.0B / 日本語特化
- Qwen3 8B8.2B / 汎用・チャット
- Gemma 3 12B12.2B / 汎用・チャット
- LLM-jp-3 13B13.7B / 日本語特化
- Phi-4 14B14.7B / 汎用・チャット
- Qwen3 14B14.8B / 汎用・チャット
- Qwen2.5-Coder 14B14.8B / コーディング
- DeepSeek-R1-Distill-Qwen 14B14.8B / 推論(思考型)
- gpt-oss 20B20.9B / 汎用・チャット
- CyberAgentLM3 22B22.5B / 日本語特化
- Mistral Small 24B23.6B / 汎用・チャット
- Gemma 3 27B27.4B / 汎用・チャット
- Qwen3 30B-A3B30.5B / 汎用・チャット
- Qwen3 32B32.8B / 汎用・チャット
- Qwen2.5-Coder 32B32.8B / コーディング
- DeepSeek-R1-Distill-Qwen 32B32.8B / 推論(思考型)
- Mixtral 8x7B46.7B / 汎用・チャット
- DeepSeek-R1-Distill-Llama 70B70.6B / 推論(思考型)
- Llama 3.3 70B Instruct70.6B / 汎用・チャット
- Llama 3.1 Swallow 70B70.6B / 日本語特化
- Qwen2.5 72B Instruct72.7B / 汎用・チャット
- gpt-oss 120B116.8B / 汎用・チャット
- Qwen3 235B-A22B235.1B / 汎用・チャット
よくある質問
ブラウザでVRAMの容量まで分かるのですか?
いいえ。ブラウザから取得できるのはGPUの型番までで、VRAMの容量は取得できません。本ツールは型番から容量を推定して初期値に置き、利用者が画面で訂正できるようにしています。
Mac(Apple Silicon)でも使えますか?
使えます。Apple SiliconはCPUとGPUがメモリを共有するため、搭載メモリを選ぶと、GPU側が既定で使える量(おおむね7割)を基準に判定します。上限はsysctlの設定で引き上げられます。
量子化とは何ですか?
モデルの重みを低いビット数で持ち、容量と必要メモリを減らす手法です。Q4_K_Mなら1重みあたり約4.9ビットで、FP16の約3分の1の容量になります。ビット数を下げるほど必要メモリは減り、品質は少しずつ落ちます。
判定が「動く」でも遅いことがありますか?
あります。本ツールはメモリに載るかどうかを判定するもので、生成速度は判定していません。速度はメモリ帯域やGPUの世代に強く依存し、CPU側へはみ出すと大きく落ちます。
このツールについて
ゲームが快適に動くかを調べたい場合はゲーム別推奨スペック逆引きDBを使えます。入力したPC構成はブラウザに保存され、両方のツールで引き継がれます。 買い替えの検討にはPC構成シミュレータも併せてどうぞ。
本ツールの判定は公開データに基づく概算です。実際に動くかは実行ソフト(llama.cpp / Ollama / LM Studio 等)の設定、 同時に動いている他のアプリのメモリ使用量、ドライバの挙動によって変わります。購入の判断材料にする場合は、必ず実機や公式情報でご確認ください。