主要なローカルLLMの必要VRAM一覧|実ファイルサイズで確認する

執筆者:

カテゴリ:

本記事にはアフィリエイト広告を含みます。掲載している数値はモデルの配布ページと公式ドキュメントの実測値に基づいており、広告の有無によって内容を変えることはありません。

結論:ファイルサイズ+約1.5GBが目安です

配布されているファイルのサイズが、そのまま重みを載せるのに必要な容量です。下の表は実際のファイルサイズで、計算値ではありません。この値に、やり取りの履歴と実行環境の分を足したものが必要なVRAMになります。

モデルごとのファイルサイズ

Hugging Face の配布ページから取得した実測値です。同じページの「Files and versions」で、読者も同じ数字を確認できます。

モデル パラメータ数 Q4_K_M Q5_K_M Q8_0
Qwen2.5 7B Instruct 7.6B 4.68 GB 5.44 GB 8.1 GB
Qwen2.5 14B Instruct 14.8B 8.99 GB 10.51 GB 15.7 GB
Qwen2.5 32B Instruct 32.8B 19.85 GB 23.26 GB 34.82 GB
Llama 3.1 8B Instruct 8.0B 4.92 GB 5.73 GB 8.54 GB
Gemma 2 9B it 9.2B 5.76 GB 6.65 GB 9.83 GB
Gemma 2 27B it 27.2B 16.65 GB 19.41 GB 28.94 GB
Mistral 7B Instruct v0.3 7.2B 4.37 GB 5.14 GB 7.7 GB
Phi-4 14.7B 9.05 GB 10.6 GB 15.58 GB
DeepSeek R1 Distill Qwen 7B 7.6B 4.68 GB 5.44 GB 8.1 GB
DeepSeek R1 Distill Qwen 32B 32.8B 19.85 GB 23.26 GB 34.82 GB
Llama 3.3 70B Instruct 70.6B 42.52 GB 49.95 GB 74.98 GB

VRAM容量を上げると何ができるようになるか

それぞれの量子化で、余裕をもって載るいちばん大きいモデルです(履歴と実行環境の分を含めた場合)。容量を上げても、載るモデルが大きくなるとは限りません。同じモデルをより高い品質の量子化で動かせるようになる、という形で効いてくることがあります。右端に、1つ下の容量から何が変わるかを出しています。

VRAM Q4_K_M で載る最大 Q5_K_M で載る最大 Q8_0 で載る最大 1つ下の容量から増えるもの
8 GB Gemma 2 9B it(5.76GB) Llama 3.1 8B Instruct(5.73GB)
10 GB Gemma 2 9B it(5.76GB) Gemma 2 9B it(6.65GB) Qwen2.5 7B Instruct(8.1GB) Gemma 2 9B it を Q5_K_M で/Qwen2.5 7B Instruct を Q8_0 で
12 GB Phi-4(9.05GB) Gemma 2 9B it(6.65GB) Gemma 2 9B it(9.83GB) Gemma 2 9B it を Q8_0 で/Phi-4 を Q4_K_M で
16 GB Phi-4(9.05GB) Phi-4(10.6GB) Gemma 2 9B it(9.83GB) Phi-4 を Q5_K_M で
20 GB Gemma 2 27B it(16.65GB) Phi-4(10.6GB) Qwen2.5 14B Instruct(15.7GB) Gemma 2 27B it を Q4_K_M で/Qwen2.5 14B Instruct を Q8_0 で
24 GB Qwen2.5 32B Instruct(19.85GB) Gemma 2 27B it(19.41GB) Qwen2.5 14B Instruct(15.7GB) Gemma 2 27B it を Q5_K_M で/Qwen2.5 32B Instruct を Q4_K_M で
32 GB Qwen2.5 32B Instruct(19.85GB) Qwen2.5 32B Instruct(23.26GB) Gemma 2 27B it(28.94GB) Gemma 2 27B it を Q8_0 で/Qwen2.5 32B Instruct を Q5_K_M で
重みを載せるのに必要な容量(GB)やり取りの履歴と実行環境の分は別に要りますQ4_K_MQ5_K_MQ8_0F167B4.35.07.414.014B8.610.014.928.032B19.622.834.064.070B42.849.974.4140.0緑=12GB以下 / 青=12〜24GB / 赤=24GB超(一般的なカードでは載りません)
パラメータ数と量子化から計算した必要容量です。上の実測値とほぼ一致します。

計算値と実測値がずれていないか

当サイトでは、取得した実ファイルサイズをパラメータ数からの計算値と自動で突き合わせています。大きくずれる値は、分割されたファイルの一部や別形式を拾っている可能性があるため、公開せずに除外します。実際に、ある配布ページから取得した値が計算値の25分の1だったため除外しました(そのモデルはGGUFとは別の形式で配布されていました)。

間違えるとどうなるか

VRAMに収まらない分は、多くの実行環境が自動でシステムメモリに逃がします。壊れることはありませんが、体感で分かるほど遅くなります。「動くけれど遅い」のと「そもそも動かない」のとでは対処が違うので、まずどちらなのかを確かめてください。

VRAMに収まらない分は、システムメモリに置いて動かすこともできます(オフロード)。動作はしますが、GPUの外へ出た分だけ大幅に遅くなります。全部をVRAMに載せられるかどうかが、実用になるかの分かれ目です。

自分の環境で動くか確かめる手順

  1. タスクマネージャーの「パフォーマンス」→GPU→「専用GPUメモリ」で、搭載量と使用中の量を見ます。
  2. 使いたいモデルの配布ページで「Files and versions」を開き、量子化ごとのファイルサイズを確認します。
  3. そのサイズに1.5GBほど足した値を、空いているVRAMと比べます。
  4. 足りなければ一段下の量子化を試します。Q5_K_M から Q4_K_M で約15%減ります。
  5. それでも足りなければ、パラメータ数の小さいモデルに替えます。同じ系統で小さいものが配布されていることが多くあります。

カードの買い替えはいちばん最後です。量子化を下げる・モデルを替えるのは費用がかかりません。

買い替えなくてよい場合

  • 使いたいモデルが表にあり、いまのVRAMで「載る」側にあるなら、買い替える必要はありません。
  • 1つ下の量子化にすると必要な容量は約15%減ります。境目にいる場合は、これで収まることがあります。
  • 同じ系統でパラメータ数の小さいモデルが配布されていることがあります。用途に足りるかを先に試してください。

関連する判定

出典と確認方法

このページの数値は、以下の一次情報に基づいています。同じ手順でご自身でも確認できます。

  • Hugging Face のファイル一覧:モデルの配布ページで「Files and versions」を開くと、ファイルごとのサイズが表示されます。使いたい量子化のファイルサイズが、重みを載せるのに必要な容量です。大きいモデルは複数ファイルに分割されていることがあり、その場合は合計が必要な容量になります。
  • llama.cpp 公式ドキュメント(quantize / bits per weight):量子化の形式ごとの1重みあたりビット数(Q4_K_M・Q8_0・F16 など)
  • いま空いているVRAMの確認方法:タスクマネージャーを開き、「パフォーマンス」タブでGPUを選びます。「専用GPUメモリ」の欄に、搭載量と使用中の量が出ます。モデルを載せられるのは、この差の分だけです。

当サイトは配布ページから取得した実ファイルサイズと、パラメータ数からの計算値を自動で突き合わせ、大きく食い違う値は公開せずに除外しています。モデルは入れ替わるため、判断の前には配布ページの現在のファイルサイズもあわせてご確認ください。

判定の作り方・自動で行っている検算・運営者の立ち位置は判定の方法にまとめています。

よくある質問

表に無いモデルはどう調べればよいですか。

配布ページの「Files and versions」でファイルサイズを見てください。そのサイズに1.5GBほど足した値が、必要なVRAMの目安です。

ファイルが複数に分かれている場合はどうなりますか。

合計が必要な容量です。大きいモデルは分割して配布されることがあります。

計算で出した値と、ファイルサイズが違うのはなぜですか。

量子化は層ごとに使い分けられることがあり、配布する側の設定によっても変わるためです。ファイルサイズのほうを信じてください。

VRAMが足りない場合、システムメモリを増やせば速くなりますか。

速くはなりません。あふれた分をシステムメモリに置いて動かすこと自体はできますが、GPUの外に出た時点で遅くなります。速度を戻すにはVRAMに収める必要があります。

この条件に合う製品

下記は、この記事の条件に合う製品です。対応を確認しやすいメーカーの製品から機械的に選んだもので、当サイトが実際に使用して比較したものではありません。購入前には、必ずメーカーの仕様欄で対応状況をご確認ください。

Palit NE75080019T2-GB2031A (GeForce RTX 5080 GamingPro 16GB)

Palit NE75080019T2-GB2031A (GeForce RTX 5080 GamingPro 16GB) / Palit(パリット)

ドスパラ楽天市場店/レビュー 2件

楽天市場で価格を見る

あなたの構成で確認する

モデルの大きさと量子化、お使いのGPUのVRAM容量を選ぶと、その組み合わせで動くかを判定します。

互換チェッカーを開く