ローカル LLM 配置用メモリ見積もりエンジン

LLM VRAM メモリ要件見積もりツール

Llama、DeepSeek、Qwen、Gemma、Mistral などの大規模言語モデルをローカル実行するために必要な GPU VRAM とシステムメモリを精密に見積もります。量子化形式、Context Length、GPU 互換性判定、「自分の GPU でどのモデルを動かせるか?」という逆引きにも対応します。

モデルサイズ

または手動入力: B(10億パラメーター)

量子化形式 param あたりの bits

Context Length と GPU 構成

一般的なモデルをすばやく選択

クリックして対応する model size を自動入力します。

⭐ GPU 逆引き検索 限定機能

GPU を選択すると、実行可能なモデルを確認できます

VRAM 必要量の見積もり結果

モデル重み

-- GB

KV キャッシュ

-- GB

推奨 VRAM

-- GB

推奨システム RAM

-- GB

configuration を入力して calculate してください。
VRAM 使用量 0 / 0 GB

一般的な GPU 互換性の比較

GPU VRAM 実行可能 推奨事項

パフォーマンスとデプロイに関する推奨事項

計算後に推奨事項が自動生成されます

Context Length が VRAM に与える影響

Context Length の違いによる KV Cache と総 VRAM 使用量の変化傾向

LLM VRAM とオンプレミス展開の完全ガイド

VRAM、量子化、GPU 選定を詳しく解説

VRAM とは何ですか?

VRAM(Video Random Access Memory)は GPU に搭載される専用メモリで、コンピューターのシステム RAM に相当します。VRAM には GPU のリアルタイム計算に必要なデータが保存され、テクスチャ、Frame Buffer、シェーダープログラム、そして近年特に重要なものとして—大規模言語モデル(LLM)の model weight と intermediate calculation

LLM をローカルで動かす場合、VRAM 容量は読み込めるモデルサイズと推論速度に直接影響します。モデルが必要とする VRAM が GPU 容量を超えると、その GPU だけでは完全に載せられず、CPU Offloading など速度低下を伴う方法を使う必要があります。

なぜ LLM は大量の VRAM を必要とするのですか?

大規模言語モデルの VRAM 消費は、主に 3 つの要素から生じます。

  • モデル重み(Weights): ニューラルネットワークの全パラメータです。70B モデルを FP16 で保持するには、およそ 70 × 2 = 140 GB のメモリが必要です。
  • KV キャッシュ:各 Token の生成時、Transformer モデルは過去すべての Token の Key と Value を保存する必要があります。Context Length が増えるにつれて KV Cache は線形に増加し、長い Context ではモデル重み自体より大きくなる場合があります。
  • 中間値(Activations)の計算: 順伝播中の中間層出力です。サイズはバッチサイズとモデルアーキテクチャによって変わります。

たとえば 70B モデルを FP16 で 32K context まで処理する場合、約 140 GB(weights)+ 10 GB(KV Cache)+ 小さな overhead で、合計 150 GB 超の VRAM が必要になります。これは RTX 4090 1 枚(24 GB)の容量を大きく超えるため、量子化またはマルチ GPU 構成が必要です。

Quantization とは何ですか?

量子化は、パラメータ 1 個あたりのビット数を減らしてモデルサイズを小さくする圧縮技術です。元のモデルは通常 FP16(16 bit 浮動小数点、1 パラメータ 2 byte)や BF16 で保存されます。量子化では INT8(8 bit、1 byte)、Q4_K_M(約 4 bit、0.5 byte)、Q2_K(約 2 bit、0.25 byte)など、より少ないビット数でパラメータを表現します。

量子化モデルは容量を大幅に削減できる一方、一定の品質低下が生じます。llama.cpp で広く普及した GGUF の Q4_K_M は、現在も実用上バランスのよい量子化方式の1つで、メモリ要件をおよそ75%減らしながら、モデル品質の大部分を維持できます。

Q4、Q5、Q8 の違いと選び方

quantization level によって model size、quality、speed の間に trade-off があります。

量子化形式 ビット数 B あたりのパラメータサイズ 品質維持 推奨シナリオ
FP16 / BF1616 ビット約2 GB100%専門的な研究、最高品質が求められる用途
Q8_08-bit約 1 GB~99%高品質・中程度 VRAM のシーン
Q6_K6 ビット約 0.75 GB~98%品質とサイズのバランスが良好
Q5_K_M5-bit約0.625 GB~96%推奨バランスポイント
Q4_K_M4 ビット約0.5 GB~93%⭐ コストパフォーマンス最優先(業界標準)
Q3_K_M3-bit約 0.375 GB~85%VRAM が極端に少ないシナリオ
Q2_K2 ビット約0.25 GB~75%VRAM が極端に少ない場合にのみ使用します

推奨事項:多くのユーザーにとって Q4_K_M は定番のバランス設定です。モデルサイズを約 75% 削減しながら、品質を約 93% 維持できます。VRAM に余裕があれば Q5_K_M または Q8_0 でより高品質にできます。極端に VRAM が少ない環境では Q3_K_M が最後の選択肢になります。

Context Length はメモリにどう影響しますか?

KV Cache の size は Context Length と関係します。線形関係. Context Length が 2 倍になると KV Cache も 2 倍になります。短い Context(2K〜8K)では比較的小さい割合ですが、長い Context(32K〜128K+)では KV Cache が VRAM 消費の主要因になることがあります。

たとえば 8B モデルでは、Q4_K_M の重みが約 4 GB、8K コンテキスト時の KV Cache が約 0.5 GB でも、128K コンテキストでは KV Cache が約 8 GB まで膨らみ、重み本体を上回ることがあります。これが長コンテキストモデルでより多くの VRAM が必要になる理由であり、sliding window attention や context caching などの最適化技術が使われる理由でもあります。

GPU Offload とは何ですか?

GPU Offload(Layer Offloading とも呼ばれます)は、モデルの全重みを GPU VRAM に収められない場合に、一部のニューラルネットワーク層を CPU のシステムメモリへ割り当てて処理するハイブリッド推論方式です。GPU は VRAM に収まる層を計算し、残りを CPU が担当し、中間結果を PCIe バス経由で相互に受け渡します。

  • 利点: VRAM 容量の制約で通常は読み込めないモデルも実行できるようになります。
  • 欠点: PCIe 帯域幅は GPU メモリ帯域幅より大幅に低いため、著しく遅くなります(純 GPU 実行の 5~20 倍程度遅い場合があります)。

Ollama や llama.cpp を使用する場合は、次の値を渡せます --num-gpu-layers このパラメータは Offload するレイヤー数を制御します。通常はまずモデル全体を VRAM に載せ、VRAM が不足する場合に CPU へ Offload するレイヤーを段階的に増やす方法が推奨されます。

LLM VRAM よくある質問 FAQ

Q1:RTX 4090(24GB)でどの model を実行できますか?

RTX 4090 の 24GB VRAM なら、8B 未満のモデルを FP16 で快適に動かしたり、Q4_K_M 量子化で 32B〜40B 級を実行したりできます。例:Llama 3 8B(FP16、約 16 GB)、Qwen3 32B(Q4_K_M、約 16.5 GB)、Mistral 7B(FP16、約 14 GB)。Q4_K_M と CPU Offload を使えば 70B モデルを試せる場合もあります。

Q2:FP16 と Q4_K_M では品質差が大きいですか?

実測では、Q4_K_M は FP16 品質のおよそ 93% を維持し、日常的なチャット、翻訳、要約、コード生成では差をほとんど感じないことが多いです。ただし、高度な推論、数学計算、高精度が必要な用途では FP16 や Q8_0 に依然として利点があります。Q4_K_M を選ぶと VRAM 要件を約 75% 削減でき、多くのユーザーにとってバランスの良い選択肢です。

Q3: VRAM が不足する場合、どのような代替策がありますか?

選択肢は 4 つあります:(1) 量子化レベルを下げます——FP16 から Q4_K_M へ切り替えると memory requirement を約75%削減できます。(2) Context Length を短縮—— KV Cache の占有量を削減。(3) GPU オフロードを有効化--一部レイヤーを CPU メモリへ移動(速度は低下します);(4) 複数 GPU を使用- model を複数 GPU に分散します。実際にはまず option 1 を試し、その後ほかの option を段階的に評価するのが一般的です。

Q4: Ollama と LM Studio の VRAM 要件は同じですか?

基本要件は同様で、どちらも内部で llama.cpp または類似エンジンを使用します。ただし実際の VRAM 使用量には多少差があり、(1) Ollama はモデル読込時におおむねモデルサイズ相当の VRAM を使用します。対応機能は --num-gpu-layers Offload を調整する点では、(2) LM Studio はより細かな GPU Offload slider を提供し、(3) ollama は一定時間使用しないと VRAM を解放する一方、LM Studio は占有を維持します。全体として、両者の中核的な VRAM 要件は同程度です。

Q5: 24 GB VRAM の GPU で 16 GB のモデルを読み込めないのはなぜですか?

モデルを読み込む際は、重みを保存する領域だけでなく、KV Cache、途中計算の Activations、CUDA 実行に伴う領域なども必要になるためです。こうしたオーバーヘッドは目安として 10〜20% 程度です。さらに OS や他のアプリも少量の VRAM を使用します。そのため、少なくとも 2〜4GB 程度の余裕を確保するのが安全で、24GB の GPU なら実際にモデルへ使える容量はおおむね 20〜22GB 程度と考えるとよいでしょう。

Q6:システム RAM はどのくらい必要ですか?

推論方式によって異なります。CPU のみで推論する場合、システム RAM はモデルサイズの少なくとも約 1.2 倍が必要で、たとえば 70B Q4_K_M の約 35 GB モデルなら 48~64 GB RAM を推奨します。全量 GPU 推論なら RAM 要件は低く、16~32 GB 程度で十分です。GPU Offload はその中間です。多くのローカル AI 用途では最低 32 GB、長いコンテキストや複数モデルを頻繁に切り替えるなら 64 GB を推奨します。

計算が完了しました