NVIDIA GeForce RTX 5090 で動くローカルLLM
🛒 カードだけ替えられないなら、PCごと選び直す(BTOの選び方)
上記はアフィリエイトリンクです。経由して購入・課金された場合、当サイトに紹介料が入ります(判定結果には影響しません)。
VRAM: 32 GB ・ メモリ帯域: 1792 GB/s ・ TDP: 575 W ・ 区分: デスクトップGPU
量子化レベル別の動作判定(32GB VRAM 基準)。モデル名を押すと必要VRAMの詳細が見られます。
| モデル | Q4_K_M | Q5_K_M | Q6_K | Q8_0 | FP16 |
|---|---|---|---|---|---|
| Llama 3.2 1B 1.24B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| MiniCPM5 1B 1.08B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| LFM2.5 2.6B 2.7B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| LFM2.5 8B-A1B 8.47B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Sarashina 2.2 3B 3.36B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Qwen3.5 4B 4.66B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Nemotron-3 Nano 4B 3.97B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Llama 3.1 8B 8.03B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Llama 3.1 Swallow 8B 8.03B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Bonsai 8B (1-bit) 8.19B | ◎ 快適 Q1_0のみ | ||||
| Ternary-Bonsai 8B (三値) 8.19B | ◎ 快適 Q2_0のみ | ||||
| MiniCPM-V 4.6 1.3B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Qwen3.5 9B 9.65B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Ornith 1.0 9B 9.41B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Gemma 4 12B 12B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 |
| Qwen2.5 14B 14.8B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | △ ぎりぎり |
| DeepSeek R1 Distill Qwen 14B 14.8B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | △ ぎりぎり |
| gpt-oss 20B 21.51B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | × 不可 |
| Mistral Small 3.2 24B 23.6B | ◎ 快適 | ◎ 快適 | ◎ 快適 | ◎ 快適 | × 不可 |
| Gemma 4 26B-A4B 26.54B | ◎ 快適 | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 |
| Gemma 4 31B 31.27B | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 | × 不可 |
| Qwen3.6 27B 27.78B | ◎ 快適 | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 |
| Fara 1.5 27B 27.36B | ◎ 快適 | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 |
| Bonsai 27B (1-bit) 27.78B | ◎ 快適 Q1_0のみ | ||||
| Ternary-Bonsai 27B (三値) 27.78B | ◎ 快適 Q2_0のみ | ||||
| EXAONE 4.5 33B 34.35B | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 | × 不可 |
| GLM-4.7-Flash 31B-A3B 31.2B | ◎ 快適 | ◎ 快適 | ◎ 快適 | × 不可 | × 不可 |
| Qwen2.5 32B 32.8B | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 | × 不可 |
| Qwen3 Swallow 32B 32.8B | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 | × 不可 |
| Qwen3.5 35B-A3B 35.95B | ◎ 快適 | ◎ 快適 | × 不可 | × 不可 | × 不可 |
| Qwen3.6 35B-A3B 35.95B | ◎ 快適 | ◎ 快適 | × 不可 | × 不可 | × 不可 |
| Muse Glimmer 30B 29.78B | ◎ 快適 | ◎ 快適 | △ ぎりぎり | × 不可 | × 不可 |
| Nemotron-3.5 Lightning 30B-A3B 31.58B | ◎ 快適 | ◎ 快適 | × 不可 | × 不可 | × 不可 |
| Llama 3.3 70B 70.6B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Qwen3-Coder-Next 80B-A3B 79.7B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| GLM-5.2 753B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| DeepSeek-R1 684.53B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Solar Open 2 250B 250.29B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| DeepSeek-V4-Flash 304.18B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Step-3.7-Flash 201.37B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| MiniMax-M2.7 228.7B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Qwen3.5 397B-A17B 403.4B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Nemotron-3 Super 120B-A12B 123.61B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| DeepSeek-V4-Pro 1598.84B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Qwen3.8 2.4T-A95B 2446B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Kimi K3 2779.93B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
| Kimi K2.6 1058B | × 不可 | × 不可 | × 不可 | × 不可 | × 不可 |
必要VRAM = 重み + KVキャッシュ(既定コンテキスト時) + 1.5GB(OS/表示)。△は量子化を下げるかコンテキストを絞れば動作します。
NVIDIA GeForce RTX 5090とは
NVIDIA GeForce RTX 5090はNVIDIAのBlackwell世代(2025年)のGPUです。VRAM 32GB・メモリ帯域1792GB/sで、当サイトが判定に対応する単体GPU 78機種(2016年以降に発売された主要なコンシューマ向け・ノートPC向けGPU)の中で帯域は上位1%に位置します。発売は2025年1月です。TDPは575Wです。
32GB搭載の現行最上位。ローカルAI需要を明確に意識した容量設定です。
NVIDIA GeForce RTX 5090でローカルLLMはどこまで動く?
VRAM 32GB・メモリ帯域1792GB/sのGPUです。Q4_K_M量子化で◎(快適)判定になる最大クラスはQwen3.5 35B-A3B(35.95B)です。
当サイトの主要31モデル(Q4_K_M)に対する判定は、◎快適 29件・△ぎりぎり 0件・×不可 2件です。
このGPUで何ができるようになる?
32B級が◎で動く環境は、ローカルLLMではハイエンドの部類です。複雑な指示への追従、長文の要約・翻訳、コーディング支援まで、クラウドサービスに頼っていた作業のかなりの部分を手元で完結できます。入力した文章が一切外部に出ないため、仕事の文書や個人的なメモを気兼ねなく扱えるのが実用上の最大の恩恵です。
◎で動く代表例: Qwen3.5 35B-A3B / Qwen3.6 35B-A3B / EXAONE 4.5 33B。
理論上の生成速度の目安
生成速度はメモリ帯域(このGPUは1792GB/s)でほぼ頭打ちになります。◎判定モデルでの理論上限は次のとおりです。
| モデル | Q4_K_M重み | 理論上限 |
|---|---|---|
| MiniCPM5 1B | 0.7GB | ~2560 tokens/秒 |
| DeepSeek R1 Distill Qwen 14B | 9GB | ~199 tokens/秒 |
| Qwen3.6 35B-A3B | 22.3GB | ~80 tokens/秒 |
理論上限=メモリ帯域÷重みサイズの単純計算です。実際のスループットはオーバーヘッドの分これより下がります。
この機種は実測値があります: Llama 2 7B の4bit量子化で 290.02 トークン/秒 — 上の理論値の 62% です。実現できる割合はソフトウェア環境によって差があるため、別ベンダーのGPUと理論値だけで比較しないでください(詳しくはメモリ帯域の項)。
足りないときの3つの選択肢
- 量子化を一段下げる — 品質をわずかに譲って必要VRAMを減らします。
- CPUオフロード — 収まらない分をRAMへ。動きますが大幅に低速です。
- クラウドGPUを借りる — 秒課金で上位GPUを使う方法です: クラウドGPUという選択肢 / RunPodの始め方
どんな人に向いているか
VRAM 24GB以上は「ローカルで本格運用したい人」の領域です。30B級を常用し、用途別にモデルを切り替えて使い分ける遊び方まで視野に入ります。ローカルLLMを趣味として深掘りするなら、長く付き合える容量です。
スペック(VRAM・帯域・TDP)の出典: TechPowerUp GPU Database: techpowerup.com/gpu-specs
▶ あなたのPCを自動判定する(スペック送信なし・ブラウザ内完結)
またはこのGPU(NVIDIA GeForce RTX 5090)を選択した状態で判定ツールを開く
上記はアフィリエイトリンクです。経由して購入・課金された場合、当サイトに紹介料が入ります(判定結果には影響しません)。