AI・テクノロジー
LM StudioのQ4・Q5・Q8は何が違う?量子化とモデルサイズの選び方【2026年版】
LM Studioで表示されるQ4・Q5・Q8、K・S・M・Lは何を意味する?GGUFの量子化と7B・14B・32B・70Bモデルの選び方を初心者向けに整理します。
本記事にはA8.netのアフィリエイト広告が含まれます。量子化による容量・品質・速度の違いは、モデル、実行環境、プロンプトによって変わります。表の容量は購入前の概算に使う目安であり、特定モデルの動作を保証するものではありません。
LOCAL LLM GUIDE / 02
LM Studioで同じモデル名が何個も出てきて、
どれをダウンロードすればいいか分からない。
その原因が、ファイル名に付くQ4_K_M、Q5_K_M、Q8_0などの量子化表記です。結論から言うと、初めてならQ4_K_M前後が基準。そこからPCの空きメモリと、速度・品質のどちらを優先するかで調整します。
QUICK ANSWER
迷ったらQ4_K_M、余裕があればQ5_K_M
Q4
最初の基準
容量を抑えやすく、より大きなモデルを試しやすい。初心者向けの第一候補。
Q5 / Q6
品質とのバランス
メモリに余裕があり、同じモデルで少し品質を重視したい人向け。
Q8
大容量・高精度寄り
ファイルが大きい。Q4より小さいモデルをQ8で使うべきかも含めて比較する。
量子化とは、モデルを軽くする圧縮のようなもの
LLMは、膨大な数のパラメータを数値として持っています。元の高精度な数値を、より少ないビット数で表現してモデルを小さくするのが量子化です。一般には、ビット数を下げるほどファイルと必要メモリを減らせますが、回答品質が変化する可能性があります。
HIGH PRECISION
大きい・精度を保ちやすい
QUANTIZED
小さい・家庭用PCで扱いやすい
Hugging Faceの公式資料では、8bit量子化はメモリ使用量をおおむね半分にでき、4bitではさらに圧縮できると説明されています。ただし、GGUFで使うQ4_K_Mと、Transformersのbitsandbytesによる4bit量子化は実装が同じではありません。「4bitなら全部同じ」とは考えないでください。
GGUFとは?
llama.cpp系の実行環境で使われるモデルファイル形式です。LM StudioではGGUFモデルを検索・取得でき、同じモデルに複数の量子化ファイルが並びます。そこでQ4やQ8を選ぶことになります。
Q2・Q3・Q4・Q5・Q6・Q8の違い
Qの後ろの数字は、ざっくり言えば量子化の細かさを見分ける手掛かりです。数字が大きいほど常にすべてが優秀とは限りませんが、同じモデル・同系統の方式なら、一般に数字が大きいほどファイル容量と必要メモリが増え、元モデルの情報を保ちやすくなります。
| 表記 | 容量 | 品質の傾向 | おすすめ度 | 主な用途 |
|---|---|---|---|---|
| Q2 | かなり小さい | 劣化を感じやすい | 限定的 | メモリが厳しい環境で試す |
| Q3 | 小さい | 用途によって差が出る | 条件付き | より大きなモデルを載せたい |
| Q4 | 抑えやすい | 実用とのバランス | 最初の候補 | 日常チャット、要約、コード補助 |
| Q5 | Q4より大きい | 品質重視寄り | 余裕があれば | 同じモデルを丁寧に使う |
| Q6 | 大きい | 高精度寄り | 上級者向け | 容量より品質を優先 |
| Q8 | かなり大きい | 元精度に近づけやすい | 目的次第 | 検証、比較、メモリに余裕がある環境 |
※品質差はモデルやタスクに依存します。低ビット量子化でも十分な用途がある一方、計算、コード、長文、細かな指示では差が気になる場合があります。
「小さいQ8」と「大きいQ4」、どちらを選ぶ?
たとえば、8BモデルのQ8と14BモデルのQ4が近い容量になることがあります。この場合、単純にQ8の方が高品質とは限りません。モデル規模、学習内容、設計、得意分野の違いが大きいからです。まず使いたいモデル系統を決め、その中で量子化を選ぶのが基本です。
SMALL MODEL / Q8
軽いモデルを高精度寄りで使う
応答速度や小回りを重視しつつ、同じモデル内で情報を保ちたい場合に向きます。
LARGER MODEL / Q4
大きなモデルを現実的な容量で試す
推論能力や知識量を期待して、PCに載る範囲でモデル規模を上げたい場合の候補です。
Q4_K_MのK・S・M・Lは何を意味する?
GGUFでは、Q4_0だけでなくQ4_K_S、Q4_K_Mのような名前を見かけます。Kはllama.cppのK-quant系の方式です。末尾のS・M・Lは、同じビット数の中でも小ささや品質のバランスが異なる派生を見分ける表記として使われます。
SMALL寄り
容量を少し抑えたいときの候補。同じQ4でもMより小さい場合があります。
MEDIUM・バランス型
迷ったときの基準にしやすい。LM Studioの公式例でもQ4_K_Mが量子化指定の例として使われています。
LARGE寄り
同じ系列でより品質を残す方向。すべてのQ表記にS・M・Lが揃うわけではありません。
なお、名前だけで優劣を断定するのは危険です。作成者が重要度行列(imatrix)を使ったか、どのテンソルを別精度にしたかでも結果は変わります。信頼できる配布元を選び、モデルカードを読むことも大切です。
7B・14B・32B・70Bはどのくらいの容量?
モデル名の7B、14B、32B、70Bなどは、おおむねパラメータ数の規模を表します。下の表は、代表的な量子化を選んだときのモデルファイル容量の概算です。実際はアーキテクチャや語彙、量子化方式で変わるため、LM Studioのダウンロード画面に表示される実ファイル容量を優先してください。
| モデル規模 | Q4前後 | Q5前後 | Q8前後 | PCメモリの考え方 |
|---|---|---|---|---|
| 7B~8B | 約4~6GB | 約5~7GB | 約8~10GB | 16GBでも試せるが、32GBなら余裕 |
| 12B~14B | 約7~10GB | 約9~12GB | 約14~17GB | 32GBが現実的 |
| 27B~32B | 約16~21GB | 約20~25GB | 約30~36GB | 64GBが安心 |
| 70B前後 | 約38~45GB | 約46~53GB | 約72~80GB | 128GBを検討 |
※概算にはモデル本体以外の実行時メモリを含みません。OS、LM Studio、KVキャッシュ、画像入力用モデル、ブラウザなどの分を別に確保する必要があります。
容量表だけでPCを決めない
モデルファイルが20GBなら、20GBの空きメモリだけで安全に動くわけではありません。メモリ容量の決め方は、前の子記事でOSやKVキャッシュまで含めて整理しています。
32GB・64GB・128GBの目安を見る →LM Studioで失敗しにくい選び方
LM Studioにはモデルを探してダウンロードする機能があり、同じモデルに複数の量子化候補があるときは選択できます。公式ドキュメントは、PCで実行できるなら4bit以上の選択肢を案内しています。
用途からモデルを決める
日本語会話、コード、画像理解など、目的に合うモデル系統を先に選びます。
まずQ4_K_M前後を見る
実ファイル容量がPCの空きメモリへ余裕を持って収まるか確認します。
コンテキスト長を欲張らない
最初は既定値か小さめで読み込み、余裕を確認してから増やします。
同じ質問でQ4とQ5を比べる
速度、メモリ、回答の安定性を自分の用途で比べ、差を感じる場合だけ上げます。
CLIなら量子化を指定して取得できる
LM StudioのCLIでは、モデル名の後ろへ量子化を付けて指定できます。公式例では次のような形です。
lms get llama-3.1-8b@q4_k_m
画面操作の場合はDiscoverでモデルを検索し、複数候補が表示されたら量子化とファイル容量を確認します。モデル名が同じでも、配布者やファイル形式が異なることがあるため、名前だけでクリックしないようにしましょう。
PC別の無難なスタート地点
| PCメモリ | 最初に試す規模 | 量子化 | 次の調整 |
|---|---|---|---|
| 16GB | 7B~8B | Q4前後 | コンテキストを控えめにする |
| 32GB | 8B~14B | Q4_K_M | 余裕があればQ5または32Bの低量子化 |
| 64GB | 14B~32B | Q4~Q5 | 70B Q4は余裕を慎重に確認 |
| 128GB | 32B~70B | Q4~Q8を比較 | 長いコンテキストや大規模モデルへ |
量子化選びでよくある失敗
MISTAKE 01
最大のQ8を選べば安心
Q8でメモリを使い切るより、Q4・Q5で余裕を残した方が、長文や他アプリとの併用に向く場合があります。
MISTAKE 02
ファイル容量だけを見る
読み込み後はKVキャッシュや実行時領域も必要です。空きメモリぎりぎりのファイルは避けます。
MISTAKE 03
Q2とQ8の回答を一度だけ比べる
生成には揺らぎがあります。同じ設定・複数の課題で比べないと量子化差とは断定できません。
MISTAKE 04
配布元を確認しない
モデルカード、ライセンス、ベースモデル、量子化方法を確認します。仕事や公開サービスで使う場合は特に重要です。
ローカルLLM向けPCも量子化から逆算する
PCを先に買ってから入るモデルを探すより、「使いたいモデル規模」「Q4とQ5のどちらを中心にするか」「同時に使うアプリ」を先に決める方が失敗しにくくなります。メモリ増設ができないミニPCなら、特にこの順番が重要です。
MODEL → QUANT → MEMORY → PC
モデルから逆算する4ステップ
- 使いたいモデル規模を決める
- Q4_K_M前後の実ファイル容量を見る
- OS・KVキャッシュ・他アプリ分の余裕を足す
- 必要なメモリ容量のPCを選ぶ
ローカルLLM向けミニPCを探す
GMKtec公式ストアでは、64GB・128GB構成を選べるAI向けミニPCの現在価格と在庫を確認できます。
よくある質問
結局、Q4_K_Mを選べばよいですか?+
Q8は無劣化ですか?+
Q4_K_SとQ4_K_Mならどちら?+
量子化を変えると生成速度も上がりますか?+
GGUFとGPTQ・AWQは同じですか?+
まとめ:最初の1本はQ4、必要を感じたら上げる
- 初心者:Q4_K_M前後を最初の基準にする
- 品質重視:空きメモリが十分ならQ5・Q6と比較する
- Q8:高精度寄りだが、大容量に見合うかを確認する
- PC選び:モデルファイル以外のメモリも必ず残す
- 最終判断:同じ質問と設定で実際に比較する
量子化は、数字が大きければ無条件で正解というものではありません。家庭用PCでローカルLLMを活用するなら、まずQ4前後で用途に合うモデルを探し、回答の差を感じたときにQ5・Q6へ上げるのが現実的です。PCを購入する場合も、広告上の「大規模モデル対応」ではなく、使いたいGGUFの実容量から逆算しましょう。
参考にした公式情報
- LM Studio:モデルの検索と量子化候補の選び方
- LM Studio:lms getで量子化を指定する方法
- llama.cpp:量子化方式とビット数
- llama.cpp:GGUF量子化ツール
- Hugging Face:8bit・4bit量子化
情報は2026年9月2日時点で確認しています。LM Studio、llama.cpp、配布モデルの対応形式や推奨設定は更新される可能性があります。ダウンロード前に各モデルカードと利用規約をご確認ください。