インデックスへスキップ

GLOSSARY

量子化

モデルの重みを 16 ビットから 8・4 ビット以下へ圧縮する技術。大型モデルを小型ハードウェアで動かせるようになり、代償はわずかな品質低下です。

ニューラルネットワークは知識を数値として保持します — 通常は 16 ビット浮動小数点。量子化はこれらの数値をより小さな表現(8 ビット整数、4 ビット、研究では 1.58 ビットさえ)に丸めます。フル精度で 140GB のメモリを要する 70B モデルも、4 ビットなら約 40GB に収まり、ハイエンド GPU 1 台で動きます。

多くのタスクでは品質の代償は直感より小さく、ローカル AI ツールが量子化済みモデルを既定で配布する理由です。レジストリで Q4_K_M や Q8_0 のようなファイル名を見たら、それが量子化フォーマットです。

関連する用語

この技術を使うツール

関連カテゴリー