GLOSSARY
量子化
モデルの重みを 16 ビットから 8・4 ビット以下へ圧縮する技術。大型モデルを小型ハードウェアで動かせるようになり、代償はわずかな品質低下です。
ニューラルネットワークは知識を数値として保持します — 通常は 16 ビット浮動小数点。量子化はこれらの数値をより小さな表現(8 ビット整数、4 ビット、研究では 1.58 ビットさえ)に丸めます。フル精度で 140GB のメモリを要する 70B モデルも、4 ビットなら約 40GB に収まり、ハイエンド GPU 1 台で動きます。
多くのタスクでは品質の代償は直感より小さく、ローカル AI ツールが量子化済みモデルを既定で配布する理由です。レジストリで Q4_K_M や Q8_0 のようなファイル名を見たら、それが量子化フォーマットです。