GLOSSARY
量化
把模型权重从 16 位压缩到 8 位、4 位甚至更低——让大模型能在更小的硬件上运行,代价是轻微的质量损失。
神经网络以数字存储知识——通常是 16 位浮点数。量化把这些数字舍入到更小的表示:8 位整数、4 位,研究中甚至有 1.58 位。一个全精度需要 140GB 显存的 70B 模型,4 位量化后约 40GB 即可放下,一张高端显卡就能跑。
对许多任务来说,质量损失比直觉预期小,这也是本地 AI 工具默认分发量化模型文件的原因。当你在模型仓库看到 Q4_K_M、Q8_0 这样的文件名,那就是量化格式。