术语表

量化(Quantization)

最后更新:2026-07-20

**量化(quantization)**通过降低权重的数值精度来压缩神经网络——训练时用 16 比特,存储时改用 8、4 甚至 2 比特。权重变成自己略粗糙的近似值,换来的是模型体积的剧烈缩水:一个 70B 参数的模型,16-bit 需要约 140 GB 显存,4-bit 只要约 35 GB。这就是「一组 GPU 集群」和「一张消费级显卡」的区别——开源权重模型能跑在普通硬件上,量化是最大的功臣。

为什么行得通

训练出的权重携带的精度超过模型实际所需,16 比特里有相当一部分是噪声。量化利用的就是这份冗余——把每个权重映射到一张紧凑的数值网格上,用缩放因子保住重要权重的分辨率。聪明的方案会重点保护少数关键的离群值,这是现代 4-bit 量化在基准上通常只掉几个百分点的原因。低于 4 比特后冗余耗尽,退化肉眼可见:先是细微的推理失手,然后长文本开始跑偏。llama.cpp 社区的实用经验:同样的显存,大模型的 4-bit 通常好过小模型的全精度。

你会见到的名字

Hugging Face 上的模型文件都标着格式:GGUF(llama.cpp 的格式,本地 CPU/GPU 推理的事实标准——Q4_K_M 这类标签表示约 4 比特/权重)、AWQGPTQ(GPU 服务格式)、FP8/INT8(数据中心 API 常用的服务精度)。在 LM Studio 或 Ollama 里下载模型时,选量化档位就是在选质量-显存的折中——Q4_K_M 是约定俗成的甜点位,Q8_0 接近无损,低于 Q3 的档位用前先测。

它不做什么

量化压缩的是推理,不是训练(那是 QLoRA 的活——在量化基座之上做微调)。量化后的模型还是同一个模型,只是略微模糊——同样的知识、同样的失效模式,最难的任务上可靠性略降。托管 API 背后同样在量化,你很少被服务到完整的 16-bit 权重——只是从没见过那个标签而已。

来源

← 全部术语