GLOSSARY
KV 缓存
让模型为已读 token 保留“笔记”而无需重算的内存——长对话吞噬显存的原因。
Transformer 对“迄今看过的一切”做注意力。若每个新 token 都重算全部历史,会慢得无法接受,因此服务引擎保存每个 token 的 key/value 投影——即 KV 缓存——并复用。缓存随对话长度与批量大小增长,这就是为什么服务容量以内存计量不亚于算力,为什么长上下文更贵。
这里的著名创新是 vLLM 的 PagedAttention:像操作系统管理内存分页那样管理 KV 缓存,用页而非连续块——大幅削减浪费,抬高了所有下游用户的吞吐。当 API 对长上下文收取更高费用时,定价页背后的物理现实就是缓存内存。