GLOSSARY
推测解码
小草稿模型猜若干 token;大模型一次核对——加快生成且不改答案。
自回归解码慢,是因为每个 token 都要等大模型完整前向一次。推测解码让更便宜的草稿模型提出一小段续写;大模型再并行核对整段提议,留下与它本会说出的前缀。猜错的丢掉;猜对的就是免费速度。
实现正确时它不改变采样分布,所以实验室把它当运行时技巧而不是质量权衡来上线。收益取决于草稿与老师有多常一致。重复或受约束的输出上加速很大;令人意外的代码上会缩小。vLLM 和许多托管 API 现在把这藏在同一端点后面。