跳到索引

GLOSSARY

推测解码

小草稿模型猜若干 token;大模型一次核对——加快生成且不改答案。

自回归解码慢,是因为每个 token 都要等大模型完整前向一次。推测解码让更便宜的草稿模型提出一小段续写;大模型再并行核对整段提议,留下与它本会说出的前缀。猜错的丢掉;猜对的就是免费速度。

实现正确时它不改变采样分布,所以实验室把它当运行时技巧而不是质量权衡来上线。收益取决于草稿与老师有多常一致。重复或受约束的输出上加速很大;令人意外的代码上会缩小。vLLM 和许多托管 API 现在把这藏在同一端点后面。

相关术语

使用该技术的工具

相关分类