GLOSSARY
注意力机制
让模型为每个输出判断输入中哪些部分重要的机制——让现代 AI 成为可能的那一个想法。
注意力在每一步回答一个问题:“我看过的所有内容里,现在什么重要?”读“river bank”里的“bank”时,注意力会拉近“river”、压低“finance”。每个 token 与其他所有 token 计算相关性分数,模型成为其所关注内容的加权混合。
这就是 Transformer 能处理长距离语义、翻译能记住几段前提到的性别、上下文窗口以 token 计量的原因——注意力的开销随两两组合增长。它的各种变体(多头、分组查询、flash attention)正是 vLLM 这类推理引擎背后的管道优化。