跳到索引

GLOSSARY

注意力机制

让模型为每个输出判断输入中哪些部分重要的机制——让现代 AI 成为可能的那一个想法。

注意力在每一步回答一个问题:“我看过的所有内容里,现在什么重要?”读“river bank”里的“bank”时,注意力会拉近“river”、压低“finance”。每个 token 与其他所有 token 计算相关性分数,模型成为其所关注内容的加权混合。

这就是 Transformer 能处理长距离语义、翻译能记住几段前提到的性别、上下文窗口以 token 计量的原因——注意力的开销随两两组合增长。它的各种变体(多头、分组查询、flash attention)正是 vLLM 这类推理引擎背后的管道优化。

相关术语

使用该技术的工具

相关分类