GLOSSARY
Transformer 架构
几乎当代所有 AI 模型(从聊天机器人到图像生成器)背后的神经网络架构,核心是一种名为注意力(attention)的机制。
Transformer 由 2017 年论文《Attention Is All You Need》提出,用注意力机制取代了逐步循环:输入的每一部分都能直接影响其他任何部分,使模型捕捉长距离关系,并能在数千块 GPU 上并行训练。正是这种并行性让“用互联网级数据训练”成为可能。
本目录中的一切都源于它:GPT 类语言模型是 Transformer 解码器,Stable Diffusion 类图像生成器内嵌 Transformer 模块,Whisper 类音频模型同样是 Transformer。研究者谈“缩放定律”,指的正是 Transformer 的质量如何随数据、参数与算力的增加而可预测地提升。