GLOSSARY
训练(预训练与后训练)
创造模型的过程:预训练从海量文本学习语言,后训练把它塑造成有用的助手。
预训练是最烧钱的部分:GPU 集群上运行数月,从网络规模的文本、代码与(近来)图像中学习下一 token 预测。产物是原始的“基础模型”——续写很强,作为产品无用。后训练随后改造它:在精选对话上做监督微调,用 RLHF 或 DPO 对齐人类偏好,再针对推理、编程或安全做专项训练。这就是为什么“小”的后训练模型能胜过更大的原始模型。
几乎没人从头训练前沿基础模型——那是五家公司的游戏——但后训练正快速民主化:开源模型附上配方,微调一个已发布的 checkpoint 只要数百美元而非数百万。当厂商宣传“为你定制模型”,几乎总是指后训练。