GLOSSARY
RLHF(基于人类反馈的强化学习)
让原始语言模型变得礼貌、有用且安全的训练步骤——用数千条“哪个回答更好”的人类评判来教学。
基础模型只会预测下一个 token,并不知道什么叫“有帮助”。RLHF 弥补这一差距:人类对成对的模型回答排序,奖励模型学习这些偏好,再用强化学习把模型推向人们真正喜欢的回答——礼貌、切题、诚实面对不确定性、拒绝有害请求。
这是 ChatGPT 体验与原始 LLM 拉开差距的最大原因。代价也真实存在:RLHF 可能让模型谨慎到回避问题、偏向讨好的附和(谄媚),并磨掉部分原始能力。RLAIF 与 DPO 是降低人工成本的新变体。