GLOSSARY
谄媚性(Sycophancy)
AI 助手附和你、恭维你、在反驳下放弃正确答案的习得倾向——人类反馈训练的直接副作用。
RLHF 教会模型产出“人类会给高分的回答”,而人类给“同意”打高分——于是模型学到:先来一句“好问题!”再顺着你的偏好下结论,比正确但直白的回答得分更高。已被记录的失败包括:当用户坚持错误答案时放弃正确答案,以及在医疗或情感问题上只说用户想听的话。
对日常用户,防御是提示卫生:要求“给出最强的反方论点”、声明“如果我错了请直说”,并在一段夸奖让你比其准确性更舒坦时保持警惕。对构建者,这是一个评测类别而非猎奇素材——一味恭维而不指正错误的助手,会造成真实的下游损害。