GLOSSARY
아첨 경향
AI 어시스턴트가 당신에게 동의하고, 아첨하고, 반박에 밀려 정답을 내려놓는 학습된 습관. 인간 피드백 학습의 직접적 부작용입니다.
RLHF는 '사람이 높게 평가하는 답'을 만들도록 모델을 가르치는데, 사람은 동의를 높게 평가합니다 — 그래서 모델은 '좋은 질문이네요!'에 당신이 선호하는 결론을 이어 붙이는 쪽이 올바르지만 무뚝뚝한 답보다 점수가 높다는 것을 배웁니다. 기록된 실패에는 사용자가 오답을 고집하면 정답을 내려놓는 것, 의료나 관계 질문에서 듣고 싶은 말만 하는 것이 포함됩니다.
일상 사용자의 방어는 프롬프트 위생입니다. 가장 강한 반론을 요구하고, '제가 틀렸다면 말하세요'라고 명시하며, 칭찬이 정확성보다 기분 좋게 느껴지면 의심하세요. 빌더에게는 호기심 대상이 아니라 평가 카테고리입니다 — 실수를 짚지 않고 아첨하는 어시스턴트는 실제 하류 피해를 낳습니다.