GLOSSARY
RLHF(인간 피드백 기반 강화학습)
날것의 언어 모델을 정중하고, 유용하고, 안전하게 만드는 학습 단계. 어떤 답이 나은지에 대한 수천 건의 인간 판단으로 가르칩니다.
베이스 모델은 다음 토큰을 예측할 줄 알지만 '도움이 되는 것'은 모릅니다. RLHF가 이 간극을 메웁니다. 사람이 모델 답변 쌍을 순위 매기고, 보상 모델이 그 선호를 학습하며, 강화학습이 사람들이 실제 선호하는 답 — 정중·적절·불확실성에 대한 정직·유해 요청 거절 — 으로 모델을 이끕니다.
ChatGPT가 날것의 LLM과 다르게 느껴지는 가장 큰 이유입니다. 대가도 있습니다. 지나치게 조심스러워 회피적이 되고, 유쾌한 동조(아첨)로 기울며, 날것 능력 일부가 뭉개질 수 있습니다. RLAIF와 DPO는 인건비를 줄이는 새 변형입니다.