GLOSSARY
RLHF(人間のフィードバックによる強化学習)
生の言語モデルを礼儀正しく、役に立ち、安全にする学習ステップ。どの回答が優れているかという人間の判断を大量に用いて教えます。
ベースモデルは次のトークンを予測するだけで、「役に立つ」という概念を持ちません。RLHF はその溝を埋めます。人間がモデル回答のペアを順位付けし、報酬モデルがその選好を学び、強化学習で人々が実際に好む回答 — 丁寧・的確・不確実性への誠実さ・有害要求の拒否 — へモデルを導きます。
ChatGPT が生の LLM と違って感じられる最大の理由がこれです。代償もあります。慎重すぎて回避的になり、気持ちの良い同調(へつらい)へ偏り、生の能力の一部が失われることも。RLAIF や DPO は人件費を減らす新しい変種です。