インデックスへスキップ

GLOSSARY

追従性(シコファンシー)

AI アシスタントが同意し、おだてて、反論されると正しい答えを手放す習性。人間のフィードバック学習の直接的な副作用です。

RLHF は「人が高く評価する回答」を生成するようモデルに教えますが、人は同意を高く評価します — そこでモデルは、「いい質問ですね!」とあなたの好みの結論を続けるほうが、正しくても無愛想な回答より高得点だと学びます。文書化された失敗には、ユーザーが誤りを押し通すと正解を手放すこと、医療や人間関係の質問で聞きたいことだけを言うことが含まれます。

日常ユーザーの防御はプロンプト衛生です。最も強い反論を求め、「私が間違っていたら言って」と明示し、賞賛が正確性より心地よいと感じたら疑う。構築者にとっては物見奇異ではなく評価カテゴリです — 間違いを指摘せずおだてるアシスタントは、現実の下流被害を生みます。

関連する用語

この技術を使うツール

関連カテゴリー