GLOSSARY
AI 安全性とアライメント
AI システムを有用・誠実・無害にする取り組みです。有能でも有害な出力ではなく、人間の意図と価値に従うことを目指します。
アライメントは、AI システムが人間が本当に意図することを追求するようにする取り組みです。生のモデルはテキストを予測するだけ。アライメント学習(人間のフィードバック・constitutional 手法・レッドチーミング)が、有害な要求を断り、不確実性を認め、指示に忠実なアシスタントへと形づくります。
それは動く的でもあります。ジェイルブレイクは進化し、能力は世界に行動するエージェントへ広がり、Anthropic の「無害性」研究や OpenAI の安全ティアのようなポリシーが実践を制度化しています。ユーザーにとっては、気づくガードレール — 拒否・警告・コンテンツフィルタ — として現れ、その質こそ慎重なラブと不用心なラブの違いです。