GLOSSARY
ガードレール
AI システムの外側にある安全層。有害出力・禁止トピック・プロンプト攻撃・危険な操作を、ユーザーに届く前に遮るフィルタとルールです。
モデル単体は設計上予測不能であり、ガードレールはそれを包むプロダクト上の判断です。入力フィルタ(この要求は許可されるか)、出力分類器(この応答は有害か、秘密を漏らすか)、トピック境界、レート制限、アクション検査 — エージェントが「DB を削除」と提案したら、ガードレール層が人間の確認を求めます。
良いガードレールは機能中は見えず、調整が外れると厄介です。「無害なものを拒否する」拡散スクリーンショットは全て調整の失敗で、全てのジェイルブレイクは隙間です。OpenAI や Cohere がモデレーション API として提供し、LLM を使うチームは自作せずに済みます。