GLOSSARY
护栏(Guardrails)
AI 系统外围的安全层:在毒性输出、违禁话题、提示攻击与危险操作到达用户之前拦截它们的过滤器与规则。
模型本身的设计就是不可预测的;护栏是包裹其外的产品决策。包括输入过滤(该请求是否允许?)、输出分类(回复是否有毒或泄露机密?)、话题边界、限流与操作检查——当代理提议“删除数据库”时,护栏层要求人工确认。
好的护栏在正常工作时不可见,校准失误时令人恼火——每张“AI 拒绝无害请求”的疯传截图都是校准失败,每个越狱都是护栏的缺口。厂商以审核 API(OpenAI、Cohere)形式提供护栏,让基于 LLM 的团队不必自研。