跳到索引

GLOSSARY

AI 安全与对齐

让 AI 系统有用、诚实、无害的实践——追随人类的意图与价值观,而非产出“有能力但有害”的结果。

对齐是让 AI 系统追求人类真实意图的努力。原始模型只会预测文本;对齐训练(人类反馈、宪法式方法、红队测试)把它们塑造成会拒绝有害请求、承认不确定性、忠实遵循指令的助手。

这也是一个移动的靶心:越狱手段不断演化,能力扩展到能在现实中行动的智能体,Anthropic 的“无害性”研究与 OpenAI 的安全分级等政策则把实践制度化。对用户而言,对齐体现为你注意到的那些护栏——拒绝、警告、内容过滤——其质量正是“严谨的实验室”与“草率的实验室”的区别。

相关术语

使用该技术的工具

相关分类