跳到索引

GLOSSARY

红队测试

在对手之前蓄意攻击 AI 系统——越狱、提示注入、古怪边界情况——然后修复被攻破之处。

红队测试借用了军事用语:内部“红队”扮演对手,用越狱措辞、操纵性人格、多语言变通与荒诞边界输入探测模型,绘制其失效地图。前沿实验室运行常态化项目并发布报告;监管日益要求相关证据;众包式漏洞赏金攻击已成产业分支。

产出永远不会是“安全”——它是当下失效点的地图与修复循环。对构建者的启示:安全是对抗性测试而非打勾项——如果你的 AI 代理会花钱而没人试图攻破过它,就当它会被攻破。

相关术语

使用该技术的工具

相关分类