跳到索引

GLOSSARY

AI 偏见

从数据中学到的系统性不公:模型以机器规模重复并放大关于性别、种族、语言与文化的刻板印象。

模型从人类数据中学习,而人类数据包含人类偏见——于是翻译把医生译成男性、护士译成女性,图像生成器给职业“美白”,简历筛选给少数族裔名字降分。偏见不是偶发 bug,而是训练语料的统计属性,这就是“直接修掉”行不通的原因:整个领域用均衡数据集、公平性评测套件与跨人群校验的 RLHF 偏好数据来应对。

对用户,实用的防御很具体:交换属性重问同一问题并对比;要求对涉及人群的论断给出出处;记住“流畅的自信”不是公平的证据。对构建者,偏见评测应与准确率评测并列——不带它们上线,等于把一个未经测试的 bug 规模化发布。

相关术语

使用该技术的工具

相关分类