インデックスへスキップ

GLOSSARY

AI バイアス

データから学んだ系統的な不公平。モデルが性別・人種・言語・文化についてのステレオタイプを機械の規模で反復・増幅します。

モデルは人間のデータから学び、人間のデータには人間の偏見が含まれます。翻訳は医師を男性・看護師を女性にし、画像生成は職業を白くし、履歴書スクリーニングは少数派に傾く名前を低評価します。バイアスは時折のバグではなく学習コーパスの統計的性質であり、だから「直せばいい」では済みません。分野全体が均衡データセット、公平性の評価スイート、人口統計横断で確認した RLHF データで応えています。

ユーザーへの実用的な防御は具体的です。属性を入れ替えて同じ質問をし比較する、集団についての主張に出典を求める、そして流暢な自信は公平さの証拠ではないと覚えておく。構築者には、バイアス評価を精度評価の隣に置くことです。なしで出荷するのは、テスト未実施のバグを規模化して出荷することです。

関連する用語

この技術を使うツール

関連カテゴリー