GLOSSARY
データアノテーション
あらゆる AI システムの足元にある人間の労働です。テキスト・画像・音声にタグを付け、モデルが学ぶ正解を用意します — 数百万人規模の産業です。
モデルはラベル付きの例から学び、その例を作るのは誰かです。データアノテーションは、バウンディングボックスをクリックするギグワーカーから、医療画像を注釈する専門家、そしてフロンティアラブが奪い合うエリート層 — RLHF の比較を書く博士たち — に及びます。産業の地理と賃金それ自体が公平性の問題になり、合成データが一部を代替しつつあります。
品質がすべてです。曖昧なガイドライン、レーター疲労、不揃いなアノテーターは静かにモデルを毒します。だからこそ真剣なプログラムはアノテーター間一致を測り、ゴールドスタンダード検査を回し、要る場所の専門性に払います。「ゴミラベル、ゴミモデル」は、コンピューティング最古の規則のアノテーション時代版です。