GLOSSARY
데이터 레이블링
모든 AI 시스템 아래 깔린 인간의 노동. 텍스트·이미지·오디오에 태그를 달아 모델이 배울 정답을 만듭니다 — 수백만 명 규모의 산업입니다.
모델은 라벨 붙은 예시에서 배우고, 그 예시를 만드는 사람이 있습니다. 데이터 레이블링은 바운딩 박스를 클릭하는 기글 워커부터, 의료 영상에 주석 다는 전문가, 그리고 프론티어 랩이 경쟁하는 엘리트층 — RLHF 비교를 작성하는 박사들 — 에 이릅니다. 이 산업의 지리와 임금 자체가 공정성 문제가 됐고, 합성 데이터가 그 일부를 대신하고 있습니다.
품질이 전부입니다. 모호한 가이드라인, 레이터 피로, 불일치하는 어노테이터가 조용히 모델을 독살합니다. 그래서 진지한 프로그램은 어노테이터 간 일치도를 측정하고, 골드 스탠다드 검사를 돌리고, 필요한 곳에 전문성을 지불합니다. '쓰레기 라벨, 쓰레기 모델'은 컴퓨팅 최고의 규칙의 레이블링 시대 버전입니다.