인덱스로 건너뛰기

GLOSSARY

AI 편향

데이터에서 배운 체계적 불공정. 모델이 성별·인종·언어·문화에 대한 고정관념을 기계 규모로 반복·증폭합니다.

모델은 인간 데이터에서 배우고, 인간 데이터에는 인간의 편견이 담겨 있습니다. 번역은 의사를 남성으로, 간호사를 여성으로 옮기고, 이미지 생성은 직업을 밝게 만들며, 이력서 스크리닝은 소수자 쪽 이름에 낮은 점수를 줍니다. 편향은 가끔의 버그가 아니라 학습 코퍼스의 통계적 성질이라 '그냥 고치자'가 통하지 않는 이유입니다. 분야 전체가 균형 데이터셋, 공정성 평가 스위트, 인구통계를 넘나들며 검증한 RLHF 데이터로 대응합니다.

사용자를 위한 실용적 방어는 구체적입니다. 속성을 바꿔 같은 질문을 하고 비교하기, 집단에 대한 주장에 출처 요구하기, 유창한 자신감이 공정성의 증거가 아님을 기억하기. 빌더에게는 편향 평가를 정확도 평가 곁에 두는 것입니다. 없이 출시하는 것은 테스트되지 않은 버그를 규모로 출시하는 것입니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리