GLOSSARY
AI 안전성·정렬
AI 시스템을 유용·정직·무해하게 만드는 실천입니다. 유능하지만 해로운 출력이 아니라 인간의 의도와 가치를 따르도록 하는 것입니다.
정렬은 AI 시스템이 인간이 실제로 의도한 것을 추구하게 만드는 노력입니다. 날것의 모델은 텍스트를 예측할 뿐. 정렬 학습(인간 피드백·헌법적 기법·레드팀)이 유해한 요청을 거절하고, 불확실성을 인정하고, 지시에 충실한 어시스턴트로 다듬습니다.
움직이는 과녁이기도 합니다. 탈옥 기법은 진화하고, 능력은 세상에서 행동하는 에이전트로 확장되며, Anthropic의 '무해성' 연구나 OpenAI의 안전 등급 같은 정책이 실천을 제도화합니다. 사용자에게 정렬은 눈에 띄는 가드레일 — 거절·경고·콘텐츠 필터 — 로 나타나며, 그 품질이 신중한 랩과 무성의한 랩의 차이입니다.