인덱스로 건너뛰기

GLOSSARY

가드레일

AI 시스템 바깥의 안전 계층. 유해 출력·금지 주제·프롬프트 공격·위험한 작업이 사용자에게 닿기 전에 가로막는 필터와 규칙입니다.

모델 자체는 설계상 예측 불가능하며, 가드레일은 그것을 감싼 제품적 판단입니다. 입력 필터(이 요청이 허용되는가), 출력 분류기(이 응답이 유독한가, 비밀을 새는가), 주제 경계, 레이트 리밋, 액션 검사 — 에이전트가 'DB 삭제'를 제안하면 가드레일 계층이 사람 확인을 요구합니다.

좋은 가드레일은 작동 중엔 보이지 않고, 보정이 틀어지면 성가십니다. '무해한 것을 거절하는' 확산 스크린샷은 모두 보정 실패이고, 모든 탈옥은 틈새입니다. OpenAI와 Cohere가 모더레이션 API로 제공해, LLM 기반 팀이 직접 만들 필요가 없습니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리