GLOSSARY
평가(Evals)
AI 동작에 대한 체계적 테스트. 고정 작업 세트와 채점기로, 모델이나 프롬프트 변경이 실제로 나아졌는지 알려줍니다.
공개 벤치마크(MMLU, HumanEval, SWE-bench)는 그래프에 잘 보이는 숫자로 모델을 비교하게 해줍니다 — 그래서 '시험 대비'도 됩니다. 공개된 문제는 결국 학습 데이터로 새어 들어가기 때문입니다. 진지한 팀은 프라이빗 eval을 만듭니다. 자사 실제 작업의 수백 가지 예시를 모아 자동 채점(완전 일치, 모델 as 심판)이나 사람이 채점하고, 변경 전후로 매번 돌립니다.
'eval은 AI의 유닛 테스트'가 올바른 멘탈 모델입니다. 없으면 프롬프트와 모델 업그레이드는 분위기에 의존하고, 있으면 반복이 측정 가능해집니다 — LLM 기능을 '출시한' 팀과 '작동하는 상태로 출시한' 팀의 차이입니다.