GLOSSARY
평가 하네스
AI 제품의 테스트 스위트. 골든 데이터셋, 스코어러, 품질이 퇴보하면 빌드를 떨어뜨리는 게이트.
평가 하네스는 모델 행동의 CI입니다. 얼린 입력 세트를 유지하고 '좋음'의 정의 — 완전 일치, 루브릭, 모델 심판, 사람 리뷰 — 를 두며, 사용자가 보기 전에 그 자로 프롬프트나 모델 변경을 돌립니다. Braintrust와 LangSmith가 이 루프를 제품화했고, 많은 팀은 아직 pytest와 스프레드시트를 유지합니다.
하네스가 없으면 '모델이 나빠졌다'는 일화입니다. 있으면 diff입니다. 규율은 데모가 아니라 프로덕션을 대표하는 데이터셋을 손질하는 것과, 제품은 초록이 아닌데 eval이 초록이 될 때까지 튜닝하려는 충동을 거스르는 것입니다. 실패하지 않는 eval은 장식입니다.