인덱스로 건너뛰기

GLOSSARY

과대적합

패턴을 배우는 대신 학습 예시를 암기하는 것. 모의고사는 만점이지만 새로운 것엔 취약합니다.

과대적합은 머신러닝의 고전적 실패입니다. 옵티마이저가 근본 규칙이 아닌 학습 세트 그 자체 — 그 버릇과 노이즈까지 — 에 맞는 지름길을 찾습니다. 학습 데이터에선 100%, 실데이터에선 60%인 파인튜닝 분류기는 배운 게 아니라 암기한 것입니다. 표준 방어는 홀드아웃 검증 세트, 조기 중단, 정규화, 더 다양한 데이터입니다.

이 개념은 이제 학습을 넘어선 실패도 설명합니다. 벤치마크에 과적합된 모델은 MMLU에선 아름답고 당신의 작업에선 나쁩니다. eval 스위트에 과적합된 에이전트는 테스트는 통과해도 요점을 놓칩니다. 결과가 너무 좋아 보이면 첫 질문은 '무엇을 암기했나', 둘째는 '본 적 없는 데이터를 보여줘'입니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리