GLOSSARY
데이터 큐레이션
학습에 무엇을 넣을지 고르는 것 — 필터링, 중복 제거, 가중치 — 가 품질 경쟁에서 모델 아키텍처만큼 중요해졌습니다.
스케일링 시대의 교훈은 뒤집혔습니다. 어느 지점을 넘으면 더 많은 데이터보다 더 나은 데이터가 이깁니다. 프론티어 랩은 이제 아키텍처만큼 큐레이션 파이프라인 — 품질 분류기, 중복 제거, 퍼플렉시티 필터, 도메인별 혼합 가중치 — 에 투자합니다. 큐레이션된 데이터로 학습한 소형 모델(Phi 시리즈, 현대 SLM)이 날것 스크레이프로 학습한 더 큰 모델을 부끄럽게 하며, 결정적으로 증명했습니다.
큐레이션은 학습을 넘어 확장됩니다. eval 세트 큐레이션이 무엇을 측정할 수 있는지 정하고, RAG 코퍼스 큐레이션이 그라운딩된 어시스턴트가 무엇을 알 수 있는지 정합니다. 아이러니하게도 큐레이션은 데이터 사이언스 가장 오래된 기술의 새 옷이지만 — 파운데이션 모델 규모에서는 전처리 잡일이 아니라 핵심 경쟁 해자가 됐습니다.