인덱스로 건너뛰기

GLOSSARY

지시 튜닝

수천 개의 '지시-응답' 쌍으로 베이스 모델을 파인튜닝해 요청을 따르게 만드는 단계. 날것의 예측기와 쓸 만한 어시스턴트 사이에 있습니다.

베이스 모델은 텍스트를 이어 쓸 뿐, 따르지 않습니다. 지시 튜닝은 예시로 복종을 가르칩니다. 좋은 응답을 곁들인 지시형 작업을 형식(목록·표·코드)·스타일·도메인에 걸쳐 모아 학습시킵니다. 이 단계를 거치면 모델은 자동완성처럼 문장을 잇지 않고, 어시스턴트처럼 질문에 답하기 시작합니다.

위치는 사전학습과 선호 튜닝(RLHF/DPO) 사이입니다. 먼저 '도움이 되는 형식'을 배우고, 이어서 RLHF가 사람들이 선호하는 답을 다듬습니다. 오픈 지시 데이터셋과 커뮤니티 지시 튜닝 모델 덕에 'Ollama에서 어떤 오픈 모델이든 돌리면 바로 대화'가 가능한 것입니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리