인덱스로 건너뛰기

GLOSSARY

양자화

모델 가중치를 16비트에서 8·4비트 이하로 압축하는 기술. 큰 모델을 작은 하드웨어에서 돌릴 수 있게 하며, 대가는 약간의 품질 저하입니다.

신경망은 지식을 수치로 저장합니다 — 보통 16비트 부동소수점. 양자화는 이 수치를 더 작은 표현(8비트 정수, 4비트, 연구에서는 1.58비트까지)으로 반올림합니다. 풀 정밀도에서 140GB 메모리가 필요한 70B 모델도 4비트면 약 40GB에 들어가, 고급 GPU 한 대로 구동됩니다.

많은 작업에서 품질 대가는 직관보다 작으며, 이것이 로컬 AI 도구가 양자화된 모델 파일을 기본으로 배포하는 이유입니다. 레지스트리에서 Q4_K_M·Q8_0 같은 파일명을 본다면, 그것이 양자화 포맷입니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리