GLOSSARY
KV 캐시
이미 읽은 토큰에 대한 메모를 재계산 없이 유지하게 하는 구조. 긴 대화가 GPU 메모리를 잡아먹는 이유입니다.
Transformer는 '지금까지 본 모든 것'에 주의를 기울입니다. 새 토큰마다 전체 이력을 재계산하면 처참하게 느려지므로, 서빙 엔진은 각 토큰의 key/value 투영 — KV 캐시 — 를 저장해 재사용합니다. 캐시는 대화 길이와 배치 크기와 함께 자라며, 이것이 서빙 용량이 연산만큼 메모리로 측정되고 긴 컨텍스트에 돈이 드는 이유입니다.
여기서 유명한 혁신은 vLLM의 PagedAttention입니다. OS가 RAM을 관리하듯 KV 캐시를 페이지 단위로 관리해 연속 블록을 피함 — 낭비를 획기적으로 줄이고 모든 다운스트림의 처리량을 올렸습니다. API가 긴 컨텍스트에 더 부을 때, 가격 페이지 뒤의 물리학은 캐시 메모리입니다.