GLOSSARY
투기적 디코딩
작은 초고 모델이 몇 토큰을 추측하고, 큰 모델이 한 번에 확인합니다 — 답을 바꾸지 않고 생성을 빠르게.
자기회귀 디코딩이 느린 이유는 각 토큰이 큰 모델의 완전한 전향 패스를 기다리기 때문입니다. 투기적 디코딩은 더 싼 초고 모델이 짧은 연속을 제안하게 하고, 큰 모델이 제안 전체를 병렬로 검증해 자신이 말했을 접두사를 남깁니다. 틀린 추측은 버리고, 맞은 추측은 공짜 속도입니다.
올바르게 구현하면 샘플링 분포가 바뀌지 않으므로, 랩은 품질 거래가 아니라 런타임 재주로 출시합니다. 이득은 초고가 선생님과 얼마나 자주 동의하는지에 달렸습니다. 반복적이거나 제약된 출력에서는 가속이 크고, 놀라운 코드에서는 줄어듭니다. vLLM과 많은 호스티드 API는 이제 같은 엔드포인트 뒤에 이것을 숨깁니다.