GLOSSARY
KV キャッシュ
既に読んだトークンについてのメモを再計算なしで保持させる仕組み。長い会話が GPU メモリを食う理由です。
Transformer は「これまで見たすべて」へ注意を払います。新しいトークンごとに全履歴を再計算すると破滅的に遅いため、サービングエンジンは各トークンの key/value 射影 — KV キャッシュ — を保存して再利用します。キャッシュは会話長とバッチサイズで増え、サービング容量が計算量と同じくらいメモリで測られ、長いコンテキストが課金される理由です。
ここでの有名な革新が vLLM の PagedAttention です。OS が RAM を管理するように KV キャッシュをページで管理し、連続ブロックを避ける — 無駄を劇的に減らし、下流全員のスループットを引き上げました。API が長いコンテキストに別料金を求めるとき、料金ページの裏の物理はキャッシュメモリです。