GLOSSARY
投機的デコーディング
小さな下書きモデルが数トークンを推測し、大きなモデルが一度で確認する — 答えを変えずに生成を速くする。
自己回帰デコードが遅いのは、各トークンが大きなモデルの完全な前向き計算を待つからです。投機的デコーディングは安い下書きモデルに短い続きを提案させ、大きなモデルが提案全体を並列で検証し、自分が言ったであろう接頭辞を残します。外れた推測は捨て、当たった推測はただの速度です。
正しく実装すればサンプリング分布は変わらないので、ラボは品質の取引ではなくランタイムの技として出荷します。得は下書きが教師にどれだけ同意するかに依ります。反復的・制約付き出力では加速が大きく、意外なコードでは縮みます。vLLM と多くのホスト API は今、同じエンドポイントの裏にこれを隠しています。