GLOSSARY
混合エキスパート(MoE)
各リクエストを少数の専門サブネットワークへ振り分けるアーキテクチャ。トークンあたりの計算量を抑えつつ、最前線級の品質を実現します。
密なモデルはすべてのトークンで全パラメータを動かします。MoE モデルは多数の並列「エキスパート」サブネットワークとルーターを持ち、トークンごとにその一部(例:256 中 8)だけを起動します。総知識量は巨大でも、トークンあたりの計算は小さく保たれます。
現在の最強クラスのオープン・商用モデルの多くがこのアーキテクチャです。よくある混乱もこれで説明できます。「671B パラメータ」とうたうモデルの提供コストが密な 70B より安いことがあるのは、各リクエストで動くのはパラメータのごく一部だからです。