GLOSSARY
混合专家(MoE)
一种把每次请求路由到少数专家子网络的架构——以每个 token 更低的算力,达到前沿级质量。
稠密模型对每个 token 激活全部参数。混合专家模型则包含大量并行的“专家”子网络和一个路由器,每个 token 只激活其中少数——例如 256 个专家中的 8 个。模型的总知识量巨大,但每个 token 的计算量保持很小。
当前一代最强的开源与商用模型很多都采用这一架构。它也解释了一个常见困惑:号称“671B 参数”的模型,服务成本可能比稠密 70B 还低——因为任何一次请求只运行其中一小部分参数。