GLOSSARY
혼합 전문가(MoE)
각 요청을 소수의 전문 서브네트워크로 라우팅하는 아키텍처. 토큰당 연산을 줄이면서 최전선급 품질을 냅니다.
밀집 모델은 모든 토큰에 전체 파라미터를 활성화합니다. MoE 모델은 수많은 병렬 '전문가' 서브네트워크와 라우터를 두고, 토큰마다 그중 일부(예: 256개 중 8개)만 활성화합니다. 전체 지식은 거대하지만 토큰당 연산은 작게 유지됩니다.
현재 웨이브의 가장 강력한 오픈·상용 모델 다수가 이 아키텍처입니다. 흔한 혼란도 설명됩니다. '671B 파라미터'라고 광고하는 모델이 밀집 70B보다 서빙 비용이 쌀 수 있는 이유는, 각 요청에서 파라미터의 일부만 동작하기 때문입니다.