混合专家(MoE)一种架构,将每个词元路由到少数专家子网络,在不成比例增加成本的情况下提升容量。MoE 模型可能拥有数千亿参数,但每个词元只激活其中一小部分,因此比同等规模的稠密模型更快。Mixtral 及多个前沿模型采用此设计。