Saltar al contenido

Mezcla de expertos (MoE)

Arquitectura que envía cada token a unas pocas subredes especializadas, aumentando la capacidad sin coste proporcional.

Un modelo MoE puede tener cientos de miles de millones de parámetros pero activar solo una fracción por token, así que corre más rápido que un modelo denso del mismo tamaño. Mixtral y varios modelos de frontera usan este diseño.

Recursos relacionados