Mélange d’experts (MoE)
Architecture qui route chaque token vers quelques sous-réseaux spécialisés, augmentant la capacité sans coût proportionnel.
Un modèle MoE peut compter des centaines de milliards de paramètres tout en n’en activant qu’une fraction par token : il tourne donc plus vite qu’un modèle dense de même taille. Mixtral et plusieurs modèles de pointe adoptent ce design.