Aller au contenu

Mélange d’experts (MoE)

Architecture qui route chaque token vers quelques sous-réseaux spécialisés, augmentant la capacité sans coût proportionnel.

Un modèle MoE peut compter des centaines de milliards de paramètres tout en n’en activant qu’une fraction par token : il tourne donc plus vite qu’un modèle dense de même taille. Mixtral et plusieurs modèles de pointe adoptent ce design.

Ressources associées