Zum Inhalt springen

Mixture of Experts (MoE)

Eine Architektur, die jedes Token an wenige spezialisierte Subnetze leitet und so Kapazität ohne proportionale Kosten steigert.

Ein MoE-Modell kann Hunderte Milliarden Parameter besitzen, aktiviert pro Token aber nur einen Bruchteil – und läuft damit schneller als ein gleich großes dichtes Modell. Mixtral und mehrere Frontier-Modelle setzen auf dieses Design.

Verwandte Ressourcen