Aller au contenu

Transformer

L’architecture de réseau de neurones derrière les LLM modernes, qui utilise l’auto-attention pour traiter tous les tokens en parallèle.

Née dans l’article de 2017 « Attention Is All You Need », cette architecture a supplanté les réseaux récurrents et rendu possible l’entraînement à très grande échelle. Presque tous les LLM connus aujourd’hui en sont des variantes.

Ressources associées