Tokeniseur
Composant qui découpe le texte brut en tokens exploitables par le modèle, puis les reconvertit en texte.
La plupart des tokenizers modernes utilisent des schémas de sous-mots comme BPE : un mot rare peut se découper en plusieurs tokens quand les mots courants restent entiers. C’est pourquoi un même sens ne « coûte » pas le même nombre de tokens selon la langue.