Aller au contenu

Tokeniseur

Composant qui découpe le texte brut en tokens exploitables par le modèle, puis les reconvertit en texte.

La plupart des tokenizers modernes utilisent des schémas de sous-mots comme BPE : un mot rare peut se découper en plusieurs tokens quand les mots courants restent entiers. C’est pourquoi un même sens ne « coûte » pas le même nombre de tokens selon la langue.

Ressources associées