分词器(Tokenizer)将原始文本拆分为模型可处理的词元、并能反向还原的组件。大多数现代分词器采用 BPE 等子词方案,因此生僻词可能被拆成多个 token,而常见词保持完整。这也是相同含义在不同语言下 token 数不同的原因。