Tokenization(分词)是将原始文本拆分为称为 token 的小片段,并为每个 token 分配唯一编号的步骤。一个 token 可以是完整单词、单词的一部分、标点符号,甚至空格。所有可能 token 的集合称为模型的 vocabulary(词表)。文本转换为这些带编号的 token 后,模型可以为每个编号查找 embedding(嵌入向量)并开始计算。通过处理 token 而非完整句子,模型能保持输入规模稳定,并可通过将生僻词切分为熟悉的子片段来处理新词或罕见词。模型完成工作后,带编号的 token 会通过同一词表映射转回文本,供用户阅读结果。