CodeRoadMap
路线图学习路径文章题库资源社区

浏览

首页路线图学习路径知识库题库文章资源社区我的学习
CodeRoadMap

中文编程学习导航:路线图、讲义与题库,进度可同步。

路线图学习路径文章题库社区

© 2026 CodeRoadMap

津ICP备2026012044号-1|coderoadmap@126.com
开发路线图/AI 智能体开发路线图/分词(Tokenization)
阶段一

分词(Tokenization)

节点说明与学习资源

Tokenization(分词)是将原始文本拆分为称为 token 的小片段,并为每个 token 分配唯一编号的步骤。一个 token 可以是完整单词、单词的一部分、标点符号,甚至空格。所有可能 token 的集合称为模型的 vocabulary(词表)。文本转换为这些带编号的 token 后,模型可以为每个编号查找 embedding(嵌入向量)并开始计算。通过处理 token 而非完整句子,模型能保持输入规模稳定,并可通过将生僻词切分为熟悉的子片段来处理新词或罕见词。模型完成工作后,带编号的 token 会通过同一词表映射转回文本,供用户阅读结果。

← 上一节点Transformer 模型与大语言模型下一节点 →上下文窗口