基础知识词元化
Tokenization 基础
会员专享为什么需要 Tokenization?从字符级到子词级,理解 Unicode 和 UTF-8 编码
为什么需要 Tokenization
大语言模型的核心是 Transformer,它处理的是数字序列,而不是文本。那么问题来了:如何将文本转换成模型可以理解的数字?
这就是 Tokenization 要解决的问题。Tokenization 负责将文本字符串转换为整数序列(tokens),这些整数会作为查找表的索引,获取对应的向量表示(embeddings),最终输入到 Transformer 中。

Tokenization 看起来简单,但它是 LLM 中许多"奇怪"行为的根源。比如:
- 为什么 GPT 有时不擅长逐字母拼写?
- 为什么某些语言的性能比英语差?
- 为什么模型对某些字符串特别敏感?
这些问题都可以追溯到 Tokenization 的设计。
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档