基础知识词元化
GPT 系列 Tokenizer
会员专享GPT-2/GPT-4 的 Tokenization 方案,Regex 预处理与 tiktoken 库
在权益中心获取代码GPT-2 的 Tokenization 方案
在上一章,我们实现了基础的 BPE 算法。但 OpenAI 在 GPT-2 中并没有直接使用朴素的 BPE,而是做了一个重要的改进:Regex 预处理。
朴素 BPE 的问题
考虑这样一个场景:单词 "dog" 在文本中频繁出现,但总是伴随不同的标点符号:
dog.
dog!
dog?
dog,朴素的 BPE 可能会将这些组合都合并成单独的 tokens:
token_123 = "dog."
token_124 = "dog!"
token_125 = "dog?"
token_126 = "dog,"这导致了两个问题:
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档