Tokenizer 训练
会员专享使用 RustBPE 训练 BPE tokenizer,并导出 tiktoken 编码
预训练前必须先确定 tokenizer。模型看到的不是原始字符串,而是 token id 序列;词表大小、特殊 token、预分词规则都会影响后续模型配置和训练数据形态。
cookllm-bento 默认已经带了一个可用 tokenizer:
tokens/
├── tokenizer.pkl
├── token_bytes.pt
└── metadata.json如果你只是想直接跑预训练,可以先使用默认 tokenizer。重新训练 tokenizer 适合在你更换语料、调整词表大小,或者想完整复现训练流程时再做。
训练数据
Tokenizer 训练使用单独的采样数据,不直接使用预训练 shard。下载脚本中对应选项是:
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档