预训练
会员专享从样本数据开始,完成 29M BentoLM 的完整预训练闭环
概述
预训练是 cookllm-bento 的第一条主线。这里从一个 29M 参数的小模型开始,完整走过语言模型预训练需要的关键环节:准备文本数据,训练 tokenizer,定义 BentoLM,构建数据流水线,进入 Lightning 训练循环,写出 checkpoint、TensorBoard/SwanLab 日志和采样文本。
这一章会从训练前的数据和 tokenizer 开始,逐步进入模型架构、数据流水线、训练循环和监控验证。完成后,你应该知道一条预训练任务由哪些文件组成,每个配置文件管什么,以及当训练速度、loss、采样输出或 checkpoint 出问题时应该从哪里开始查。
这一章关注 cookllm-bento 中“如何跑”。如果你想深入理解 Attention、RoPE、RMSNorm、激活函数或优化器原理,可以配合阅读"原理精讲"中的对应章节。
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档