模型架构
会员专享从 bento_29m.yaml 读懂 BentoLM 的结构和参数规模
BentoLM-29M 不是为了追求大,而是为了让单卡也能完成完整训练链路。小模型的好处是反馈快:配置写错、数据路径不对、loss 异常、checkpoint 保存失败,都能在较短时间内暴露。
29M 这个数字也不是随手定的。参数量主要由三项决定:embedding(vocab_size × hidden_size)、每层的 attention 与 FFN 权重、以及输出头。当 vocab_size 只有 8192、hidden_size 取 512 时,embedding 只占约 4M,剩下的预算才能分给 8 层 Transformer。这个比例很关键,因为如果 embedding 占比过高,模型就把容量花在了记词表而不是学结构上,这是小模型最常见的浪费。
下面的配置文件里,每个字段都对应一处这样的权衡。
关键配置
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档