从 token ids 到 logits
会员专享理解 Decoder-only Transformer 如何把 token ids 变成 next-token logits
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
理解 Decoder-only Transformer 如何把 token ids 变成 next-token logits
这是一篇付费内容,请登录您的账户以访问完整内容。
在 词元化 部分,我们已经把文本转成了 token ids。到这里,模型看到的不是字符串,而是一串整数。
接下来的问题是:这些整数进入 Transformer 之后,为什么最后会变成每个位置对整个词表的打分?
先把完整模型记作 ,其中 表示模型的所有可训练参数。对一个 batch 来说,输入是:
输出是:
这里 是 batch size, 是序列长度, 是 vocabulary size。也就是说,模型不是直接输出下一个 token id,而是给每个位置都输出一组长度为 的 logits。
logits 是什么、有多大?
logits 是 softmax 之前的原始分数,可正可负、量级不固定;它本身不是概率,只有经过 softmax 之后才是概率分布。
典型规模感:Qwen3.5-0.8B 的 、;Qwen3.5-9B 的 、。 通常比 大一到两个数量级,LM Head 的 矩阵因此能占模型相当一部分:
模型越小、词表越大,这块比例越夸张(下一章 Embedding 与 LM Head 会展开 weight tying 的取舍)。