Embedding 与 LM Head
会员专享理解 token ids 如何进入连续向量空间,以及 hidden states 如何投影回词表 logits
在权益中心获取代码为什么输入输出层值得单独看?
Decoder-only Transformer 最重的计算发生在中间的 blocks 里,但语言模型的输入输出关系其实由两端决定:
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
理解 token ids 如何进入连续向量空间,以及 hidden states 如何投影回词表 logits
在权益中心获取代码Decoder-only Transformer 最重的计算发生在中间的 blocks 里,但语言模型的输入输出关系其实由两端决定:
这是一篇付费内容,请登录您的账户以访问完整内容。
如果这两端没有看清楚,后面很多问题都会混在一起:为什么输入是整数、为什么输出不是 token id、为什么 loss 需要 shift targets、为什么词表大小会显著影响参数量,甚至为什么有些模型会共享输入 embedding 和输出 LM Head 的权重。
本章主线只讲输入输出两端:Embedding 和 LM Head。