位置编码基础
会员专享为什么 Transformer 需要位置信息,以及绝对位置编码的方案与局限
在权益中心获取代码Transformer 的排列不变性
我们先来看一个有趣的事实:标准的 Self-Attention 完全不关心输入的顺序。
回顾 Attention 的计算过程:
其中 ,,。如果我们打乱输入 中 token 的顺序,每个 token 的 、、 向量本身不会改变,只是它们在序列中的位置变了。而 Attention 计算的是所有 token 之间的两两点积,这个操作对顺序是不敏感的。
换句话说,"我 喜欢 猫" 和 "猫 喜欢 我" 对 Attention 来说是一样的。这显然不行,语言的意义高度依赖词序。
这就是为什么我们需要位置编码:在输入中注入位置信息,让模型知道每个 token 在序列中的位置。
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档