Attention Sink
会员专享第一个 token 为什么吸走绝大部分注意力,这一现象的机制、代价,以及为何消除它要留到 Gated Attention
在权益中心获取代码GQA 之后还剩下的问题
上一章我们看到 GQA 把 KV cache 压到 MHA 的 1/4,代价是部分任务上略有质量下降。但 GQA 改的是 KV head 的数量,没有动 attention 本身的数学结构:还是 softmax,还是 causal mask,还是 。
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档