基础知识模型架构
Attention 机制
会员专享从 MHA / Causal / GQA,到 Attention Sink 与 Gated Attention,理解注意力机制的设计、缺陷与演进
概述
Attention 是 Transformer 的核心。本系列从最基础的 Self-Attention 出发,先讲清 MHA、Causal Attention、GQA 这三个工程上必须掌握的形态;然后揭开一个所有现代 softmax-based LLM 都共有的反直觉现象 Attention Sink:第一个 token 为什么会吸走绝大部分注意力,这一现象的机制、代价与消除路径;最后进入 Gated Attention,Qwen 团队 2025 年提出、用一个 head-wise sigmoid 门同时治理 sink、低秩塌缩与训练稳定性的架构改动。
读完本系列,你应该能回答:
- MHA / Causal / GQA 各自解决了什么问题、留下了什么代价
- 为什么 softmax + causal 必然产生 attention sink,这一现象给系统带来什么代价
- 为什么 GQA 在 这条路径上"低秩塌缩",为什么这一点最终成了 Gated Attention 的发力点
- 在 SDPA 输出后加 head-specific sigmoid gate,究竟在改善什么
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档