系统工程
推理优化
从 KV cache 到批处理调度,理解 LLM 推理为什么慢、怎么加速
概述
训练关心的是"一次把整段序列并行算完",推理却是"一个 token 接一个 token 地挤出来"。这个差别决定了推理有一套自己的瓶颈和优化手段。本系列从 KV cache 讲起,逐步深入批处理与显存管理,回答一个核心问题:为什么推理慢,以及怎么让它更快、更省显存。
建议先掌握 Transformer 前向传播 与 注意力机制。本系列默认你熟悉 Q/K/V 和自回归生成。
从 KV cache 到批处理调度,理解 LLM 推理为什么慢、怎么加速
训练关心的是"一次把整段序列并行算完",推理却是"一个 token 接一个 token 地挤出来"。这个差别决定了推理有一套自己的瓶颈和优化手段。本系列从 KV cache 讲起,逐步深入批处理与显存管理,回答一个核心问题:为什么推理慢,以及怎么让它更快、更省显存。
建议先掌握 Transformer 前向传播 与 注意力机制。本系列默认你熟悉 Q/K/V 和自回归生成。
generate 与缓存相关的 API 行为。