PagedAttention
会员专享按最大长度预留连续显存只用上了两三成,用操作系统的分页思路把利用率做到 96%
在权益中心获取代码前两章我们做了两件事:用 KV cache 省掉重复计算,用 continuous batching 让 GPU 不再空转。但每一章的结尾都指向同一个没解决的问题:这些缓存到底该怎么在显存里摆放。
这一章要回答的就是它。我们会先算清楚显存到底被谁吃掉了,看到一个相当难堪的事实:现有系统里真正用于存 token 的显存只有两三成。然后引入一个四十多年前操作系统就用过的办法,把利用率拉到 96%,顺便白送一个意想不到的能力。
显存到底被谁吃掉了
先做一道算术题,感受一下 KV cache 有多占地方。
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档