OasisKV:把 KV Cache 搬出 HBM 解決 LLM 推理記憶體瓶頸
- URL: https://www.threads.com/share/BAVZRePD2m/
- Date Saved: 2026-08-13
- Source: Threads (@myps6415)
- Tags: ai-engineering, local-llm
- Paper: https://arxiv.org/abs/2505.xxxxx (OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching)
Summary
LLM 推理的真正瓶頸不在算力,而在記憶體——具體是 KV cache。上下文越長、推理鏈越深,KV cache 膨脹越快,HBM 容量很快見底。
OasisKV 的做法
在解碼階段把完整 KV cache 挪出 HBM,利用注意力稀疏性只保留最相關的 Token 在高速記憶體,再靠投機解碼(speculative decoding)預測下一輪哪些 Token 會變重要,提前從大容量記憶體預抓回來。
效益數據
- 推理吞吐量比原生 vLLM 高 1.69x
- 準確度只掉 0.1 個百分點
- 多 GPU 長上下文場景最高 2.1x 吞吐提升
- Prefill-decode 分離部署下:KV 量減少 6.5-9.7x,吞吐維持約 2x,主記憶體省 2.2-2.6x
- 2,048 Token KV budget 下,與完整注意力差距壓在 0.7% 以內
關鍵特點
- 底層建置在 vLLM,已有部署可直接實驗
- 適用場景:長上下文、多輪推理、記憶體緊縮的環境
為什麼重要(「鈔票」)
這是直接省推理成本的技術——同樣的 GPU 記憶體能服務更多請求、更長上下文,對任何跑 LLM 推理的人來說都是實打實的錢。